Definition
Vision-Language-Action-Modelle (VLA) erzeugen Roboteraktionen aus visuellen Beobachtungen und sprachlichen Anweisungen.
RoboAtlas
Vergleichen Sie Vision-Language-Action-Modelle: veröffentlichte Versionen, Checkpoints, Roboterkompatibilität, Lizenzen und Benchmark-Nachweise.
Vision-Language-Action-Modelle (VLA) erzeugen Roboteraktionen aus visuellen Beobachtungen und sprachlichen Anweisungen.
Enthält öffentliche Modellfamilien mit mindestens einer veröffentlichten, als VLA klassifizierten Version. Andere Embodied-AI-Kategorien werden separat geführt.
Vergleichen Sie Versionen, Aktionsräume, Checkpoints, Lizenzen, Roboterkompatibilität und Evaluierungsnachweise in den Modellprofilen.
Die VLA-Klassifizierung belegt keine universellen Fähigkeiten. Trainingsdaten, Hardwareanforderungen und Testbedingungen können unveröffentlicht sein.
13 veröffentlichte VLA-Modellfamilien
Katalog zuletzt aktualisiert: 28. Sept. 2026
Wählen Sie veröffentlichte Versionen im VLA-Katalog und vergleichen Sie dokumentierte Fähigkeiten und Quellen.
VLA-Modelle ansehen