OpenVLA: Open-Source Vision-Language-Action-Modell für Robotersteuerung

ArtikelMoo Jin Kim et al.Forschung

Forschende von Stanford, UC Berkeley, Google DeepMind und weiteren Institutionen stellen OpenVLA vor, ein quelloffenes Vision-Language-Action-Modell mit 7 Milliarden Parametern. Das auf 970.000 realen Roboterdemonstrationen trainierte Modell übertrifft geschlossene Vorgänger wie RT-2-X deutlich und lässt sich per LoRA auf handelsüblichen GPUs feinjustieren.

Das Wichtigste

  1. OpenVLA kombiniert ein Llama-2-Sprachmodell mit visuellen Encodern von DINOv2 (räumliche Merkmale) und SigLIP (semantische Merkmale).
  2. Das Modell wurde auf 970.000 Episoden des Open X-Embodiment-Datensatzes trainiert und steuert mehrere Robotertypen direkt nach der Installation.
  3. In 29 Evaluierungsaufgaben übertrifft OpenVLA das geschlossene RT-2-X (55 Milliarden Parameter) um 16,5 Prozentpunkte bei der absoluten Erfolgsrate – trotz siebenfach kleinerer Modellgröße.
  4. Gegenüber Imitation-Learning-Methoden wie Diffusion Policy erzielt OpenVLA bei Multi-Task-Szenarien mit mehreren Objekten und Sprachbezug eine um 20,4 Prozentpunkte höhere Erfolgsrate.
  5. Dank Low-Rank Adaptation (LoRA) und Quantisierung lässt sich das 7B-Modell ressourcenschonend auf Consumer-GPUs feinabstimmen und betreiben.
  6. Checkpoints, Fine-Tuning-Notebooks und der PyTorch-Trainingscode wurden als Open Source via Hugging Face veröffentlicht.

Warum das relevant ist

Bisherige Spitzenmodelle für Robotik-Handlungssteuerung waren proprietär oder schwer an neue Aufgaben anpassbar. OpenVLA senkt die Einstiegshürden erheblich, indem es ein leistungsfähiges VLA-Fundament bereitstellt, das sich auf Standard-Hardware für konkrete Einsatzbereiche adaptieren lässt.

Einordnung

Das Papier demonstriert, dass der Rückgriff auf offene Vision-Language-Grundlagen wie Llama 2, DINOv2 und SigLIP ausreicht, um spezialisierte, deutlich größere proprietäre Modelle zu übertreffen. Durch die direkte Abbildung von Roboteraktionen als Token im VLM-Vokabular profitiert das System von bestehender LLM-Trainingsinfrastruktur. Die Kombination aus offener Verfügbarkeit und effizienter Parameteranpassung schließt eine zentrale Lücke zwischen theoretischer VLA-Forschung und praktischer Implementierung in der Robotik.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti et al.

    OpenVLA: Open-Source Vision-Language-Action-Modell für Robotik

    OpenVLA ist ein quelloffenes Vision-Language-Action-Modell (VLA) mit 7 Milliarden Parametern zur Steuerung von Robotern. Es basiert auf Prismatic-7B, nutzt Llama 2 und wurde auf 970.000 Roboter-Episoden trainiert. Das Modell übertrifft bisherige Generalisten wie Octo und RT-1-X sowie teilweise das proprietäre 55B-Modell RT-2-X.

    KI & AI· Forschung

  • Link:Zhe Liu, Jinghua Hou, Yuxiang Lu, et al.

    StreamPI: Temporale Modellierung für Vision-Language-Action-Modelle im Streaming-Betrieb

    Forschende der University of Hong Kong und von ACE Robotics stellen StreamPI vor. Das Framework erweitert Vision-Language-Action-Modelle (VLAs) wie π0.5 um zeitliche Kontextverarbeitung, ohne neue Modellparameter hinzuzufügen. Durch die paarweise Bindung von Bild- und Textbefehlen sowie ein Trainingsverfahren mit zufälligen Zeitintervallen verbessert StreamPI die Präzision und Robustheit bei der realen Robotersteuerung.

    KI & AI· Forschung

  • Artikel:Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

    BridgeVLA++: 3D-Roboter-Manipulations-Framework mit spatio-temporalem Gedächtnis

    Forschende stellen BridgeVLA++ vor, ein Vision-Language-Action-Framework für 3D-Roboter-Manipulationen. Aufbauend auf BridgeVLA erweitert das Modell vortrainierte Vision-Language-Modelle (VLMs) um eine Architektur für räumlich-zeitliches Gedächtnis, um vergangene Beobachtungen und Interaktionshistorien effizient einzubeziehen.

    KI & AI· Forschung

  • Link:Qwen

    Qwen3.8-27B: Multimodales 27B-Modell mit Hybrid-Architektur und Denkmodus

    Das Qwen-Team hat mit Qwen3.8-27B ein kompaktes, dichtes Vision-Language-Modell unter der Apache-2.0-Lizenz veröffentlicht. Das 27-Milliarden-Parameter-Modell kombiniert Gated DeltaNet mit regulärer Attention, versteht Bilder sowie Videos und bietet flexible Steuerungsmöglichkeiten für Denkprozesse.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.