OpenVLA: Open-Source Vision-Language-Action-Modell für Robotik

LinkMoo Jin Kim, Karl Pertsch, Siddharth Karamcheti et al.Forschung

OpenVLA ist ein quelloffenes Vision-Language-Action-Modell (VLA) mit 7 Milliarden Parametern zur Steuerung von Robotern. Es basiert auf Prismatic-7B, nutzt Llama 2 und wurde auf 970.000 Roboter-Episoden trainiert. Das Modell übertrifft bisherige Generalisten wie Octo und RT-1-X sowie teilweise das proprietäre 55B-Modell RT-2-X.

Das Wichtigste

  1. Architektur: Basiert auf Prismatic-7B mit fusioniertem Vision-Encoder (SigLIP und DinoV2), Projektor und einem Llama 2 7B-Sprachmodell, das diskretisierte Aktions-Token ausgibt.
  2. Trainingsdaten: Auf 970.000 Trajektorien aus dem Datensatz Open X-Embodiment über 15 Tage auf 64 A100-GPUs trainiert.
  3. Generalisierung: Steuert verschiedene Roboterplattformen (darunter WidowX und Google Robot) direkt ohne zusätzliches Training bei visuellen, physischen und sprachlichen Variationen.
  4. Effizientes Fine-Tuning: Anpassung an neue Setups wie Franka Emika Panda über LoRA mit nur 1,4 % der Parameter bei voller Leistungsfähigkeit.
  5. Grenzen bei Internet-Wissen: Bei Aufgaben mit reinem Web-Wissen (wie dem Erkennen von Prominenten) bleibt das 55B-Modell RT-2-X im Vorteil, da OpenVLA ausschließlich auf Roboterdaten feingetunt wurde.

Warum das relevant ist

Große Robotik-Modelle waren bisher überwiegend proprietär oder in ihrer Anpassbarkeit stark limitiert. OpenVLA stellt Gewichte und Code vollständig via HuggingFace bereit. Dadurch wird offene Forschung und die praktische Anpassung auf eigene Roboter-Hardware mit geringem Rechenaufwand möglich.

Einordnung

Das Forschungsteam demonstriert, dass Spezialisierung auf multimodale Aufgaben auch mit kleineren Parametermengen (7B) konkurrenzfähig zu massiven Modellen wie RT-2-X (55B) sein kann. Während klassische Diffusions-Ansätze bei engen Einzelaufgaben noch präziser agieren, zeigt OpenVLA seine Stärken in Umgebungen mit mehreren Objekten und variierenden Sprachanweisungen. Der Einsatz von LoRA macht das Fine-Tuning zudem für praktische Anwendungen zugänglich.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Moo Jin Kim et al.

    OpenVLA: Open-Source Vision-Language-Action-Modell für Robotersteuerung

    Forschende von Stanford, UC Berkeley, Google DeepMind und weiteren Institutionen stellen OpenVLA vor, ein quelloffenes Vision-Language-Action-Modell mit 7 Milliarden Parametern. Das auf 970.000 realen Roboterdemonstrationen trainierte Modell übertrifft geschlossene Vorgänger wie RT-2-X deutlich und lässt sich per LoRA auf handelsüblichen GPUs feinjustieren.

    KI & AI· Forschung

  • Link:Zhe Liu, Jinghua Hou, Yuxiang Lu, et al.

    StreamPI: Temporale Modellierung für Vision-Language-Action-Modelle im Streaming-Betrieb

    Forschende der University of Hong Kong und von ACE Robotics stellen StreamPI vor. Das Framework erweitert Vision-Language-Action-Modelle (VLAs) wie π0.5 um zeitliche Kontextverarbeitung, ohne neue Modellparameter hinzuzufügen. Durch die paarweise Bindung von Bild- und Textbefehlen sowie ein Trainingsverfahren mit zufälligen Zeitintervallen verbessert StreamPI die Präzision und Robustheit bei der realen Robotersteuerung.

    KI & AI· Forschung

  • Artikel:Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

    BridgeVLA++: 3D-Roboter-Manipulations-Framework mit spatio-temporalem Gedächtnis

    Forschende stellen BridgeVLA++ vor, ein Vision-Language-Action-Framework für 3D-Roboter-Manipulationen. Aufbauend auf BridgeVLA erweitert das Modell vortrainierte Vision-Language-Modelle (VLMs) um eine Architektur für räumlich-zeitliches Gedächtnis, um vergangene Beobachtungen und Interaktionshistorien effizient einzubeziehen.

    KI & AI· Forschung

  • Link:Qwen

    Qwen3.8-27B: Multimodales 27B-Modell mit Hybrid-Architektur und Denkmodus

    Das Qwen-Team hat mit Qwen3.8-27B ein kompaktes, dichtes Vision-Language-Modell unter der Apache-2.0-Lizenz veröffentlicht. Das 27-Milliarden-Parameter-Modell kombiniert Gated DeltaNet mit regulärer Attention, versteht Bilder sowie Videos und bietet flexible Steuerungsmöglichkeiten für Denkprozesse.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.