BridgeVLA++: 3D-Roboter-Manipulations-Framework mit spatio-temporalem Gedächtnis

ArtikelPeiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu TanForschung

Forschende stellen BridgeVLA++ vor, ein Vision-Language-Action-Framework für 3D-Roboter-Manipulationen. Aufbauend auf BridgeVLA erweitert das Modell vortrainierte Vision-Language-Modelle (VLMs) um eine Architektur für räumlich-zeitliches Gedächtnis, um vergangene Beobachtungen und Interaktionshistorien effizient einzubeziehen.

Das Wichtigste

  1. Bisherige 3D-VLA-Ansätze benötigen viele Trainingsdaten, generalisieren schwach bei Verteilungsverschiebungen und besitzen kein explizites Gedächtnis für frühere Beobachtungen.
  2. Das Vorgängermodell BridgeVLA projizierte Punktwolken in Multiview-Bilder und nutzte Heatmaps, um das VLM-Alignment beizubehalten.
  3. BridgeVLA++ ergänzt ein einheitliches spatio-temporales Gedächtnis für beständigen Raumkontext und Interaktionshistorie.
  4. In Tests erzielt das System State-of-the-Art-Ergebnisse auf zwei gedächtnisabhängigen Benchmarks und funktioniert bei beidhändiger Manipulation sowie auf realen Robotern.

Warum das relevant ist

Für praktische Robotikanwendungen in komplexen Umgebungen ist es essenziell, dass Roboter Handlungen aus vergangenen Schritten ableiten können, ohne dafür riesige Mengen an Trainingsdaten für jede neue Aufgabe zu benötigen.

Einordnung

Das Papier adressiert eine zentrale Schwachstelle aktueller VLA-Architekturen: das Fehlen eines temporalen und persistenten Raumgedächtnisses. Durch die Beibehaltung der Daten-Effizienz von BridgeVLA und die gezielte Gedächtniserweiterung zeigt das Team, dass sich vortrainierte 2D-VLMs auch für komplexe, mehrstufige 3D-Aufgaben und bimanuelle Steuerungen adaptieren lassen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti et al.

    OpenVLA: Open-Source Vision-Language-Action-Modell für Robotik

    OpenVLA ist ein quelloffenes Vision-Language-Action-Modell (VLA) mit 7 Milliarden Parametern zur Steuerung von Robotern. Es basiert auf Prismatic-7B, nutzt Llama 2 und wurde auf 970.000 Roboter-Episoden trainiert. Das Modell übertrifft bisherige Generalisten wie Octo und RT-1-X sowie teilweise das proprietäre 55B-Modell RT-2-X.

    KI & AI· Forschung

  • Artikel:Moo Jin Kim et al.

    OpenVLA: Open-Source Vision-Language-Action-Modell für Robotersteuerung

    Forschende von Stanford, UC Berkeley, Google DeepMind und weiteren Institutionen stellen OpenVLA vor, ein quelloffenes Vision-Language-Action-Modell mit 7 Milliarden Parametern. Das auf 970.000 realen Roboterdemonstrationen trainierte Modell übertrifft geschlossene Vorgänger wie RT-2-X deutlich und lässt sich per LoRA auf handelsüblichen GPUs feinjustieren.

    KI & AI· Forschung

  • Link:Zhe Liu, Jinghua Hou, Yuxiang Lu, et al.

    StreamPI: Temporale Modellierung für Vision-Language-Action-Modelle im Streaming-Betrieb

    Forschende der University of Hong Kong und von ACE Robotics stellen StreamPI vor. Das Framework erweitert Vision-Language-Action-Modelle (VLAs) wie π0.5 um zeitliche Kontextverarbeitung, ohne neue Modellparameter hinzuzufügen. Durch die paarweise Bindung von Bild- und Textbefehlen sowie ein Trainingsverfahren mit zufälligen Zeitintervallen verbessert StreamPI die Präzision und Robustheit bei der realen Robotersteuerung.

    KI & AI· Forschung

  • Link:arcprize.org

    ARC-AGI-3: Interaktiver Reasoning-Benchmark für KI-Agenten

    ARC-AGI-3 ist ein neuer interaktiver Benchmark zur Messung menschenähnlicher Intelligenz in KI-Agenten. Statt statischer Aufgaben müssen Agenten unbekannte Umgebungen interaktiv erkunden, Ziele eigenständig ableiten und Strategien über längere Zeithorizonte anpassen.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.