StreamPI: Temporale Modellierung für Vision-Language-Action-Modelle im Streaming-Betrieb

LinkZhe Liu, Jinghua Hou, Yuxiang Lu, et al.Forschung

Forschende der University of Hong Kong und von ACE Robotics stellen StreamPI vor. Das Framework erweitert Vision-Language-Action-Modelle (VLAs) wie π0.5 um zeitliche Kontextverarbeitung, ohne neue Modellparameter hinzuzufügen. Durch die paarweise Bindung von Bild- und Textbefehlen sowie ein Trainingsverfahren mit zufälligen Zeitintervallen verbessert StreamPI die Präzision und Robustheit bei der realen Robotersteuerung.

Das Wichtigste

  1. Bestehende VLAs wie π0 und π0.5 arbeiten primär mit Einzelbildern und besitzen kein historisches Gedächtnis.
  2. StreamPI fasst jede visuelle Beobachtung zusammen mit der Sprachanweisung als atomare temporale Einheit zusammen.
  3. Innerhalb einer Einheit sorgt bidirektionale Attention für multimodale Fusion, während kausale Attention zwischen den Schritten das sequentielle Streaming ermöglicht.
  4. Ein Training mit variablen Abständen (Random-Interval Streaming) bereitet Modelle auf asynchrone Bildraten bei echten Robotern vor.
  5. Bei Streaming-Inferenz auf einer Nvidia RTX 4090 verursacht ein Kontext von fünf Frames lediglich 9,2 ms zusätzliche Latenz gegenüber einem Einzelbild.
  6. In Tests übertrifft StreamPI die Baseline π0.5 sowohl bei Präzisions- und Gedächtnisaufgaben am Roboter als auch in den Benchmarks LIBERO und CALVIN.

Warum das relevant ist

Viele aktuelle Robotik-Modelle scheitern an Aufgaben, die räumliche Feinmotorik über Zeit oder das Merken verdeckter Objekte erfordern. Da StreamPI ohne zusätzliche Parameter auskommt und vortrainierte Gewichte weiternutzt, lässt sich die Methode direkt auf bestehende Single-Frame-Architekturen anwenden. Die geringe Latenz im Inferenzbetrieb macht sie zudem praxistauglich für reale Steuerungsszenarien.

Einordnung

StreamPI adressiert ein Kernproblem aktueller VLAs: das Verwerfen von Vergangenheitsdaten. Die Kombination aus bidirektionaler Aufmerksamkeitsverteilung innerhalb jedes Beobachtungspaars und kausaler Verknüpfung über die Zeitschritte hinweg verhindert, dass Instruktionen im Zeitverlauf verwässern. Gleichzeitig löst das variable Abtasten während des Trainings die Diskrepanz zwischen synchronem Labor-Setup und asynchronen Kamerasensoren im Live-Einsatz. Einschränkungen bleiben jedoch: Das synchrone Laden langer Frame-Sequenzen während des Trainings bleibt rechenintensiv, und extreme Asynchronitäten erfordern künftig adaptive Mechanismen wie dynamisches Pruning des KV-Caches.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti et al.

    OpenVLA: Open-Source Vision-Language-Action-Modell für Robotik

    OpenVLA ist ein quelloffenes Vision-Language-Action-Modell (VLA) mit 7 Milliarden Parametern zur Steuerung von Robotern. Es basiert auf Prismatic-7B, nutzt Llama 2 und wurde auf 970.000 Roboter-Episoden trainiert. Das Modell übertrifft bisherige Generalisten wie Octo und RT-1-X sowie teilweise das proprietäre 55B-Modell RT-2-X.

    KI & AI· Forschung

  • Artikel:Moo Jin Kim et al.

    OpenVLA: Open-Source Vision-Language-Action-Modell für Robotersteuerung

    Forschende von Stanford, UC Berkeley, Google DeepMind und weiteren Institutionen stellen OpenVLA vor, ein quelloffenes Vision-Language-Action-Modell mit 7 Milliarden Parametern. Das auf 970.000 realen Roboterdemonstrationen trainierte Modell übertrifft geschlossene Vorgänger wie RT-2-X deutlich und lässt sich per LoRA auf handelsüblichen GPUs feinjustieren.

    KI & AI· Forschung

  • Artikel:Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

    BridgeVLA++: 3D-Roboter-Manipulations-Framework mit spatio-temporalem Gedächtnis

    Forschende stellen BridgeVLA++ vor, ein Vision-Language-Action-Framework für 3D-Roboter-Manipulationen. Aufbauend auf BridgeVLA erweitert das Modell vortrainierte Vision-Language-Modelle (VLMs) um eine Architektur für räumlich-zeitliches Gedächtnis, um vergangene Beobachtungen und Interaktionshistorien effizient einzubeziehen.

    KI & AI· Forschung

  • Link:Qwen

    Qwen3.8-27B: Multimodales 27B-Modell mit Hybrid-Architektur und Denkmodus

    Das Qwen-Team hat mit Qwen3.8-27B ein kompaktes, dichtes Vision-Language-Modell unter der Apache-2.0-Lizenz veröffentlicht. Das 27-Milliarden-Parameter-Modell kombiniert Gated DeltaNet mit regulärer Attention, versteht Bilder sowie Videos und bietet flexible Steuerungsmöglichkeiten für Denkprozesse.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.