Link:Zhe Liu, Jinghua Hou, Yuxiang Lu, et al.
StreamPI: Temporale Modellierung für Vision-Language-Action-Modelle im Streaming-Betrieb
Forschende der University of Hong Kong und von ACE Robotics stellen StreamPI vor. Das Framework erweitert Vision-Language-Action-Modelle (VLAs) wie π0.5 um zeitliche Kontextverarbeitung, ohne neue Modellparameter hinzuzufügen. Durch die paarweise Bindung von Bild- und Textbefehlen sowie ein Trainingsverfahren mit zufälligen Zeitintervallen verbessert StreamPI die Präzision und Robustheit bei der realen Robotersteuerung.
Aus Video: AI Weekly Updates: Open-Source Model Surge, Agent Harnesses, and Meta's AI Reality Check