Link:Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti et al.
OpenVLA: Open-Source Vision-Language-Action-Modell für Robotik
OpenVLA ist ein quelloffenes Vision-Language-Action-Modell (VLA) mit 7 Milliarden Parametern zur Steuerung von Robotern. Es basiert auf Prismatic-7B, nutzt Llama 2 und wurde auf 970.000 Roboter-Episoden trainiert. Das Modell übertrifft bisherige Generalisten wie Octo und RT-1-X sowie teilweise das proprietäre 55B-Modell RT-2-X.
Aus Video: Weekly AI Roundup: DeepSeek Harness, Model Routing, and Scaffolding Shifts