NVIDIA Cosmos 3: World Action Models statt klassischer VLA-Modelle für Roboter-Manipulation

ArtikelSaeed BabamohamadiNews

NVIDIA präsentiert mit Cosmos 3 eine offene Modellfamilie, die als World Action Model (WAM) physikalische Dynamiken erlernt und Steuerungsaktionen gemeinsam mit zukünftigen Kamerabildern generiert.

Das Wichtigste

  1. WAMs ersetzen reine Vision-Language-Backbones durch Video-Weltmodelle, um Handlungen mit einem physikalischen Vorwissen über Szenenveränderungen auszustatten.
  2. Cosmos 3 nutzt eine Mixture-of-Transformers-Architektur (MoT), die autoregressive Transformer für Text mit Diffusion Transformern für Video, Bild und Aktionen verbindet.
  3. Das Foundation-Modell existiert in drei Größen: Cosmos Edge (4B), Cosmos Nano (16B) und Cosmos 3 Super (64B), trainiert auf 767 Millionen Bildern, 348 Millionen Videos und 8 Millionen Aktionsbeispielen.
  4. Im Test auf der DROID-Plattform steigerte das vortrainierte Omni-Checkpoint die Erfolgsrate im RoboLab-Benchmark von 28,1 % auf 36,8 % gegenüber dem Basis-Checkpoint.
  5. Die Bereitstellung gelingt entweder per Workstation (16B Nano auf NVIDIA RTX PRO 6000) oder direkt auf Edge-Hardware (4B Edge auf NVIDIA Jetson Thor bei 15 Hz Kontrollfrequenz).

Warum das relevant ist

Klassische Vision-Language-Action-Modelle (VLAs) verstehen zwar Sprachbefehle und Bildinhalte, erfassen aber physikalische Konsequenzen von Bewegungen oft unzureichend. WAMs verallgemeinern physikalische Dynamiken besser auf unbekannte Objekte und senken den Trainingsaufwand für neue Greifer und Roboterarme deutlich.

Einordnung

Der Schritt von rein semantischer Imitation hin zur gemeinsamen Generierung von Handlung und erwartetem Szenenverlauf löst eine zentrale Schwachstelle bisheriger Robotik-Pipelines. Da NVIDIA Gewichte, Rezepte und Datensätze unter einer kommerziell nutzbaren Lizenz bereitstellt und auf Standardformate wie LeRobotDataset setzt, bietet Cosmos 3 einen praxistauglichen Baustein für autonome Systeme.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Moo Jin Kim et al.

    OpenVLA: Open-Source Vision-Language-Action-Modell für Robotersteuerung

    Forschende von Stanford, UC Berkeley, Google DeepMind und weiteren Institutionen stellen OpenVLA vor, ein quelloffenes Vision-Language-Action-Modell mit 7 Milliarden Parametern. Das auf 970.000 realen Roboterdemonstrationen trainierte Modell übertrifft geschlossene Vorgänger wie RT-2-X deutlich und lässt sich per LoRA auf handelsüblichen GPUs feinjustieren.

    KI & AI· Forschung

  • Link:Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti et al.

    OpenVLA: Open-Source Vision-Language-Action-Modell für Robotik

    OpenVLA ist ein quelloffenes Vision-Language-Action-Modell (VLA) mit 7 Milliarden Parametern zur Steuerung von Robotern. Es basiert auf Prismatic-7B, nutzt Llama 2 und wurde auf 970.000 Roboter-Episoden trainiert. Das Modell übertrifft bisherige Generalisten wie Octo und RT-1-X sowie teilweise das proprietäre 55B-Modell RT-2-X.

    KI & AI· Forschung

  • Artikel:Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

    BridgeVLA++: 3D-Roboter-Manipulations-Framework mit spatio-temporalem Gedächtnis

    Forschende stellen BridgeVLA++ vor, ein Vision-Language-Action-Framework für 3D-Roboter-Manipulationen. Aufbauend auf BridgeVLA erweitert das Modell vortrainierte Vision-Language-Modelle (VLMs) um eine Architektur für räumlich-zeitliches Gedächtnis, um vergangene Beobachtungen und Interaktionshistorien effizient einzubeziehen.

    KI & AI· Forschung

  • Link:Zhe Liu, Jinghua Hou, Yuxiang Lu, et al.

    StreamPI: Temporale Modellierung für Vision-Language-Action-Modelle im Streaming-Betrieb

    Forschende der University of Hong Kong und von ACE Robotics stellen StreamPI vor. Das Framework erweitert Vision-Language-Action-Modelle (VLAs) wie π0.5 um zeitliche Kontextverarbeitung, ohne neue Modellparameter hinzuzufügen. Durch die paarweise Bindung von Bild- und Textbefehlen sowie ein Trainingsverfahren mit zufälligen Zeitintervallen verbessert StreamPI die Präzision und Robustheit bei der realen Robotersteuerung.

    KI & AI· Forschung

  • Repository:LMD0311/Awesome-World-Model

    Awesome World Models: Kuratierte Forschungsübersicht für autonomes Fahren und Robotik

    Das GitHub-Repository LMD0311/Awesome-World-Model sammelt, dokumentiert und bewertet wissenschaftliche Arbeiten rund um World Models mit Schwerpunkt auf autonomem Fahren und Robotik. Es dient als fortlaufende Ergänzung zur Übersichtsarbeit 'The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey'.

    2234Sterne

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.