Dyna Robotics präsentiert DYNA-2: World-Action Model für Robotik auf Basis von menschlichen Videodaten

LinkDyna RoboticsAnkündigung

Dyna Robotics hat DYNA-2 vorgestellt, ein World-Action-Modell (WAM), das auf über einer Million Stunden egozentrischer menschlicher Videos vortrainiert wurde. Das Modell umgeht den Engpass manueller Teleoperationsdaten und überträgt räumliches Verständnis sowie physische Handlungen direkt auf unterschiedliche Robotersysteme.

Das Wichtigste

  1. Erstes Basismodell der Robotik, das auf über 1 Million Stunden menschlicher Ego-Perspektiven-Videos trainiert wurde (entspricht etwa 170 Jahren wacher Lebenserfahrung).
  2. Wechsel von bisherigen Vision-Language-Action-Modellen (VLA) zu einer nativen World-Action-Model-Architektur auf Basis von Videogenerierung (Next-Frame- und Next-Action-Modellierung).
  3. Demonstriert laut Dyna Robotics ein verlässliches Skalierungsgesetz: Fähigkeiten verbessern sich linear mit zunehmender Menge an reinem menschlichem Videomaterial.
  4. Hardware-übergreifender Transfer (Cross-Embodiment) auf stationäre Arme, humanoide Roboter und geschickte Greifhände.
  5. In Tests stieg die Erfolgsquote bei Fertigungsaufgaben von 20 % auf 80–90 % allein durch die Vorabskalierung, ohne zusätzliche Nachjustierung der Trainingsdaten.
  6. Erfordert nur geringes Feintuning: Eine Roboterhand mit fünf Fingern lernte das Öffnen eines Schraubverschlusses mit 13 Minuten Feintuning-Daten.

Warum das relevant ist

Bisherige Roboter-KI scheiterte oft daran, dass Bewegungsdaten mühsam per Teleoperation an physischen Maschinen gesammelt werden mussten. Wenn sich räumliche Intuition und Interaktionsphysik tatsächlich über gewöhnliche Videoaufnahmen von Menschen skalieren lassen, sinken Trainingsaufwand und Kosten für industrielle und gewerbliche Robotikeinsätze dramatisch.

Einordnung

Dyna Robotics beansprucht den Nachweis, dass Robotik foundation models nicht an knappen Teleoperationsdaten verharren müssen, sondern von großen Videodatensätzen profitieren können. Der Sprung in der Zero-Shot-Qualitätsrate von 46 % (DYNA-1) auf 87 % (DYNA-2) bei Kundeneinsätzen zeigt das Potenzial der WAM-Architektur. Zudem erholt sich das Modell eigenständig nach Störungen, was für den Produktiveinsatz in unstrukturierten Umgebungen entscheidend ist.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti et al.

    OpenVLA: Open-Source Vision-Language-Action-Modell für Robotik

    OpenVLA ist ein quelloffenes Vision-Language-Action-Modell (VLA) mit 7 Milliarden Parametern zur Steuerung von Robotern. Es basiert auf Prismatic-7B, nutzt Llama 2 und wurde auf 970.000 Roboter-Episoden trainiert. Das Modell übertrifft bisherige Generalisten wie Octo und RT-1-X sowie teilweise das proprietäre 55B-Modell RT-2-X.

    KI & AI· Forschung

  • Artikel:Moo Jin Kim et al.

    OpenVLA: Open-Source Vision-Language-Action-Modell für Robotersteuerung

    Forschende von Stanford, UC Berkeley, Google DeepMind und weiteren Institutionen stellen OpenVLA vor, ein quelloffenes Vision-Language-Action-Modell mit 7 Milliarden Parametern. Das auf 970.000 realen Roboterdemonstrationen trainierte Modell übertrifft geschlossene Vorgänger wie RT-2-X deutlich und lässt sich per LoRA auf handelsüblichen GPUs feinjustieren.

    KI & AI· Forschung

  • Artikel:Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

    BridgeVLA++: 3D-Roboter-Manipulations-Framework mit spatio-temporalem Gedächtnis

    Forschende stellen BridgeVLA++ vor, ein Vision-Language-Action-Framework für 3D-Roboter-Manipulationen. Aufbauend auf BridgeVLA erweitert das Modell vortrainierte Vision-Language-Modelle (VLMs) um eine Architektur für räumlich-zeitliches Gedächtnis, um vergangene Beobachtungen und Interaktionshistorien effizient einzubeziehen.

    KI & AI· Forschung

  • Link:Zhe Liu, Jinghua Hou, Yuxiang Lu, et al.

    StreamPI: Temporale Modellierung für Vision-Language-Action-Modelle im Streaming-Betrieb

    Forschende der University of Hong Kong und von ACE Robotics stellen StreamPI vor. Das Framework erweitert Vision-Language-Action-Modelle (VLAs) wie π0.5 um zeitliche Kontextverarbeitung, ohne neue Modellparameter hinzuzufügen. Durch die paarweise Bindung von Bild- und Textbefehlen sowie ein Trainingsverfahren mit zufälligen Zeitintervallen verbessert StreamPI die Präzision und Robustheit bei der realen Robotersteuerung.

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.