Dhruv Batra: Profil, Forschung und Computer-Use-Modelle bei Yutori

LinkDhruv BatraSammlung

Die persönliche Website des KI-Forschers Dhruv Batra fasst seine aktuellen Arbeiten bei Yutori zu Browser- und Computer-Use-Modellen sowie frühere Meilensteine bei Meta FAIR und Georgia Tech zusammen.

Das Wichtigste

  1. Mitgründer und Chief Scientist bei Yutori, Entwickler der Modellfamilie Navigator (Navigator n1 und Navigator n1.5) für Computer-Use.
  2. Navigator n1 (November 2025) und n1.5 (Mai 2026) übertreffen laut Angaben Modelle wie GPT 5.5, Opus 4.7, Gemini 3 Flash und Claude Sonnet 4.5 auf Browser-Benchmarks und erreichen 97,3 % auf Online Mind2Web.
  3. Früherer Senior Director bei Meta FAIR Embodied AI; leitete Arbeiten am multimodalen Assistenten der Ray-Ban Meta SmartGlasses sowie am 3D-Simulator Habitat.
  4. Ehemaliger Associate Professor an der Georgia Tech, ausgezeichnet unter anderem mit dem PECASE-Award 2019.
  5. Pionierarbeiten in visueller Fragebeantwortung (VQA, Everingham-Preis ICCV 2025), Interpretierbarkeit (Grad-CAM) und Robotik.

Warum das relevant ist

Batra zählt zu den führenden Köpfen im Bereich multimodaler und handelnder KI (Embodied AI). Seine aktuelle Arbeit an Navigator zeigt, wie spezialisierte Modelle für Browser- und Desktop-Automatisierung mit JavaScript-Ausführung Benchmark-Ergebnisse allgemeiner Spitzen-LLMs herausfordern.

Einordnung

Die Website dokumentiert den Übergang von akademischer Grundlagenforschung und Tech-Konzern-Leitung (Meta) hin zu Start-up-gestützten Agentensystemen. Mit Yutoris Navigator-Serie rückt das Zusammenspiel von visuellen UI-Aktionen und direktem Code (JavaScript) in den Mittelpunkt, um praktische Aufgaben im Web verlässlich zu automatisieren.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Video

    Video:AI Engineer

    Computer-Use-Modelle statt APIs: Warum Web-Agents auf Pixel setzen müssen

    Dhruv Batra argumentiert, dass KI-Agenten das Web nicht über APIs oder MCP-Server erschließen werden, sondern über visuelle Computer-Use-Modelle. Während Top-Websites strukturierte Schnittstellen bereitstellen können, besteht der Long Tail aus rund 200 Millionen Sites mit veralteter Infrastruktur, Scans und clientseitig gerendertem State, den nur Bildschirm-Interaktionen zuverlässig erfassen können.

    KI & AI· Vortrag

  • Link:METR

    METR: Forschung und Evaluierung von Risiken hochentwickelter KI-Modelle

    METR (Model Evaluation & Threat Research) ist eine gemeinnützige Forschungsorganisation, die autonome Fähigkeiten und Bedrohungsrisiken moderner KI-Systeme evaluiert. Die Organisation untersucht unter anderem Time Horizons bei Aufgabenlängen, Überwachungsmechanismen und Vorfälle mit KI-Agenten.

    KI & AI· Sammlung

  • Artikel:Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

    BridgeVLA++: 3D-Roboter-Manipulations-Framework mit spatio-temporalem Gedächtnis

    Forschende stellen BridgeVLA++ vor, ein Vision-Language-Action-Framework für 3D-Roboter-Manipulationen. Aufbauend auf BridgeVLA erweitert das Modell vortrainierte Vision-Language-Modelle (VLMs) um eine Architektur für räumlich-zeitliches Gedächtnis, um vergangene Beobachtungen und Interaktionshistorien effizient einzubeziehen.

    KI & AI· Forschung

  • Link:Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti et al.

    OpenVLA: Open-Source Vision-Language-Action-Modell für Robotik

    OpenVLA ist ein quelloffenes Vision-Language-Action-Modell (VLA) mit 7 Milliarden Parametern zur Steuerung von Robotern. Es basiert auf Prismatic-7B, nutzt Llama 2 und wurde auf 970.000 Roboter-Episoden trainiert. Das Modell übertrifft bisherige Generalisten wie Octo und RT-1-X sowie teilweise das proprietäre 55B-Modell RT-2-X.

    KI & AI· Forschung

  • Link:Rogerio Bonatti, Dan Zhao, Francesco Bonacci, et al.

    Windows Agent Arena: Großskaliges Benchmark für multimodale Windows-Agenten

    Forschende von Microsoft, der Carnegie Mellon University und der Columbia University haben mit Windows Agent Arena (WAA) ein Open-Source-Framework veröffentlicht, mit dem multimodale KI-Agenten in einer nativen Windows-11-Umgebung getestet werden können. Das System umfasst über 150 Alltagsaufgaben und lässt sich via Azure parallelisieren, wodurch vollständige Benchmark-Läufe in rund 20 Minuten statt mehreren Tagen durchlaufen. Ein begleitend vorgestellter Referenz-Agent namens Navi erreichte eine Erfolgsquote von 19,5 Prozent, verglichen mit 74,5 Prozent menschlicher Genauigkeit.

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.