Windows Agent Arena: Großskaliges Benchmark für multimodale Windows-Agenten

LinkRogerio Bonatti, Dan Zhao, Francesco Bonacci, et al.Forschung

Forschende von Microsoft, der Carnegie Mellon University und der Columbia University haben mit Windows Agent Arena (WAA) ein Open-Source-Framework veröffentlicht, mit dem multimodale KI-Agenten in einer nativen Windows-11-Umgebung getestet werden können. Das System umfasst über 150 Alltagsaufgaben und lässt sich via Azure parallelisieren, wodurch vollständige Benchmark-Läufe in rund 20 Minuten statt mehreren Tagen durchlaufen. Ein begleitend vorgestellter Referenz-Agent namens Navi erreichte eine Erfolgsquote von 19,5 Prozent, verglichen mit 74,5 Prozent menschlicher Genauigkeit.

Das Wichtigste

  1. WAA basiert auf einer Anpassung des OSWorld-Frameworks und bietet 154 deterministisch überprüfbare Aufgaben in Standard-Tools wie LibreOffice, VS Code, Browsern oder Systemeinstellungen.
  2. Die Architektur nutzt Docker-Container mit virtualisiertem Windows 11 und Flask-Schnittstellen; via Azure Machine Learning können Auswertungen parallelisiert in 20 Minuten abgeschlossen werden.
  3. Der eigene multimodale Agent Navi nutzt Chain-of-Thought-Prompting sowie Set-of-Marks-Verfahren, um Bildschirmelemente über UIA-Bäume, OCR und OmniParser zu analysieren.
  4. Ergebnis des Benchmarks: Reine OCR- und Bilderkennung schneidet schlechter ab als Ansätze, die den Windows UI Automation (UIA) Tree einbinden; insgesamt liegen alle getesteten Modelle noch weit hinter menschlichen Resultaten.

Warum das relevant ist

Während sich viele Agenten-Benchmarks bisher auf isolierte Weboberflächen oder reine Textbefehle beschränkten, verlangt WAA die Bedienung realer Desktop-Software mit Fenstern, Menüs und komplexen Arbeitsabläufen. Die schnelle Parallelisierbarkeit in der Cloud senkt zudem die Hürden für Entwicklerteams, multimodale Betriebssystem-Agenten reproduzierbar und zeitsparend zu evaluieren.

Einordnung

Die Diskrepanz zwischen Navis Erfolgsquote von 19,5 Prozent und der menschlichen Quote von 74,5 Prozent verdeutlicht, wie fehleranfällig multimodale LLM-Agenten bei sequenziellen Arbeitsschritten auf Betriebssystemebene noch agieren. Interessant ist die technische Erkenntnis, dass visuelle Pixelmodelle alleine schlechter performen als hybride Ansätze, die Metadaten wie den UIA-Baum von Windows auslesen. Für den produktiven Einsatz autonomer Desktop-Assistenten bleiben Robustheit und Kontextverständnis weiterhin die wesentlichen Engpässe.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Jiarui Lu, Thomas Holleis, Yizhe Zhang, Bernhard Aumayer, Feng Nan, Felix Bai, Shuang Ma, Shen Ma, Mengyu Li, Guoli Yin, Zirui Wang, Ruoming Pang

    ToolSandbox: Zustandsbasierter Benchmark für die Tool-Nutzung von LLMs

    ToolSandbox ist ein Evaluierungs-Benchmark, der die Fähigkeiten von Sprachmodellen bei der Werkzeugnutzung anhand zustandsbehafteter Umgebungen und mehrteiliger Dialoge testet.

    KI & AI· Forschung

  • Repository:nekuda-ai/WindTunnel

    WindTunnel: Benchmark für Browser-Agenten-Schnittstellen und WebMCP

    WindTunnel ist ein Open-Source-Benchmark-Harness, das unterschiedliche Interaktionsmethoden von Browser-Agenten auf Webseiten vergleicht. Untersucht werden WebMCP (direkt von Websites bereitgestellte Aktionen), Screenshots (Computer Use via Koordinaten) und klassische Seitenstrukturen (DOM und Accessibility Tree).

    34SterneHTML

    KI & AI· Forschung

  • Artikel:Terry Chen, Yeyin (Eva) Zhu, Zhifan Ye, Jean-Francois Puget and Humphrey Shi

    NVIDIA AVO erreicht 100 % im ARC-AGI-3-Benchmark

    NVIDIA präsentiert mit Agentic Variation Operators (AVO) eine Agentenarchitektur für langlaufende Aufgaben, die Claude Opus 5 zu einem perfekten Ergebnis im ARC-AGI-3-Benchmark verhilft.

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.