Link:Rogerio Bonatti, Dan Zhao, Francesco Bonacci, et al.
Windows Agent Arena: Großskaliges Benchmark für multimodale Windows-Agenten
Forschende von Microsoft, der Carnegie Mellon University und der Columbia University haben mit Windows Agent Arena (WAA) ein Open-Source-Framework veröffentlicht, mit dem multimodale KI-Agenten in einer nativen Windows-11-Umgebung getestet werden können. Das System umfasst über 150 Alltagsaufgaben und lässt sich via Azure parallelisieren, wodurch vollständige Benchmark-Läufe in rund 20 Minuten statt mehreren Tagen durchlaufen. Ein begleitend vorgestellter Referenz-Agent namens Navi erreichte eine Erfolgsquote von 19,5 Prozent, verglichen mit 74,5 Prozent menschlicher Genauigkeit.
Aus Video: AI Weekly Round-up: Claude Fable 5, Anthropic Pricing Adjustments, and Agent Architectures