WindTunnel: Offener Benchmark vergleicht WebMCP mit Computer Use und DOM-Parsing

Linknekuda-aiSammlung

Nekuda-ai hat mit WindTunnel einen reproduzierbaren Open-Source-Benchmark vorgestellt, der WebMCP mit visuellen Screen-Agents und DOM-basierten Ansätzen vergleicht. Der Benchmark testet 49 Aufgaben auf acht realen Websites mit jeweils drei Durchläufen über Modelle wie GPT-5.6 Luna, Gemini 3.6 Flash und Sonnet 5.

Das Wichtigste

  1. WindTunnel testet drei Interaktionsmethoden: WebMCP (Tool Calling), Screenshots (Computer Use über Koordinaten) und Seitenstruktur (DOM sowie Accessibility Tree).
  2. Alle getesteten WebMCP-Konfigurationen lösten 48 von 49 Aufgaben, während Screen-Driving-Agents im Median 43 von 49 Aufgaben bewältigten.
  3. WebMCP erreichte eine 3- bis 5-mal schnellere Aufgabenerledigung (Median 7,8 s gegenüber 28,1 s bei Screen-Agents).
  4. Die Kosten lagen mit 0,6 Cent gegenüber 5,5 Cent im Median pro Aufgabe um das 4- bis 23-fache niedriger.
  5. In der Gesamtwertung führt GPT-5.6 Luna mit nativem WebMCP (Score 98,4), gefolgt von Gemini 3.6 Flash (Score 94,0).
  6. Methodik, Code, Aufgabendefinitionen und vollständige Transkripte sind im GitHub-Repository nekuda-ai/WindTunnel veröffentlicht.

Warum das relevant ist

Für Entwickler von Browser-Agents zeigt der Benchmark, dass strukturierte APIs und direkte Schnittstellen wie WebMCP hinsichtlich Latenz, Token-Verbrauch und Kosten herkömmlichen visuellen Interaktionsansätzen (Computer Use) sowie reinem DOM-Scraping deutlich überlegen sind.

Einordnung

Die Daten belegen drastische Einsparungen beim Token-Verbrauch: Während GPT-5.6 Luna via WebMCP im Median nur 2.596 Token benötigt, steigen die Werte bei Computer Use auf 20.914 Token und bei DOM plus Vision auf 29.561 Token. Noch extremer fällt der Unterschied bei Sonnet 5 aus, wo DOM und Vision bis zu 64.424 Token pro Aufgabe konsumieren. Strukturierte Schnittstellen bieten Web-Agents somit einen entscheidenden Effizienzvorteil gegenüber pixel- oder markupbasierten Notlösungen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:nekuda-ai/WindTunnel

    WindTunnel: Benchmark für Browser-Agenten-Schnittstellen und WebMCP

    WindTunnel ist ein Open-Source-Benchmark-Harness, das unterschiedliche Interaktionsmethoden von Browser-Agenten auf Webseiten vergleicht. Untersucht werden WebMCP (direkt von Websites bereitgestellte Aktionen), Screenshots (Computer Use via Koordinaten) und klassische Seitenstrukturen (DOM und Accessibility Tree).

    34SterneHTML

    KI & AI· Forschung

  • Link:Rogerio Bonatti, Dan Zhao, Francesco Bonacci, et al.

    Windows Agent Arena: Großskaliges Benchmark für multimodale Windows-Agenten

    Forschende von Microsoft, der Carnegie Mellon University und der Columbia University haben mit Windows Agent Arena (WAA) ein Open-Source-Framework veröffentlicht, mit dem multimodale KI-Agenten in einer nativen Windows-11-Umgebung getestet werden können. Das System umfasst über 150 Alltagsaufgaben und lässt sich via Azure parallelisieren, wodurch vollständige Benchmark-Läufe in rund 20 Minuten statt mehreren Tagen durchlaufen. Ein begleitend vorgestellter Referenz-Agent namens Navi erreichte eine Erfolgsquote von 19,5 Prozent, verglichen mit 74,5 Prozent menschlicher Genauigkeit.

    KI & AI· Forschung

  • Link:webmcp.com

    WebMCP Adoption Tracker: Status bei Browsern und KI-Agenten

    Der WebMCP Ecosystem Adoption Tracker dokumentiert den Implementierungsstand des WebMCP-Standards in Browsern und KI-Agenten. Während OpenAI WebMCP in ChatGPT bereits standardmäßig aktiviert hat und Chrome eine Veröffentlichung mit Version 157 anpeilt, zeigen sich Mozilla neutral und WebKit ablehnend.

    KI & AI· Sammlung

  • Artikel:Jiarui Lu, Thomas Holleis, Yizhe Zhang, Bernhard Aumayer, Feng Nan, Felix Bai, Shuang Ma, Shen Ma, Mengyu Li, Guoli Yin, Zirui Wang, Ruoming Pang

    ToolSandbox: Zustandsbasierter Benchmark für die Tool-Nutzung von LLMs

    ToolSandbox ist ein Evaluierungs-Benchmark, der die Fähigkeiten von Sprachmodellen bei der Werkzeugnutzung anhand zustandsbehafteter Umgebungen und mehrteiliger Dialoge testet.

    KI & AI· Forschung

  • Repository:ChromeDevTools/chrome-devtools-mcp

    Chrome DevTools MCP: Browser-Debugging und Performance-Analyse für Coding-Agents

    chrome-devtools-mcp verbindet KI-Assistenten und Coding-Agents über das Model Context Protocol (MCP) mit Google Chrome. Das Werkzeug erlaubt Agents, den Browser per Puppeteer zu steuern, Netzwerk- und Konsolen-Logs inklusive Source Maps zu inspizieren und Performance-Traces auszuwerten.

    50.830SterneTypeScript

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.