WindTunnel: WebMCP-Benchmark zeigt deutliche Effizienzgewinne für Browser-Agenten

X-PostIdan LevinForschung

Idan Levin hat mit WindTunnel einen Open-Source-Benchmark für WebMCP vorgestellt. Die Auswertung vergleicht Website-gestützte Tool-Aufrufe mit Computer-Use- und DOM-basierten Methoden über 49 Aufgaben auf acht realen Webseiten.

Das Wichtigste

  1. WebMCP schneidet im Benchmark deutlich besser ab als Computer Use (Screenshots/Koordinaten) und DOM-/Accessibility-Ansätze: Alle WebMCP-Konfigurationen lösten 48 von 49 Aufgaben.
  2. Gegenüber visuellen Screen-Driving-Agenten erledigt WebMCP Aufgaben 3- bis 5-mal schneller (im Median 7,8 s gegenüber 28,1 s).
  3. Die Kosten pro Aufgabe sinken laut Benchmark um das 4- bis 23-fache (Median 0,6 Cent gegenüber 5,5 Cent).
  4. Auf den vorderen Rängen der Bestenliste liegen WebMCP-Setups mit GPT-5.6 Luna, Gemini 3.6 Flash und Sonnet 5, während reine Computer-Use-Setups ab Rang 8 folgen.
  5. Voraussetzung für die Vorteile ist, dass Betreiber ihre Webseiten mit entsprechenden Tools ausstatten, was laut Levin auch Vorteile für die Sichtbarkeit von Agenten und die Agent Experience (AX) bringt.

Warum das relevant ist

Wenn KI-Agenten komplexe Aktionen im Browser ausführen, sind reine Screenshot- und DOM-Analysen langsam und tokenintensiv. Das Bereitstellen strukturierter Schnittstellen über WebMCP senkt Latenz und Kosten drastisch, verlagert den Aufwand jedoch auf die Webentwicklung.

Einordnung

Der Benchmark quantifiziert den Unterschied zwischen generischem Screen-Scraping und strukturierten Tool-Schnittstellen im Web. Die Zahlen zeigen eine klare Überlegenheit bei Ausführungszeit und Tokenverbrauch. Gleichzeitig betont die Diskussion die Hürde: Der Ansatz skaliert nur, wenn Webseitenbetreiber aktive Schnittstellen bereitstellen und pflegen, statt dass Agenten autonom jede beliebige visuelle Oberfläche bedienen.

Original-Post

idan levin

@0xidanlevin · 5. September 2026

@rauchg You might find this interesting - We created the first WebMCP benchmark, comparing it with computer use and DOM-based methods across speed, cost, task success rate, and token usage. The results are incredible. t.co/MPXjJvRpTE You’re getting 3-5x speed, and an order

369 Likes11 Antworten581 Lesezeichen138.283 Aufrufe

Auf X ansehen
Weitere Posts im Thread (2)
  1. @chiplay @rauchg @jgw Ty! 🙏🏻
  2. @pawelblaszczyk_ @rauchg Yes you are correct, the thing is that *if* the website will expose tools, the agents will have these massive benefits. Plus for the site owner there are also major benefits (agent visibility, better AX etc.). So it should serve as motivation to add webmcp as a preferred
Ausgewählte Antworten (5)
  • @rauchg @0xidanlevin Very cool!
  • @liadyosef @rauchg Definitely! it's great as a *medium-term* agentic bridge, and especially for co-browsing. But it's definitely not the end state of the agentic web :) The visual layer will quickly lose its place as the source of truth, leaving the agents to rely more and more just on the tools
  • @vikasmalpani @rauchg The sleeper is the Next.js bit: a page exposing its own debug tools in-tab lets the agent read real state instead of guessing from logs. My bet: the first WebMCP killer use isn't consumer browsing, it's dev agents debugging their own app in the tab. That's what makes it stick.
  • @pawelblaszczyk_ @0xidanlevin @rauchg The WebMCP approach will depend heavily on what exactly the programmer exposes, do I understand it correctly? It’s surprising to put it next to computer use which will probably operate on any website 😄
  • @iserflott @purpose_walker @rauchg Yeah that’s exactly my thinking: agents load, view and click a website fine. Sure webmcp makes it more efficient but it also requires devs to build every feature as mcp tool too. But my problem is that my agent can auth into websites for me, and webmcp specifically doesn’t solve

Links und Tools aus diesem Beitrag

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:nekuda-ai

    WindTunnel: Offener Benchmark vergleicht WebMCP mit Computer Use und DOM-Parsing

    Nekuda-ai hat mit WindTunnel einen reproduzierbaren Open-Source-Benchmark vorgestellt, der WebMCP mit visuellen Screen-Agents und DOM-basierten Ansätzen vergleicht. Der Benchmark testet 49 Aufgaben auf acht realen Websites mit jeweils drei Durchläufen über Modelle wie GPT-5.6 Luna, Gemini 3.6 Flash und Sonnet 5.

    KI & AI· Sammlung

  • Repository:nekuda-ai/WindTunnel

    WindTunnel: Benchmark für Browser-Agenten-Schnittstellen und WebMCP

    WindTunnel ist ein Open-Source-Benchmark-Harness, das unterschiedliche Interaktionsmethoden von Browser-Agenten auf Webseiten vergleicht. Untersucht werden WebMCP (direkt von Websites bereitgestellte Aktionen), Screenshots (Computer Use via Koordinaten) und klassische Seitenstrukturen (DOM und Accessibility Tree).

    34SterneHTML

    KI & AI· Forschung

  • X-Post:Idan Levin

    Browser Use integriert WebMCP-Unterstützung

    Das Automatisierungs-Tool Browser Use unterstützt ab sofort WebMCP. Idan Levin hat die Neuerung im WebMCP-Ökosystem-Tracker erfasst, der den aktuellen Adoptionsstand des Standards in Browsern, Frameworks und KI-Agenten dokumentiert.

    63Lesezeichen9517Aufrufe

    KI & AI· Ankündigung

  • Link:webmcp.com

    WebMCP Adoption Tracker: Status bei Browsern und KI-Agenten

    Der WebMCP Ecosystem Adoption Tracker dokumentiert den Implementierungsstand des WebMCP-Standards in Browsern und KI-Agenten. Während OpenAI WebMCP in ChatGPT bereits standardmäßig aktiviert hat und Chrome eine Veröffentlichung mit Version 157 anpeilt, zeigen sich Mozilla neutral und WebKit ablehnend.

    KI & AI· Sammlung

  • Link:Artificial Analysis

    Artificial Analysis Search Index: Benchmark für Such-APIs von KI-Agenten

    Artificial Analysis hat ein Benchmark-Leaderboard für Such-APIs veröffentlicht, die KI-Agenten Zugriff auf aktuelle Webdaten geben. Verglichen werden 19 Such-API-Produkte von 9 Anbietern hinsichtlich Antwortqualität, Latenz und Kosten auf Basis des Referenzmodells GPT-5.6 Luna (medium).

    KI & AI· Tool

  • Link:Rogerio Bonatti, Dan Zhao, Francesco Bonacci, et al.

    Windows Agent Arena: Großskaliges Benchmark für multimodale Windows-Agenten

    Forschende von Microsoft, der Carnegie Mellon University und der Columbia University haben mit Windows Agent Arena (WAA) ein Open-Source-Framework veröffentlicht, mit dem multimodale KI-Agenten in einer nativen Windows-11-Umgebung getestet werden können. Das System umfasst über 150 Alltagsaufgaben und lässt sich via Azure parallelisieren, wodurch vollständige Benchmark-Läufe in rund 20 Minuten statt mehreren Tagen durchlaufen. Ein begleitend vorgestellter Referenz-Agent namens Navi erreichte eine Erfolgsquote von 19,5 Prozent, verglichen mit 74,5 Prozent menschlicher Genauigkeit.

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.