WindTunnel: Benchmark für Browser-Agenten-Schnittstellen und WebMCP

Repositorynekuda-ai/WindTunnelForschung

WindTunnel ist ein Open-Source-Benchmark-Harness, das unterschiedliche Interaktionsmethoden von Browser-Agenten auf Webseiten vergleicht. Untersucht werden WebMCP (direkt von Websites bereitgestellte Aktionen), Screenshots (Computer Use via Koordinaten) und klassische Seitenstrukturen (DOM und Accessibility Tree).

Das Wichtigste

  1. Vergleicht drei Interaktionsmodelle: WebMCP-Aktionen, Screenshot-basierte Steuerung per Koordinaten und Navigation über DOM bzw. Accessibility-Tree.
  2. Gemessen werden Erfolgsrate, Ausführungszeit, Token-Verbrauch und API-Kosten anhand identischer Aufgaben auf verschiedenen Test-Websites.
  3. Laut Benchmark-Ergebnissen erzielt WebMCP eine bis zu 5,5-mal schnellere Ausführung, 23-mal geringere Kosten und 12,5-mal weniger Tokens bei einer Lösungsquote von 98 %.
  4. Ein kanonischer Testlauf vom 20. August 2026 umfasst 16 Konfigurationen und 49 Aufgaben auf 8 Seiten mit 2.352 Durchläufen.
  5. Basiert technisch auf Node.js (20.11+), Playwright (Chromium) und Docker; unterstützt unter anderem Modelle wie Claude via API-Key.

Warum das relevant ist

Klassische KI-Browser-Agenten verbrauchen über Screenshots oder das Parsen riesiger DOM-Bäume enorme Mengen an Rechenzeit und Tokens. WindTunnel liefert empirische Messdaten für die Hypothese, dass standardisierte APIs auf Website-Ebene (WebMCP) Agenten-Interaktionen drastisch beschleunigen und verbilligen können.

Einordnung

Das Projekt adressiert ein Kernproblem aktueller KI-Automatisierung im Web: die ineffiziente und fehleranfällige Interaktion über reine UI-Scraping- oder Screenshot-Methoden. Zielgruppe sind Entwickler von Browser-Agenten, Betreiber von Webanwendungen und KI-Forscher. Technisch nutzt WindTunnel Node.js, Playwright und Docker sowie Integrationen für KI-APIs wie Anthropic. Bezüglich des Reifegrads präsentiert sich das Repository trotz einer überschaubaren GitHub-Präsenz (34 Sterne) methodisch detailliert: Es verfügt über automatisierte GitHub Actions, standardisierte Testläufe (über 2.300 Durchläufe dokumentiert) und einen Fake-Lifecycle-Modus für lokale Tests ohne API-Kosten.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:nekuda-ai

    WindTunnel: Offener Benchmark vergleicht WebMCP mit Computer Use und DOM-Parsing

    Nekuda-ai hat mit WindTunnel einen reproduzierbaren Open-Source-Benchmark vorgestellt, der WebMCP mit visuellen Screen-Agents und DOM-basierten Ansätzen vergleicht. Der Benchmark testet 49 Aufgaben auf acht realen Websites mit jeweils drei Durchläufen über Modelle wie GPT-5.6 Luna, Gemini 3.6 Flash und Sonnet 5.

    KI & AI· Sammlung

  • Repository:ChromeDevTools/chrome-devtools-mcp

    Chrome DevTools MCP: Browser-Debugging und Performance-Analyse für Coding-Agents

    chrome-devtools-mcp verbindet KI-Assistenten und Coding-Agents über das Model Context Protocol (MCP) mit Google Chrome. Das Werkzeug erlaubt Agents, den Browser per Puppeteer zu steuern, Netzwerk- und Konsolen-Logs inklusive Source Maps zu inspizieren und Performance-Traces auszuwerten.

    50.830SterneTypeScript

    KI & AI· Tool

  • Repository:Podcast72/showroom-la-finestra-webmcp

    WebMCP: Agenten-Schnittstelle direkt im Browser via document.modelContext

    Das Open-Source-Repository showroom-la-finestra-webmcp demonstriert, wie bestehende Websites ohne separaten MCP-Server strukturiertes Wissen und sichere Aktionen direkt an KI-Agenten übermitteln können. Über eine clientseitige JavaScript-Schicht (`document.modelContext`) erklärt sich die Website selbst, anstatt Screen Scraping oder DOM-Parsing vorauszusetzen.

    1SterneJavaScript

    KI & AI· Sammlung

  • Repository:per-simmons/simmonsbench-agent-fanout

    agent-fanout: Parallele Coding-Agenten in iTerm2 vergleichen

    agent-fanout führt bis zu sechs Instanzen der Claude Code CLI parallel in iTerm2 aus, lässt sie Aufgaben in HTML-Dateien umsetzen und misst Tokenverbrauch, Kosten sowie Ausführungszeit für Modellvergleiche.

    4SterneShell

    KI & AI· Tool

  • Repository:captivus/chrome-agent

    chrome-agent: Direkte CDP-Steuerung für KI-Coding-Agenten

    chrome-agent ist ein CLI-Werkzeug und eine Python-Bibliothek, die KI-Coding-Agenten direkten Zugriff auf den Chrome-Browser über das Chrome DevTools Protocol (CDP) bietet. Das Tool verzichtet auf einschränkende Abstraktionsschichten und erlaubt die gleichzeitige, isolierte Nutzung durch mehrere Agenten und menschliche Nutzer.

    243SternePython

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.