Adversarielles Browser-Testing mit Jev und Runlayer

X-PostRafal WilinskiDemo

Rafal Wilinski stellt eine Testsuite vor, die Releases mithilfe paralleler KI-Agenten und Chromium gezielt auf Fehler überprüft. Die Lösung basiert auf dem Modell Jev von TypeSafeAI und Agenten von Runlayer.

Das Wichtigste

  1. Wilinski nutzt das Modell Jev von TypeSafeAI für adversarielles Browser-Testing von Releases.
  2. Das Setup kombiniert Runlayer-Agenten mit Chromium und läuft laut Autor massiv parallelisiert.
  3. Die Agenten arbeiten auf Basis eines vereinfachten und transformierten HTML-Baums.
  4. Laut Wilinski verursacht das Verfahren nur minimale Kosten ('costs pennies').

Warum das relevant ist

Automatisierte E2E- und Adversarial-Tests im Browser waren bisher oft teuer, fragil und aufwendig zu warten. Kostengünstige Agenten-Setups könnten es Teams ermöglichen, Webanwendungen vor jedem Release kontinuierlich und aggressiv auf Schwachstellen abzuklopfen.

Einordnung

Wilinskis Architektur verzichtet auf ressourcenhungrige Bildverarbeitung und speist stattdessen bereinigte HTML-DOM-Bäume in die Agenten ein. Das Zusammenspiel aus Runlayers Agentenplattform und dem Modell Jev von TypeSafeAI zeigt einen pragmatischen Weg auf, LLM-gesteuerte Browser-Tests kosteneffizient in CI/CD-Pipelines zu integrieren.

Original-Post

Rafal Wilinski

@rafalwilinski · 18. September 2026

thanks to @typesafeai's Jev we now have massively parallel browser-based adversarial testing suite that tries to break each release. and it costs pennies. t.co/WoIlqGjjNB

4406 Likes82 Antworten3417 Lesezeichen238.542 Aufrufe

Auf X ansehen
Weitere Posts im Thread (3)
  1. @jedfrankowski @typesafeai @runlayer agents + chromium
  2. Since everyone is asking about setup - it’s just @runlayer agents + chromium magic. Dogfooding at its finest
  3. @ashleyrudland @typesafeai simplified/transformed html tree
Ausgewählte Antworten (5)
  • @tommyjmarshall @rafalwilinski @typesafeai What definition of “break” are you using? How can it tell between something visually regressing a little?
  • @air_codex @rafalwilinski @typesafeai holy moly the jev hype is real
  • @ashleyrudland @rafalwilinski @typesafeai You can’t give dev images so how does this work?
  • @Richelle_Ji @rafalwilinski @typesafeai Open-weights jev exists now, with vision: t.co/yMmnOYhXVO t.co/j4HfXEiU8b
  • @HaseebMir91 @rafalwilinski @typesafeai Why it was not possible before Jev model? i am curious

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:nekuda-ai/WindTunnel

    WindTunnel: Benchmark für Browser-Agenten-Schnittstellen und WebMCP

    WindTunnel ist ein Open-Source-Benchmark-Harness, das unterschiedliche Interaktionsmethoden von Browser-Agenten auf Webseiten vergleicht. Untersucht werden WebMCP (direkt von Websites bereitgestellte Aktionen), Screenshots (Computer Use via Koordinaten) und klassische Seitenstrukturen (DOM und Accessibility Tree).

    34SterneHTML

    KI & AI· Forschung

  • Video

    Video:AI Engineer

    Web-Automatisierung mit KI-Agenten über das Chrome DevTools Protocol

    Corey Gallon erklärt, wie KI-Agenten moderne Bot-Schutzmechanismen wie Cloudflare Turnstile und reCAPTCHA über das Chrome DevTools Protocol (CDP) überwinden können. Durch die Trennung von deterministischem Code und gezieltem KI-Vision-Einsatz sowie echte Mauspfade interagieren Agenten wie menschliche Nutzer im Browser.

    KI & AI· Vortrag

  • Video

    Video:AI LABS

    Graph Engineering für KI-Agenten: Parallele Workflows und Verifikation

    Graph Engineering löst lineare Schleifen (Loop Engineering) ab, indem Aufgaben auf mehrere parallel laufende Sub-Agenten verteilt werden. Der Kanal AI Labs erläutert die Struktur aus Knoten und Kanten, Risiken durch kaskadierende Fehler und konkrete Verifikationsstrategien mit Claude Code.

    KI & AI· Anleitung

  • Artikel:Google Chrome Developers Team

    Lighthouse führt experimentelle Audits für Agentic Browsing ein

    Google dokumentiert eine experimentelle Audit-Kategorie in Lighthouse, die Websites auf ihre Interaktionsfähigkeit mit KI-Agenten überprüft. Statt eines Scores von 0 bis 100 zeigt der Bericht den Anteil bestandener Prüfungen.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.