Update für das Eval Skills Plugin: Coding-Agenten erstellen Review-Apps zur Fehlersuche

X-PostHamel HusainAnkündigung

Hamel Husain und Shreya Shankar haben ihr Plugin für Eval Skills aktualisiert. Die wichtigste Neuerung ist ein Skill zur Fehlererkennung, mit dem Coding-Agenten aus KI-Ausgaben oder Traces automatisch individuelle Review-Apps generieren.

Das Wichtigste

  1. Hamel Husain und Co-Entwicklerin @sh_reya haben ihr zuvor veröffentlichtes Eval Skills Plugin überarbeitet.
  2. Die zentrale Neuerung ist eine Funktion zur Fehlererkennung (error-discovery skill).
  3. Wird dem Coding-Agenten eine Datei mit KI-Ausgaben oder Traces übergeben, baut dieser daraus eine maßgeschneiderte Review-Applikation.

Warum das relevant ist

Die systematische Auswertung von Logdaten und Ausgaben von KI-Modellen ist oft mühsam. Werkzeuge, die Trace-Dateien automatisiert in visuelle Prüfoberflächen verwandeln, erleichtern das Debugging und die Qualitätskontrolle von LLM-Anwendungen.

Einordnung

Das Update adressiert ein typisches Problem bei der Evaluation von Sprachmodellen: Rohdaten aus Traces sind unhandlich. Indem Coding-Agenten beauftragt werden, bedarfsgerechte Review-Apps direkt aus den Trace-Dateien zu bauen, wird der Schritt von der Fehlerbeobachtung zur konkreten Überprüfung verkürzt.

Original-Post

Hamel Husain

@HamelHusain · 17. August 2026

A few months ago,@sh_reya and I released eval skills plugin. We iterated on it a bunch and recently made it better The biggest change is a new error-discovery skill. Give your coding agent a file of AI outputs or traces, and it builds a custom review app w/intelligent

717 Likes41 Antworten1127 Lesezeichen71.047 Aufrufe

Auf X ansehen
Ausgewählte Antworten (2)
  • @AgomaMitchell @HamelHusain @sh_reya The key step is turning observed production failures into reusable tests. Sampling and clustering improve coverage, but every retained eval should state the defect it detects and the release decision it informs. Related QA view: t.co/jbnQGhziNe
  • @salisedesign @HamelHusain @sh_reya sounds like a really useful tool for debugging. the error-discovery skill seems super helpful

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:EveryInc/compound-engineering-plugin

    Compound Engineering: Plugin mit 33 Skills für KI-Coding-Agents

    Compound Engineering ist ein Open-Source-Plugin für AI Coding Agents, das Entwicklungsprozesse strukturiert und Erkenntnisse systematisch dokumentiert. Es unterstützt 14 Plattformen wie Claude Code, Cursor und Codex.

    24.861SterneTypeScript

    KI & AI· Tool

  • X-Post:Emre Savcı

    Cloudflare veröffentlicht Security-Audit-Skill für Coding-Agents

    Cloudflare hat mit security-audit-skill ein quelloffenes Framework für KI-Coding-Agents vorgestellt, das Codebasen strukturiert und mehrstufig auf Sicherheitslücken prüft. Der Skill nutzt isolierte Agenten für die Erkennung, Prüfung und Verifikation von Schwachstellen.

    2754Lesezeichen143.649Aufrufe

    KI & AI· Tool

  • Repository:petergyang/human-review

    Human Review: Visuelles Feedback- und Editier-Werkzeug für KI-Coding-Agenten

    Human Review ist ein Open-Source-Tool, mit dem Entwickler HTML- und Markdown-Dateien oder lokale Webseiten direkt im Browser visuell bearbeiten und kommentieren können. Anstatt Änderungen mühsam in Chat-Prompts zu beschreiben, sammelt das Werkzeug Textanpassungen und Google-Docs-ähnliche Kommentare in einem Batch und übergibt sie gesammelt an Agenten wie Claude Code oder Codex.

    1236SterneJavaScript

    KI & AI· Tool

  • X-Post:Zach Lloyd

    Warp Factories: Automatische Skill-Optimierung durch Feedback-Loops

    Zach Lloyd berichtet über zehn erfolgreich gemergte Pull Requests zur Skill-Verbesserung, die von Warps interner Software Factory vollautomatisch erstellt wurden. Grundlage dafür ist eine neue Self-Improvement-Funktion in Warp Factories, die ineffiziente Agentenläufe erkennt und daraus automatisch Anpassungen an Prompts und Tool-Definitionen ableitet.

    298Lesezeichen24.286Aufrufe

    KI & AI· Ankündigung

  • X-Post:Juampi

    Übersicht von Anti-Slop-Skills für KI-gestützte Code-Bereinigung

    Juampi stellt eine kuratierte Liste von Skills für KI-Codierungsassistenten vor, die darauf abzielen, minderwertigen oder überflüssigen KI-generierten Code («Slop») zu erkennen und zu bereinigen.

    3329Lesezeichen175.570Aufrufe

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.