Evals versus Loops: Warum nachgelagerte Tests für Agenten nicht ausreichen

X-PostHanakoMeinung

Hanako analysiert die Grenzen klassischer Evals in KI-Systemen und stellt ihnen Loop- und Graph-Architekturen gegenüber. Während Evals Fehler erst nach Abschluss des gesamten Prozesses melden, greifen Loops als Kontrollschranken direkt zwischen einzelnen Schritten ein.

Das Wichtigste

  1. Evals agieren rein informativ am Ende eines Durchlaufs, wodurch fehlerhafte Zwischenergebnisse nachfolgende Schritte verfälschen können.
  2. Ein Loop platziert dieselbe Prüflogik direkt zwischen Einzelschritte und stoppt die Ausführung bei Fehlern, bevor der nächste Schritt startet.
  3. Valide Prüfungen müssen programmatisch messbar sein (wie Exit-Codes oder Datei-Diffs); Modell-Zuversicht oder das Ausbleiben von Fehlern genügen nicht.
  4. Loops optimieren isolierte Arbeitseinheiten, während Graphs die Beziehungen, Abhängigkeiten und parallelen Ausführungen zwischen Knoten regeln.
  5. Vier Knotentypen definieren den Graphen: Splitter, Worker, Code-Nodes (für deterministische Logik ohne LLM) und Gates.
  6. Rückkopplungspfade sollten gezielt einzelne fehlerhafte Einheiten statt ganzer Batches zurückweisen, um fehlerfreie Teilergebnisse nicht zu verwerfen.

Warum das relevant ist

Viele Teams investieren stark in nachgelagerte Evaluationen, merken jedoch zu spät, dass ein früher Einzelfehler den gesamten Rest des Agenten-Workflows unbrauchbar gemacht hat. Die Verlagerung von Checks direkt in den Kontrollfluss spart Token-Budget, vermeidet Kaskadenfehler und macht Agenten autonom steuerbar.

Einordnung

Hanako beschreibt die Entwicklungslinie von Prompting über Harness hin zu Loops und Graphs. Zentral ist die Unterscheidung zwischen reiner Instrumentierung (Reports) und echter Kontrolllogik: Wenn eine Überprüfung den Ablauf bei Fehlern nicht abbrechen kann, handelt es sich nicht um einen Loop. Zudem plädiert Hanako dafür, deterministische Schritte zwingend in Code-Nodes statt LLMs auszulagern und Abhängigkeiten im Workflow nur dann einzurichten, wenn Daten tatsächlich fließen.

Original-Post

Hanako

@hanakoxbt · 11. September 2026

Evals vs. Loops, clearly explained! evals are great, and everyone is building them right now. here is the ceiling: an eval runs after the work is done. it tells you the work was wrong. four steps ran. the second one was wrong. steps three and four ran on its output anyway, t.co/00zgM6bx0u t.co/fEPJmINlgv

89 Likes15 Antworten96 Lesezeichen8259 Aufrufe

Auf X ansehen
Ausgewählte Antworten (5)
  • @biscuitweb3 @hanakoxbt loops catch mistakes before they spread
  • @0xSlyth @hanakoxbt loops act evals report
  • @0xTimQ @hanakoxbt wow cool and amazing visual!
  • @rewind02 @hanakoxbt i needed that line
  • @MegaEvolvedFrog @hanakoxbt What did you use to generate the animation ?

Links und Tools aus diesem Beitrag

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • X-Post:Kirill

    Vom Agenten-Loop zum Graph Engineering: Deterministische KI-Architekturen

    Kirill beschreibt den Architekturwandel im Agenten-Design weg von fehleranfälligen Einzelschleifen (Loop Engineering) hin zu Graph Engineering. Der Erfolg komplexer KI-Systeme hänge nicht von der Modellgröße oder einer höheren Agentenzahl ab, sondern von deterministischer Strukturierung durch Knoten, Kanten, Verifizierer und Wissensgraphen.

    27.340Lesezeichen2,7 Mio.Aufrufe

    KI & AI· Meinung

  • X-Post:Mahax

    Von einfachen Prompts zu Loops und Graphs in KI-Workflows

    Unter Berufung auf Andrew Ng argumentiert Mahax, dass einfaches Prompting durch agentische Loops und Graphs abgelöst wird. Ein begleitender Leitfaden erläutert die Funktionsweise von Agents, iterativen Prüfschleifen und vernetzten Abhängigkeiten am Beispiel von Claude.

    11.832Lesezeichen1 Mio.Aufrufe

    KI & AI· Sammlung

  • Video

    Video:Sean‘s AI Stories

    Loop vs. Graph Engineering für KI-Agenten: Konzept und Praxis mit Waku Agent

    Sean Chen ordnet die Debatte um Loop- und Graph-Engineering in Agentensystemen ein. Anhand einer Entwicklungsleiter von Prompt- über Context-Engineering bis hin zu Loops und Graphs zeigt er, wann welche Architektur sinnvoll ist, und demonstriert die Umsetzung im Open-Source-Projekt Waku Agent.

    KI & AI· Anleitung

  • Video

    Video:AI LABS

    Graph Engineering für KI-Agenten: Parallele Workflows und Verifikation

    Graph Engineering löst lineare Schleifen (Loop Engineering) ab, indem Aufgaben auf mehrere parallel laufende Sub-Agenten verteilt werden. Der Kanal AI Labs erläutert die Struktur aus Knoten und Kanten, Risiken durch kaskadierende Fehler und konkrete Verifikationsstrategien mit Claude Code.

    KI & AI· Anleitung

  • X-Post:Mahax

    Graph Engineering: Warum Agenten-Workflows ohne Graphen scheitern

    Mahax zitiert Andrej Karpathy mit der Aussage, dass Prompting verschwinden und nur Graphen-Strukturen übrig bleiben werden. In einem verlinkten Leitfaden erklärt Mahax die Grundlagen des Graph Engineering mit Claude sowie Methoden zur Parallelisierung von AI-Workflows.

    2352Lesezeichen240.822Aufrufe

    KI & AI· Meinung

  • X-Post:nicco

    Graph Engineering statt Prompting: Warum Agenten-Workflows Graphstrukturen brauchen

    Ein Beitrag von nicco greift Aussagen von Andrej Karpathy auf, wonach Prompting nur eine Übergangsstufe war und Graph-Architekturen die Zukunft von Agenten-Systemen bilden. Ergänzt wird dies durch einen Leitfaden von seeco zur Ablösung linearer Agenten-Ketten durch explizite Graphen.

    529Lesezeichen58.536Aufrufe

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.