Messung von Code-Sloppiness bei KI-generierter Software

ArtikelSebastianForschung

Sebastian von Earendil untersucht Methoden zur quantitativen Erfassung von minderwertigem, aufgeblähtem Code (Slop), den Sprachmodelle erzeugen. Obwohl LLMs formal korrekten Code schreiben, verdoppeln sie im Vergleich zu menschlichem Code oft Redundanz und strukturelle Erosion. Zudem scheitern Agenten in iterativen Benchmarks zunehmend an ihren eigenen Fehlentscheidungen.

Das Wichtigste

  1. LLMs erzeugen hochgradig verifizierbaren und formal korrekten Code, führen aber oft zu unnötigen Abstraktionen, Codeduplikaten und explodierenden Zeilenzahlen (LOC).
  2. Gängige Evaluationsansätze wie 'AI as a judge' erweisen sich laut Autor als unzuverlässig und instabil.
  3. Das Paper SlopCodeBench definiert zwei messbare Metriken: Verbosity (unnötige Zeilen via AST-Grep und Clone-Erkennung geteilt durch LOC) und Erosion (Anteil komplexer Funktionen mit zyklomatischer Komplexität über 10).
  4. Agentengenerierter Code weist im Schnitt eine doppelt so hohe Verbosity (0,33 vs. 0,15) und Erosion (0,68 vs. 0,31) auf wie etablierte menschliche Repositories.
  5. In iterativen Tests mit Context-Reset zwischen Checkpoints sank die strikte Erfolgsrate selbst bei Spitzenmodellen wie GPT 5.6 sol xhigh auf 0 %, weil sich Fehlentscheidungen kaskadierend anhäufen.

Warum das relevant ist

Das unreflektierte Generieren großer Code-Mengen gefährdet die Wartbarkeit von Softwareprojekten. Wenn selbst spezialisierte Coding-Agenten mit zunehmendem 'Slop' überfordert sind, verlieren Entwicklungsteams den Überblick, weshalb quantitative Qualitätsmetriken jenseits reiner Test-Pass-Raten essenziell werden.

Einordnung

Der Beitrag beleuchtet eine zentrale Lücke aktueller KI-Benchmarks: Bisherige Tests prüfen meist nur, ob Code einmalig unit-getestet durchläuft, ignorieren jedoch Softwarearchitektur und Wartbarkeit. Anhand der SlopCodeBench-Metriken Verbosity und Erosion quantifiziert der Autor, wie stark KI-Systeme Codebasen strukturell erodieren lassen. Die Beobachtung, dass Agenten in mehrstufigen Iterationen mit Context-Resets komplett scheitern, entkräftet die Annahme, KI könne den von ihr produzierten Müll dauerhaft selbst verwalten.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • X-Post:Pi (@pidotdev) / Sebastian Baye

    Messung von Code-Slop: Warum funktionierender KI-Code oft schlechter Code ist

    Sebastian Baye (Earendil) untersucht in einem Blogbeitrag, wie sich die mangelhafte Qualität und Aufblähung von KI-generiertem Code ('Sloppiness') quantifizieren lässt. Obwohl LLMs formal korrekten und testbaren Code liefern, verdoppeln sie im Schnitt strukturelle Erosions- und Verbositätswerte im Vergleich zu menschlichen Entwicklern.

    136Lesezeichen6223Aufrufe

    KI & AI· Forschung

  • Artikel:The Cognition Team

    Produktivitätsmessung autonomer KI-Entwickler: Cognitions Ansatz für Devin

    Cognition stellt ein automatisiertes System vor, das den tatsächlichen Wert von KI-Programmiersitzungen in produktiven Entwicklerstunden beziffert. Da Token-Verbrauch und reine Codezeilen schlechte Indikatoren für echten Ertrag sind, analysiert ein separater Agent die Arbeitsprotokolle von Devin, filtert unproduktive Sitzungen heraus und schätzt den menschlichen Zeitaufwand konservativ ab.

    KI & AI· Forschung

  • Repository:TinyFrontier/anti-slop-py

    anti-slop-py: Python-Linter gegen Typ-Umgehungen durch KI-Agenten

    anti-slop-py ist ein eigenständiger Python-Linter ohne externe Abhängigkeiten, der typische Ausweichmuster von KI-Coding-Agenten in Typensystemen aufspürt. Er verbietet Notlösungen wie Any-Typen, unkommentierte Type-Ignores oder kaskadierende Casts, mit denen Agenten Type-Checker austricksen.

    5SternePython

    KI & AI· Tool

  • Link:The Cognition Team

    FrontierCode: Neuer Benchmark für Merge-Fähigkeit von KI-Code

    Cognition hat mit FrontierCode einen Benchmark und ein Leaderboard veröffentlicht, das bewertet, ob von KI-Modellen erstellte Pull Requests von Open-Source-Maintainern tatsächlich gemergt werden würden. Die Bewertung stützt sich auf Unit-Tests, Verifizierer und praxisnahe Rubriken von Maintainern.

    KI & AI· Sammlung

  • Video

    Video:Edward Donner

    Der Agentic Development Life Cycle: Softwareentwicklung im Zeitalter von Coding-Agents

    Edward Donner stellt den 'Agentic Development Life Cycle' (ADLC) als Weiterentwicklung des klassischen SDLC vor. Anhand seines 40.000 Zeilen umfassenden Testbed-Repositorys 'Bench' gliedert er den Entwicklungsprozess mit KI-Coding-Agents in drei Kernbereiche: Harness, Handoffs und Humans.

    KI & AI· Anleitung

  • X-Post:Tech with Mak

    Ponytail: Weniger Code durch Wiederverwendung bei KI-Coding-Agents

    Das Open-Source-Projekt Ponytail trimmt KI-Coding-Agents darauf, vorhandenen Code, Standardbibliotheken und bestehende Abhängigkeiten zu nutzen, statt ungefiltert neuen Code zu generieren. Laut Entwickler Tech with Mak reduziert das Tool den generierten Code im Schnitt um 54 Prozent.

    1875Lesezeichen149.333Aufrufe

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.