Messung von Code-Slop: Warum funktionierender KI-Code oft schlechter Code ist

X-PostPi (@pidotdev) / Sebastian BayeForschung

Sebastian Baye (Earendil) untersucht in einem Blogbeitrag, wie sich die mangelhafte Qualität und Aufblähung von KI-generiertem Code ('Sloppiness') quantifizieren lässt. Obwohl LLMs formal korrekten und testbaren Code liefern, verdoppeln sie im Schnitt strukturelle Erosions- und Verbositätswerte im Vergleich zu menschlichen Entwicklern.

Das Wichtigste

  1. LLMs erzeugen funktionierenden Code, der Tests besteht, neigen jedoch zu überflüssigen Abstraktionen, Duplikaten und stark steigenden Zeilenzahlen (LOC).
  2. LLMs als Qualitätsprüfer ('AI as a judge') versagen oft: 1-10-Bewertungen ähneln Zufallszahlen, und Präferenzen bei A/B-Vergleichen kippen teils schon durch einfaches Umbenennen.
  3. Menschliche Begutachtung liefert verlässliche Urteile über Lesbarkeit, skaliert jedoch weder für KI-Training noch für breite Benchmarks.
  4. Das Benchmark SlopCodeBench nutzt zwei messbare Kriterien: Verbosity (mittels AST-Grep und Codeklonen) sowie Erosion (Anteil der Code-Masse in Funktionen mit zyklomatischer Komplexität über 10).
  5. In Benchmarks war Agenten-Code rund doppelt so verbos (0,33 vs. 0,15) und doppelt so stark erodiert (0,68 vs. 0,31) wie etablierte menschliche Repositories.

Warum das relevant ist

Wenn KI-Modelle Millionen Codezeilen in kurzer Zeit generieren, verlagert sich das Kernproblem von der reinen Lösbarkeit einer Aufgabe hin zur Beherrschbarkeit des Codes. Verliert das Team durch aufgeblähten Code die Übersicht, scheitern auf Dauer nicht nur menschliche Entwickler, sondern auch nachfolgende KI-Agenten im iterativen Entwicklungszyklus.

Einordnung

Baye kritisiert die gegenwärtige KI-Branche als stark 'Vibes-basiert' und fordert quantitative Messmethoden für Codequalität. Die bloße Zunahme von Codezeilen (LOC) dient zwar als schneller Indikator, verliert jedoch nach Goodharts Gesetz ihren Nutzen, sobald Modelle darauf optimiert werden. Mit den Metriken Verbosity und Erosion aus SlopCodeBench liegt nun ein mathematischer Ansatz vor, der das Risiko übermäßiger Komplexität und Redundanz in agentenbasierten Projekten objektiv nachweist und belegt, warum isolierte Benchmarks reale Arbeitsabläufe verfehlen können.

Original-Post

Pi

@pidotdev · 11. September 2026

Read “If code is solved, what now?: Measuring the sloppiness of code” t.co/dJpIRripSQ

104 Likes3 Antworten136 Lesezeichen6223 Aufrufe

Auf X ansehen
Weitere Posts im Thread (1)
  1. When code is abundant quality becomes the differentiator, but what is good code? New blog post from Earendil engineer @SebastianBaye on why quantifying the ‘sloppiness’ of code is difficult, which eval methods don’t work well, and what metrics matter. Link to the post below t.co/Zx2DwK2KQ6
Ausgewählte Antworten (5)
  • @Everlier @pidotdev @SebastianBaye We need to talk more about this. More is not better. Simple is not easy.
  • @justynclark @pidotdev @SebastianBaye What's more cringe is the amount of AI generated comments on this thread. Your em dashes and non-ASCII characters are a dead giveaway. You are perpetuating slop, unrelated to code.
  • @mindfultime_ @pidotdev @SebastianBaye One indicator I use is CRAP , and also AST to see the depth of the code being written. I feel crap is a good way to capture the cc with unit test . It’s a good idea on the unnecessary complexity that ai provides
  • @geminixiang @Everlier @pidotdev @SebastianBaye Simple useful is hard.
  • @yandt888 @pidotdev @SebastianBaye agent 一天塞几十个 PR 时,「好代码」很难打分。改动面、失败复现、审不过的次数,比抽象草率分更管用。

Links und Tools aus diesem Beitrag

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Sebastian

    Messung von Code-Sloppiness bei KI-generierter Software

    Sebastian von Earendil untersucht Methoden zur quantitativen Erfassung von minderwertigem, aufgeblähtem Code (Slop), den Sprachmodelle erzeugen. Obwohl LLMs formal korrekten Code schreiben, verdoppeln sie im Vergleich zu menschlichem Code oft Redundanz und strukturelle Erosion. Zudem scheitern Agenten in iterativen Benchmarks zunehmend an ihren eigenen Fehlentscheidungen.

    KI & AI· Forschung

  • Artikel:The Cognition Team

    Produktivitätsmessung autonomer KI-Entwickler: Cognitions Ansatz für Devin

    Cognition stellt ein automatisiertes System vor, das den tatsächlichen Wert von KI-Programmiersitzungen in produktiven Entwicklerstunden beziffert. Da Token-Verbrauch und reine Codezeilen schlechte Indikatoren für echten Ertrag sind, analysiert ein separater Agent die Arbeitsprotokolle von Devin, filtert unproduktive Sitzungen heraus und schätzt den menschlichen Zeitaufwand konservativ ab.

    KI & AI· Forschung

  • X-Post:Juampi

    Übersicht von Anti-Slop-Skills für KI-gestützte Code-Bereinigung

    Juampi stellt eine kuratierte Liste von Skills für KI-Codierungsassistenten vor, die darauf abzielen, minderwertigen oder überflüssigen KI-generierten Code («Slop») zu erkennen und zu bereinigen.

    3329Lesezeichen175.570Aufrufe

    KI & AI· Sammlung

  • Repository:TinyFrontier/anti-slop-py

    anti-slop-py: Python-Linter gegen Typ-Umgehungen durch KI-Agenten

    anti-slop-py ist ein eigenständiger Python-Linter ohne externe Abhängigkeiten, der typische Ausweichmuster von KI-Coding-Agenten in Typensystemen aufspürt. Er verbietet Notlösungen wie Any-Typen, unkommentierte Type-Ignores oder kaskadierende Casts, mit denen Agenten Type-Checker austricksen.

    5SternePython

    KI & AI· Tool

  • X-Post:Tech with Mak

    Ponytail: Weniger Code durch Wiederverwendung bei KI-Coding-Agents

    Das Open-Source-Projekt Ponytail trimmt KI-Coding-Agents darauf, vorhandenen Code, Standardbibliotheken und bestehende Abhängigkeiten zu nutzen, statt ungefiltert neuen Code zu generieren. Laut Entwickler Tech with Mak reduziert das Tool den generierten Code im Schnitt um 54 Prozent.

    1875Lesezeichen149.333Aufrufe

    KI & AI· Tool

  • Link:The Cognition Team

    FrontierCode: Neuer Benchmark für Merge-Fähigkeit von KI-Code

    Cognition hat mit FrontierCode einen Benchmark und ein Leaderboard veröffentlicht, das bewertet, ob von KI-Modellen erstellte Pull Requests von Open-Source-Maintainern tatsächlich gemergt werden würden. Die Bewertung stützt sich auf Unit-Tests, Verifizierer und praxisnahe Rubriken von Maintainern.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.