FrontierCode: Neuer Benchmark für Merge-Fähigkeit von KI-Code

LinkThe Cognition TeamSammlung

Cognition hat mit FrontierCode einen Benchmark und ein Leaderboard veröffentlicht, das bewertet, ob von KI-Modellen erstellte Pull Requests von Open-Source-Maintainern tatsächlich gemergt werden würden. Die Bewertung stützt sich auf Unit-Tests, Verifizierer und praxisnahe Rubriken von Maintainern.

Das Wichtigste

  1. FrontierCode misst die Merge-Fähigkeit von PRs anhand von Korrektheit, Testqualität, Scope-Disziplin, Style und Einhaltung von Repository-Standards.
  2. Mehr als 20 Open-Source-Maintainer erstellten die Aufgaben mit einem Aufwand von über 40 Stunden pro Task.
  3. Ein mehrstufiger Review- und Adversarial-Testing-Prozess sichert die subjektiven Rubrik-Bewertungen ab, inklusive manueller Prüfung durch Cognition-Forscher.
  4. Modelle dürfen das Internet für Dokumentation und Fehlersuche nutzen; Zugriffe auf lösungshaltige Quellen wie Original-PRs führen zu einer Wertung von null Punkten.
  5. Die Version FrontierCode 1.1 verfeinerte die Erkennung unfairer Internetnutzung, auditierte Blocker-Kriterien und strich das Diamond-Subset.
  6. Das Leaderboard umfasst aktuelle Modelle wie GPT-6 Astra, Gemini 3.8 Flash, GLM 5.3, Claude Fable 5.1 und Grok 4.6.

Warum das relevant ist

Bestehende Coding-Benchmarks prüfen häufig nur, ob isolierte Unit-Tests grün werden. FrontierCode rückt die praktische Akzeptanz im Repository-Alltag in den Mittelpunkt, einschließlich Codestil, Testabdeckung und Dokumentationsdisziplin.

Einordnung

Cognition adressiert mit FrontierCode die Lücke zwischen synthetischen Code-Metriken und realistischen Anforderungen in Softwareprojekten. Durch die Einbindung von Maintainern und die Sanktionierung von Daten-Leaks (wie dem Kopieren bestehender PR-Lösungen) entsteht ein anspruchsvolles Testfeld für moderne Agenten und Entwicklungsmodelle.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:The Cognition Team

    Produktivitätsmessung autonomer KI-Entwickler: Cognitions Ansatz für Devin

    Cognition stellt ein automatisiertes System vor, das den tatsächlichen Wert von KI-Programmiersitzungen in produktiven Entwicklerstunden beziffert. Da Token-Verbrauch und reine Codezeilen schlechte Indikatoren für echten Ertrag sind, analysiert ein separater Agent die Arbeitsprotokolle von Devin, filtert unproduktive Sitzungen heraus und schätzt den menschlichen Zeitaufwand konservativ ab.

    KI & AI· Forschung

  • Video

    Video:LangChain

    Cognition-Präsident Russell Kaplan über Coding-Agenten, Benchmarks und Modell-Routing

    Im Gespräch mit Harrison Chase (LangChain) erläutert Russell Kaplan, Präsident von Cognition, die Entwicklung des KI-Softwareentwicklers Devin. Er beschreibt den Wandel von reinen Modell-Fähigkeiten hin zu Kosten- und Latenzoptimierung (Intelligenzsättigung), neue Bewertungsstandards wie FrontierCode und die Architektur hinter Devin Fusion.

    KI & AI· Diskussion

  • Link:Epoch AI

    Epoch AI stellt Dashboard für KI-Fähigkeiten und Benchmarks bereit

    Epoch AI bietet ein zentrales Dashboard, das Benchmark-Ergebnisse führender KI-Modelle sammelt und visualisiert. Die Plattform umfasst eigene Tests von Epoch AI sowie Daten externer Evaluierer zu Disziplinen wie Mathematik, Softwareentwicklung, Agenten und multimodalen Aufgaben.

    KI & AI· Sammlung

  • Artikel:The Cognition Team

    Devin Review: Cognition stellt KI-gestütztes Tool für Code-Reviews vor

    Cognition hat Devin Review veröffentlicht, ein KI-Werkzeug zur Prüfung von Pull Requests. Das Tool soll Entwickler dabei unterstützen, immer größere und komplexere Code-Diffs zu bewältigen, die sowohl von Menschen als auch von Coding Agents erzeugt werden.

    KI & AI· Ankündigung

  • Link:Cognition

    Cognition: Plattform und Entwicklungsstand des KI-Software-Entwicklers Devin

    Cognition präsentiert Devin als autonomen Software-Entwickler, der Programmcode eigenständig plant, schreibt, testet und bereitstellt. Das System arbeitet direkt in bestehenden Repositories und Toolchains von Unternehmen. Ziel ist es, menschliche Entwickler von Routineaufgaben zu entlasten, damit sie sich auf Systemarchitektur und Problemlösung konzentrieren können.

    KI & AI· Tool

  • Artikel:The Cognition Team

    Devin Fusion: Multi-Modell-Architektur senkt Entwicklungskosten um bis zu 60 Prozent

    Cognition stellt Devin Fusion vor, ein System zur dynamischen Verteilung von Programmieraufgaben auf mehrere KI-Modelle. Durch die Kombination eines führenden Frontier-Modells mit einem günstigeren Sidekick-Agenten und dynamischem Routing während der Sitzung bleiben Qualität und Problemlösungskompetenz auf Spitzenniveau, während die Ausführungskosten um bis zu 60 Prozent sinken.

    KI & AI· Ankündigung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.