Link:The Cognition Team
FrontierCode: Neuer Benchmark für Merge-Fähigkeit von KI-Code
Cognition hat mit FrontierCode einen Benchmark und ein Leaderboard veröffentlicht, das bewertet, ob von KI-Modellen erstellte Pull Requests von Open-Source-Maintainern tatsächlich gemergt werden würden. Die Bewertung stützt sich auf Unit-Tests, Verifizierer und praxisnahe Rubriken von Maintainern.
Aus Video: Cognition President Russell Kaplan on Coding Agents, Benchmarks, and Model Routing