Link:hkinsley.com
Terminal-Bench v2.1: Warum das Agent-Harness für LLM-Benchmarks entscheidend ist
Neue Auswertungen auf Terminal-Bench v2.1 zeigen, dass die Wahl des Agent-Harnesses die Modellleistung drastisch verändert: DeepSeek-V4-Flash 0731 springt unter dem OMP-Harness von 49,4 % auf 71,9 % und schließt damit nahezu zur quantisierten Spitzenvariante von GLM 5.2 (73,0 %) auf.
Aus Video: Weekly AI Updates: Model Releases, Agent Harnesses, and Developer Tooling (August 2026)

