Terminal-Bench v2.1: Warum das Agent-Harness für LLM-Benchmarks entscheidend ist

LinkForschung

Neue Auswertungen auf Terminal-Bench v2.1 zeigen, dass die Wahl des Agent-Harnesses die Modellleistung drastisch verändert: DeepSeek-V4-Flash 0731 springt unter dem OMP-Harness von 49,4 % auf 71,9 % und schließt damit nahezu zur quantisierten Spitzenvariante von GLM 5.2 (73,0 %) auf.

Das Wichtigste

  1. Im Terminal-Bench v2.1 (89 Aufgaben) erreicht willfalco/GLM-5.2-EXL3-TR3-3.25bpw mit Standard-Harness 68,5 % (61/89) und klettert mit dem OMP-Harness auf 73,0 % (65/89).
  2. DeepSeek-V4-Flash 0731 verbessert sich durch OMP drastisch von 49,4 % (44/89) auf 71,9 % (64/89), womit sich die vom Hersteller angegebenen Benchmarkwerte erstmals unabhängig replizieren lassen.
  3. Bei der Decode-Geschwindigkeit liegt DSV4F-0731 mit 300 bis 400 tok/s rund 4,5-mal vor GLM 5.2 3.25 BPW (70 bis 80 tok/s) bei gleicher Host-Konfiguration via vLLM (TP=4).
  4. Der Leistungsgewinn unter OMP erfordert massiv mehr Token und Zeit: DSV4F verbraucht mit OMP pro gelöster Aufgabe schätzungsweise 5,33-mal mehr Token (~154K vs. ~62K).
  5. Das Hardware-Setup setzt auf vier RTX Pro 6K-Karten an einem PCIe-Gen-5-Switch mit Retimer und MCIO-Kabeln, um direkte P2P-Verbindungen unabhängig von der Mainboard-Generation zu gewährleisten.

Warum das relevant ist

Modellevaluationen bei Programmieraufgaben lassen sich nicht isoliert vom eingesetzten Harness und dem Test-Time-Compute betrachten. Ein Modell, das im einfachen Standard-Setup durchfällt, kann mit einem optimierten Agenten-Harness die Spitzenklasse erreichen – erkauft diesen Sprung jedoch mit vervielfachtem Token-Verbrauch.

Einordnung

Der Autor dokumentiert die Diskrepanz zwischen Hersteller-Benchmarks und unabhängiger Replikation, die oft auf spezifisch abgestimmten Harness-Umgebungen beruht. Während GLM 5.2 eine hohe inhärente Problemlösungskompetenz besitzt und bereits ohne starkes Harness solide abschneidet, entfaltet DSV4F-0731 sein volles Potenzial erst im Zusammenspiel mit OMP. Da DSV4F rund viereinhalbmal schneller generiert, kompensiert die hohe Durchsatzrate den zusätzlichen Token-Bedarf der Multi-Turn-Iterationen weitgehend.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:DeepInfra

    Die besten LLMs für OpenClaw im Praxiseinsatz

    Ein Leitfaden von DeepInfra vergleicht Modelle mit offenen Gewichten für den autonomen Agenten OpenClaw. Im Fokus stehen Kriterien wie zuverlässige Tool-Aufrufe, Kontextstabilität und reale Kosten pro Aufgabe.

    KI & AI· Sammlung

  • Artikel:Mehdi Allahyari

    Harness Engineering: Warum die Umgebung wichtiger ist als das LLM-Modell

    Nach Prompt- und Context-Engineering bildet Harness Engineering die dritte Phase im Bau autonomer KI-Systeme. Mehdi Allahyari beschreibt die Software-Infrastruktur um das Sprachmodell als entscheidenden Erfolgsfaktor für Zuverlässigkeit und Selbstkorrektur.

    KI & AI· Sammlung

  • Link:Z.ai

    Z.ai veröffentlicht GLM-5.1 mit Fokus auf Agentic Engineering

    Z.ai hat auf Hugging Face das Modell GLM-5.1 unter MIT-Lizenz bereitgestellt. Das MoE-Modell mit 754 Milliarden Parametern zielt auf anspruchsvolle Programmier- und Agenten-Workflows ab und soll über lange Sessions hinweg stabil arbeiten.

    KI & AI· Sammlung

  • Link:clickrank.ai

    LLM Leaderboards 2026: Benchmarks, Methoden und Modelle im Vergleich

    Ein Leitfaden von ClickRank AI analysiert den Stand der LLM-Ranglisten im Jahr 2026. Da traditionelle Tests wie MMLU und HumanEval übersättigt sind, stützen sich Vergleiche heute auf anspruchsvollere Benchmarks, menschliche Blindvergleiche und kombinierte Metriken aus Leistung, Geschwindigkeit und Token-Preisen.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.