Vellum LLM Leaderboard: Benchmarks, Durchsatz und Modellkosten im Überblick

LinkVellumSammlung

Das LLM-Leaderboard von Vellum vergleicht aktuelle Sprachmodelle über standardisierte Benchmarks hinweg und führt Metriken zu Durchsatz, Latenz sowie Token-Kosten auf.

Das Wichtigste

  1. Claude Fable 5.1 und Claude Mythos 5.1 führen das Gesamtranking in 'Humanity's Last Exam' mit jeweils 65 % an.
  2. Claude Sonnet 5 erreicht im Reasoning-Benchmark GPQA Diamond 96,2 %, knapp vor GPT-6 Astra mit 96 %.
  3. Im agentenbasierten Coden (SWE Bench) belegt GPT-5.6 Sol mit 96,2 % den ersten Platz vor Claude Mythos 5 (95,5 %).
  4. Llama 4 Scout erzielt mit 2.600 Tokens/Sekunde den höchsten Durchsatz, während GPT-5.3 Codex die geringste Latenz (Time to First Token: 0,003 s) verzeichnet.
  5. Günstigste Modelle bei den Abfragekosten sind unter anderem Nova Micro ($0,04 Input / $0,14 Output pro 1M Tokens) und Gemini 1.5 Flash ($0,075 / $0,3).

Warum das relevant ist

Für Architekten und Entwicklerteams bietet die Übersicht eine datengestützte Entscheidungsgrundlage, um je nach Anforderung – Reasoning, Coding-Agenten, Automatisierung oder reine Kosten- und Latenzoptimierung – das passende Modell auszuwählen.

Einordnung

Die Daten zeigen eine klare Spezialisierung der Modellanbieter: Während Anthropic bei allgemeinem Reasoning und UI-Steuerung (OSWorld) dominiert, teilen sich OpenAI und Anthropic Spitzenplätze bei agentischem Code und Web-Browsing. Zugleich zeigen Nischen- und Flash-Modelle wie GLM-5.3-Flash Spitzenleistungen in spezifischen Workflows (AutoBench) bei gleichzeitig geringeren Kosten.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:clickrank.ai

    LLM Leaderboards 2026: Benchmarks, Methoden und Modelle im Vergleich

    Ein Leitfaden von ClickRank AI analysiert den Stand der LLM-Ranglisten im Jahr 2026. Da traditionelle Tests wie MMLU und HumanEval übersättigt sind, stützen sich Vergleiche heute auf anspruchsvollere Benchmarks, menschliche Blindvergleiche und kombinierte Metriken aus Leistung, Geschwindigkeit und Token-Preisen.

    KI & AI· Sammlung

  • Link:StackAI

    StackAI LLM Leaderboard: Vergleich von Modellen nach Benchmarks und Kosten

    StackAI bietet ein interaktives Dashboard, das Sprachmodelle anhand von Benchmarks, Durchsatz, Kontextfenstern und Kosten vergleicht. Das Tool fasst Leistungskennzahlen wie MMLU, HumanEval+, GPQA, SWE-Bench und GSM8K zusammen und ermöglicht den direkten Modellvergleich.

    KI & AI· Tool

  • X-Post:Guillermo Rauch

    DeepsecBench: GPT-6 Astra führt Vercels IT-Sicherheits-Benchmark an

    Laut Vercel-CEO Guillermo Rauch belegt OpenAI GPT-6 Astra den ersten Platz auf dem DeepsecBench für IT-Sicherheit. Das Modell löst Testaufgaben in knapp 50 Minuten, wofür der Vorgänger fast vier Stunden benötigte.

    180Lesezeichen81.077Aufrufe

    KI & AI· News

  • Link:artificialanalysis.ai

    Artificial Analysis: Unabhängige Benchmarks für KI-Modelle und API-Anbieter

    Artificial Analysis bietet unabhängige Leistungs- und Kostenvergleiche für Sprachmodelle, Coding-Agenten und multimodale APIs. Mit dem Update auf den Intelligence Index v4.2 wurden die Testmethoden und Gewichtungen für aktuelle Frontier-Modelle angepasst.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.