StackAI LLM Leaderboard: Vergleich von Modellen nach Benchmarks und Kosten

LinkStackAITool

StackAI bietet ein interaktives Dashboard, das Sprachmodelle anhand von Benchmarks, Durchsatz, Kontextfenstern und Kosten vergleicht. Das Tool fasst Leistungskennzahlen wie MMLU, HumanEval+, GPQA, SWE-Bench und GSM8K zusammen und ermöglicht den direkten Modellvergleich.

Das Wichtigste

  1. Benchmarking verschiedener Dimensionen wie Allgemeinwissen (MMLU), Programmierung (HumanEval+, SWE) und logisches Denken (GPQA, GSM8K).
  2. Spitzenreiter beim MMLU-Score sind Claude 4.7 Opus (92,8 %) vor GPT-5.5 (92,4 %) und Gemini 3 Pro (89,8 %).
  3. Höchster Durchsatz bei Inceptions Mercury 2 mit 870,9 Tokens pro Sekunde, gefolgt von Granite 4.0 Small (IBM) mit 448,8 Tokens/s.
  4. Günstigste Modelle nach Token-Kosten sind Gemma 3n E4B (effektiv 0,037 $/M) und Llama 3.2 1B Instruct (0,053 $/M).
  5. Längste Kontextfenster bieten xAIs Grok-Modelle (Grok 4 Fast, Heavy, 4.1, 4.20) mit jeweils 2.000.000 Tokens, gefolgt von GPT 4.1 mit 1.280.000 Tokens.

Warum das relevant ist

Bei der Auswahl von Sprachmodellen für Produktionsumgebungen müssen Entwicklungsteams Kompromisse zwischen Benchmark-Genauigkeit, Token-Kosten, Latenz und Kontextlänge eingehen. Dashboards wie dieses liefern aggregierte Kennzahlen zur schnellen Orientierung.

Einordnung

Das Leaderboard verknüpft gängige Benchmarks direkt mit operativen Faktoren wie Durchsatz und Preisen. Die Daten veranschaulichen die Spreizung zwischen extrem schnellen, schlanken Modellen (wie Mercury 2 oder Granite 4.0 Small) und hochkomplexen Flaggschiff-Modellen für anspruchsvolle Reasoning-Aufgaben.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:clickrank.ai

    LLM Leaderboards 2026: Benchmarks, Methoden und Modelle im Vergleich

    Ein Leitfaden von ClickRank AI analysiert den Stand der LLM-Ranglisten im Jahr 2026. Da traditionelle Tests wie MMLU und HumanEval übersättigt sind, stützen sich Vergleiche heute auf anspruchsvollere Benchmarks, menschliche Blindvergleiche und kombinierte Metriken aus Leistung, Geschwindigkeit und Token-Preisen.

    KI & AI· Sammlung

  • Link:Epoch AI

    Epoch AI stellt Dashboard für KI-Fähigkeiten und Benchmarks bereit

    Epoch AI bietet ein zentrales Dashboard, das Benchmark-Ergebnisse führender KI-Modelle sammelt und visualisiert. Die Plattform umfasst eigene Tests von Epoch AI sowie Daten externer Evaluierer zu Disziplinen wie Mathematik, Softwareentwicklung, Agenten und multimodalen Aufgaben.

    KI & AI· Sammlung

  • Link:spark-arena.com

    Spark Arena: LLM-Performance-Leaderboard auf NVIDIA DGX Spark

    Spark Arena bietet ein öffentliches Leaderboard zum Leistungsvergleich von Large Language Models auf NVIDIA DGX Spark Hardware. Die Plattform nutzt Open-Source-Tools, um Benchmarks über verschiedene Runtime-Engines wie vLLM, SGLang, TensorRT-LLM und llama.cpp hinweg transparent abzubilden.

    KI & AI· Tool

  • Link:artificialanalysis.ai

    Artificial Analysis: Unabhängige Benchmarks für KI-Modelle und API-Anbieter

    Artificial Analysis bietet unabhängige Leistungs- und Kostenvergleiche für Sprachmodelle, Coding-Agenten und multimodale APIs. Mit dem Update auf den Intelligence Index v4.2 wurden die Testmethoden und Gewichtungen für aktuelle Frontier-Modelle angepasst.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.