LLM Leaderboard 2026 von Onyx: Modell-Rankings, Benchmarks und API-Preise

LinkRoshan DesaiSammlung

Onyx vergleicht in seinem LLM Leaderboard 2026 führende Open-Source- und Closed-Source-Modelle anhand von Benchmarks für Coding, Reasoning, Mathematik und agentische Aufgaben sowie deren API-Preisen.

Das Wichtigste

  1. Tier-S-Modelle: Claude Fable 5 (Anthropic), GPT-5.6 Sol (OpenAI) und Kimi K3 mit 2,8 Billionen Parametern (Moonshot) führen das Gesamt-Ranking an.
  2. Umfassende Benchmark-Erfassung: Die Modelle werden u. a. auf SWE-bench Verified, Terminal-Bench 2.1, LiveCodeBench, GPQA Diamond und Humanity's Last Exam (HLE) verglichen.
  3. Preis-Leistungs-Vergleich: Neben Benchmark-Werten führt die Übersicht API-Preise pro Million Input- und Output-Tokens auf, von budgetfreundlichen Modellen wie Step-3.5-Flash bis zu High-End-Modellen wie Claude Fable 5.
  4. Head-to-Head-Vergleich: Eine Gegenüberstellung ermöglicht den direkten Leistungsvergleich zweier ausgewählter Modelle über verschiedene Kategorien hinweg.

Warum das relevant ist

Entwickler und IT-Entscheidungsträger erhalten eine strukturierte Entscheidungshilfe, um das passende Sprachmodell basierend auf realen Leistungsdaten und operativen Token-Kosten auszuwählen.

Einordnung

Das Dashboard bündelt sowohl westliche Flaggschiff-Modelle (OpenAI, Anthropic, Google, Meta) als auch leistungsstarke asiatische Architekturen (DeepSeek, Moonshot, Zhipu AI, Stepfun). Durch die Einbeziehung komplexer Software-Engineering- und Terminal-Benchmarks (SWE-bench Pro, Terminal-Bench 2.1) reflektiert die Tabelle insbesondere Anforderungen für moderne AI-Agenten und Coding-Workflows.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:clickrank.ai

    LLM Leaderboards 2026: Benchmarks, Methoden und Modelle im Vergleich

    Ein Leitfaden von ClickRank AI analysiert den Stand der LLM-Ranglisten im Jahr 2026. Da traditionelle Tests wie MMLU und HumanEval übersättigt sind, stützen sich Vergleiche heute auf anspruchsvollere Benchmarks, menschliche Blindvergleiche und kombinierte Metriken aus Leistung, Geschwindigkeit und Token-Preisen.

    KI & AI· Sammlung

  • Link:StackAI

    StackAI LLM Leaderboard: Vergleich von Modellen nach Benchmarks und Kosten

    StackAI bietet ein interaktives Dashboard, das Sprachmodelle anhand von Benchmarks, Durchsatz, Kontextfenstern und Kosten vergleicht. Das Tool fasst Leistungskennzahlen wie MMLU, HumanEval+, GPQA, SWE-Bench und GSM8K zusammen und ermöglicht den direkten Modellvergleich.

    KI & AI· Tool

  • Link:artificialanalysis.ai

    Artificial Analysis: Unabhängige Benchmarks für KI-Modelle und API-Anbieter

    Artificial Analysis bietet unabhängige Leistungs- und Kostenvergleiche für Sprachmodelle, Coding-Agenten und multimodale APIs. Mit dem Update auf den Intelligence Index v4.2 wurden die Testmethoden und Gewichtungen für aktuelle Frontier-Modelle angepasst.

    KI & AI· Tool

  • Link:spark-arena.com

    Spark Arena: LLM-Performance-Leaderboard auf NVIDIA DGX Spark

    Spark Arena bietet ein öffentliches Leaderboard zum Leistungsvergleich von Large Language Models auf NVIDIA DGX Spark Hardware. Die Plattform nutzt Open-Source-Tools, um Benchmarks über verschiedene Runtime-Engines wie vLLM, SGLang, TensorRT-LLM und llama.cpp hinweg transparent abzubilden.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.