Chatbot Arena + Rangliste für Large Language Models

LinkSammlung

OpenLM.ai präsentiert mit Chatbot Arena + ein kombiniertes Benchmark-Leaderboard für Sprachmodelle. Die Rangliste stützt sich auf agentengesteuerte Duelle mit LLM-as-a-Judge-Elo-Bewertungen, den Artificial Analysis Intelligence Index (AAII) und den ARC-AGI v2 Benchmark.

Das Wichtigste

  1. Claude Fable 5.1 von Anthropic und GPT-6 Astra von OpenAI teilen sich den Spitzenplatz mit einem Arena-Elo-Wert von 1520.
  2. Im ARC-AGI-v2-Benchmark zur Messung fluider Intelligenz erzielt GPT-6 Astra mit 95 Punkten das höchste Einzelergebnis unter den Spitzenmodellen (Claude Fable 5.1: 90 Punkte).
  3. Die Bewertung kombiniert drei Komponenten: Arena + (Agenten-basierte Modell-Kämpfe), den AAII-Index über 10 anspruchsvolle Tests sowie ARC-AGI v2.
  4. Zu den bestplatzierten Open-Source- beziehungsweise MIT-lizenzierten Modellen zählen GLM-5.3 (Elo 1505) und DeepSeek-V4-Pro (Elo 1502).
  5. Das Feld der führenden Anbieter umfasst Modelle von Anthropic, OpenAI, xAI, Meta, Moonshot, Alibaba, Google, Z.ai und DeepSeek.

Warum das relevant ist

Die Konsolidierung von automatisierten LLM-as-a-Judge-Evaluationen mit Standards wie ARC-AGI und AAII bietet Entwicklern und Unternehmen eine differenziertere Orientierung bei der Modellauswahl für Coding, Vision und komplexe Reasoning-Aufgaben.

Einordnung

Das Leaderboard veranschaulicht den intensiven Wettbewerb an der Spitze der KI-Modelle, bei dem Anthropic und OpenAI im Arena-Elo gleichauf liegen, sich jedoch in Teilbereichen wie ARC-AGI unterscheiden. Zugleich zeigt die Präsenz von Modellen mit MIT- und Apache-2.0-Lizenzen (wie GLM-5.3 und DeepSeek-V4-Pro) im Bereich oberhalb von 1500 Elo-Punkten, dass offene und chinesische Modelle weiterhin direkten Anschluss an proprietäre Spitzenreiter halten.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:clickrank.ai

    LLM Leaderboards 2026: Benchmarks, Methoden und Modelle im Vergleich

    Ein Leitfaden von ClickRank AI analysiert den Stand der LLM-Ranglisten im Jahr 2026. Da traditionelle Tests wie MMLU und HumanEval übersättigt sind, stützen sich Vergleiche heute auf anspruchsvollere Benchmarks, menschliche Blindvergleiche und kombinierte Metriken aus Leistung, Geschwindigkeit und Token-Preisen.

    KI & AI· Sammlung

  • Link:Artificial Analysis

    Artificial Analysis Intelligence Index v4.2

    Artificial Analysis fasst in Version 4.2 seines Intelligence Index zehn Benchmarks aus den Bereichen Mathematik, Wissenschaft, Coding und Reasoning zusammen. Claude Fable 5.1 führt das Ranking mit 57 Punkten an, gefolgt von GPT-6 Astra mit 55 Punkten.

    KI & AI· Sammlung

  • Link:spark-arena.com

    Spark Arena: LLM-Performance-Leaderboard auf NVIDIA DGX Spark

    Spark Arena bietet ein öffentliches Leaderboard zum Leistungsvergleich von Large Language Models auf NVIDIA DGX Spark Hardware. Die Plattform nutzt Open-Source-Tools, um Benchmarks über verschiedene Runtime-Engines wie vLLM, SGLang, TensorRT-LLM und llama.cpp hinweg transparent abzubilden.

    KI & AI· Tool

  • Link:StackAI

    StackAI LLM Leaderboard: Vergleich von Modellen nach Benchmarks und Kosten

    StackAI bietet ein interaktives Dashboard, das Sprachmodelle anhand von Benchmarks, Durchsatz, Kontextfenstern und Kosten vergleicht. Das Tool fasst Leistungskennzahlen wie MMLU, HumanEval+, GPQA, SWE-Bench und GSM8K zusammen und ermöglicht den direkten Modellvergleich.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.