Grok 4.6 im Benchmark von Artificial Analysis: Spitzenfeld-Leistung bei geringeren Kosten

ArtikelForschung

Artificial Analysis hat Grok 4.6 von SpaceXAI evaluiert. Das Modell erzielt 61 Punkte im Intelligence Index, schließt damit zu GPT-5.6 Sol auf und liegt knapp hinter Claude Opus 5 und Claude Fable 5. Besonders stark schneidet das Modell bei agentischen Aufgaben und der Kosteneffizienz ab.

Das Wichtigste

  1. Erreicht 61 Punkte im Intelligence Index (+5 gegenüber Grok 4.5) und liegt damit gleichauf mit GPT-5.6 Sol (max) sowie hinter Claude Opus 5 (63) und Claude Fable 5 (62).
  2. Starke Ergebnisse bei Agenten-Benchmarks: GDPval-AA v2 Elo von 1753, 50,7 % bei 𝜏³-Banking und 88,4 % auf Terminal-Bench v2.1.
  3. Unveränderte API-Preise von 2 $ / 6 $ pro Million Input-/Output-Tokens (Cache-Hits bei 0,5 $ nach zuvor 0,3 $), was deutlich unter Claude Opus 5 (5 $/25 $) und GPT-5.6 Sol (5 $/30 $) liegt.
  4. Hohe Effizienz bei komplexen Aufgaben: Auf AA-Briefcase (Elo 1577) benötigt Grok 4.6 durchschnittlich rund 53 Turns und 0,5 Milliarden Input-Tokens gegenüber rund 103 Turns und 2,0 Milliarden Input-Tokens bei Claude Opus 5 (max).
  5. Das Kontextfenster bleibt unverändert bei 500.000 Tokens.

Warum das relevant ist

Für Entwickler und Unternehmen, die aufwändige Multi-Turn- und Agenten-Workflows betreiben, spielen Output-Kosten und Turn-Effizienz eine zentrale Rolle. Grok 4.6 bietet Frontier-Leistung zu einem Bruchteil der Token-Kosten von vergleichbaren Modellen von OpenAI und Anthropic.

Einordnung

Artificial Analysis hebt hervor, dass Grok 4.6 nicht nur über reine Tokenpreise punktet, sondern insbesondere durch Turn-Effizienz bei 'Long-Horizon'-Aufgaben: Da das Modell Aufgaben in der Hälfte der Züge und mit einem Viertel der Input-Tokens im Vergleich zu Claude Opus 5 löst, verstärkt sich der finanzielle Vorteil bei akkumuliertem Kontext drastisch. Es platziert sich damit auf der Pareto-Grenze aus Kosten pro Aufgabe und Intelligenz.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:x.ai

    SpaceXAI stellt Grok 4.6 vor

    SpaceXAI hat Grok 4.6 veröffentlicht. Das Modell fokussiert sich auf langlebige Agenten sowie interaktive und visuelle Aufgaben und ist ab sofort via API, Cursor und Grok Build verfügbar.

    KI & AI· Ankündigung

  • Link:artificialanalysis.ai

    Artificial Analysis: Unabhängige Benchmarks für KI-Modelle und API-Anbieter

    Artificial Analysis bietet unabhängige Leistungs- und Kostenvergleiche für Sprachmodelle, Coding-Agenten und multimodale APIs. Mit dem Update auf den Intelligence Index v4.2 wurden die Testmethoden und Gewichtungen für aktuelle Frontier-Modelle angepasst.

    KI & AI· Tool

  • Link:Artificial Analysis

    Artificial Analysis Intelligence Index v4.2

    Artificial Analysis fasst in Version 4.2 seines Intelligence Index zehn Benchmarks aus den Bereichen Mathematik, Wissenschaft, Coding und Reasoning zusammen. Claude Fable 5.1 führt das Ranking mit 57 Punkten an, gefolgt von GPT-6 Astra mit 55 Punkten.

    KI & AI· Sammlung

  • Artikel:Anthropic

    Anthropic stellt Claude Opus 4.6 mit 1M-Kontextfenster vor

    Anthropic hat Claude Opus 4.6 veröffentlicht. Das Modell bietet verbesserte Programmier- und Planungsfähigkeiten, ein 1-Million-Token-Kontextfenster in der Beta und neue Steuerungsoptionen wie adaptive Thinking und Effort-Parameter bei unveränderten Token-Preisen.

    KI & AI· Ankündigung

  • Artikel:xAI

    xAI veröffentlicht Grok 4.1

    xAI hat das Modell Grok 4.1 für grok.com, die Plattform X sowie die mobilen Apps freigegeben. Neben Verbesserungen bei Tonalität, Empathie und kreativen Texten führt das Modell laut Anbieter die LMArena-Rangliste an.

    KI & AI· Ankündigung

  • Link:clickrank.ai

    LLM Leaderboards 2026: Benchmarks, Methoden und Modelle im Vergleich

    Ein Leitfaden von ClickRank AI analysiert den Stand der LLM-Ranglisten im Jahr 2026. Da traditionelle Tests wie MMLU und HumanEval übersättigt sind, stützen sich Vergleiche heute auf anspruchsvollere Benchmarks, menschliche Blindvergleiche und kombinierte Metriken aus Leistung, Geschwindigkeit und Token-Preisen.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.