ARC-AGI-3: Neuer interaktiver Benchmark für autonome KI-Agenten

ArtikelARC Prize FoundationForschung

Die ARC Prize Foundation stellt mit ARC-AGI-3 eine neue Benchmark-Generation vor, die agentische Intelligenz in neuartigen, interaktiven und rundenbasierten Umgebungen testet. Während Menschen 100 Prozent der kalibrierten Aufgaben lösen, liegen führende KI-Systeme im März 2026 bei unter einem Prozent.

Das Wichtigste

  1. ARC-AGI-3 wechselt von statischen Aufgaben zu interaktiven, rundenbasierten Umgebungen ohne Textanweisungen, in denen Agenten Ziele selbst ableiten und Aktionspläne entwickeln müssen.
  2. Die Aufgaben stützen sich ausschließlich auf Core-Knowledge-Priori (wie grundlegende Geometrie und Objektkonzepte) und verzichten auf externe Wissensdomänen oder Sprachmodelleffekte.
  3. Menschliche Testteilnehmer erreichen eine Lösungsquote von 100 Prozent, während führende Frontier-KI-Systeme Stand März 2026 unter 1 Prozent bleiben.
  4. Frühere Versionen (ARC-AGI-1 und ARC-AGI-2) gerieten zunehmend unter Druck durch synthetische Datengenerierung, Verifier-Schleifen und Format-Memorierung in Large Reasoning Models (LRMs) wie Gemini 3.
  5. ARC-AGI-3 misst General Intelligence als Effizienz des Fertigkeitenerwerbs statt als reines Abrufen von Vorwissen.

Warum das relevant ist

Große Sprach- und Denkmodelle (LRMs) glänzen vor allem in Domänen, für die sie massenhaft Trainingsdaten und deterministische Prüfmechanismen (Verifier) besitzen, wie etwa bei Programmierwerkzeugen. ARC-AGI-3 zeigt die Grenzen dieser wissensgebundenen Systeme auf, indem es autonome Anpassung in völlig neuartigen Umgebungen verlangt und damit den tatsächlichen Abstand zu menschlicher AGI quantifiziert.

Einordnung

Das Papier der ARC Prize Foundation um François Chollet und Mike Knoop ordnet die Entwicklung der Reasoning-Modelle der letzten Jahre ein: Test-Time-Training und Test-Time-Compute (etwa in OpenAI o1 und o3) brachten signifikante Sprünge, stießen jedoch bei statischen Aufgaben an die Grenzen echter Generalisierung. Da Modelle wie Gemini 3 Deep Think selbst ohne Vorgabe die internen Farbcodierungen von ARC rekonstruieren konnten, wurden hochstufige Abkürzungen und Overfitting sichtbar. Mit ARC-AGI-3 verlagert sich der Test daher auf dynamische Exploration und Zielinferenz, was KI-Agenten zwingt, echte interne Weltmodelle aufzubauen, anstatt Muster aus vorab generierten Verifikationsschleifen abzurufen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:arcprize.org

    ARC-AGI-3: Interaktiver Reasoning-Benchmark für KI-Agenten

    ARC-AGI-3 ist ein neuer interaktiver Benchmark zur Messung menschenähnlicher Intelligenz in KI-Agenten. Statt statischer Aufgaben müssen Agenten unbekannte Umgebungen interaktiv erkunden, Ziele eigenständig ableiten und Strategien über längere Zeithorizonte anpassen.

    KI & AI· Sammlung

  • Link:arcprize.org

    ARC Prize 2026: Details zum interaktiven KI-Wettbewerb ARC-AGI-3

    Die Veranstalter des ARC Prize stellen den Track ARC-AGI-3 für 2026 vor. Der Benchmark verlässt statische Testdaten und verlangt von KI-Agenten, unbekannte, dynamische Spielumgebungen ohne Vorgaben interaktiv zu erkunden und zu meistern. Insgesamt sind 850.000 US-Dollar an Preisgeldern ausgeschrieben.

    KI & AI· Ankündigung

  • Artikel:Terry Chen, Yeyin (Eva) Zhu, Zhifan Ye, Jean-Francois Puget and Humphrey Shi

    NVIDIA AVO erreicht 100 % im ARC-AGI-3-Benchmark

    NVIDIA präsentiert mit Agentic Variation Operators (AVO) eine Agentenarchitektur für langlaufende Aufgaben, die Claude Opus 5 zu einem perfekten Ergebnis im ARC-AGI-3-Benchmark verhilft.

    KI & AI· Forschung

  • Artikel:Jiarui Lu, Thomas Holleis, Yizhe Zhang, Bernhard Aumayer, Feng Nan, Felix Bai, Shuang Ma, Shen Ma, Mengyu Li, Guoli Yin, Zirui Wang, Ruoming Pang

    ToolSandbox: Zustandsbasierter Benchmark für die Tool-Nutzung von LLMs

    ToolSandbox ist ein Evaluierungs-Benchmark, der die Fähigkeiten von Sprachmodellen bei der Werkzeugnutzung anhand zustandsbehafteter Umgebungen und mehrteiliger Dialoge testet.

    KI & AI· Forschung

  • Link:The Cognition Team

    FrontierCode: Neuer Benchmark für Merge-Fähigkeit von KI-Code

    Cognition hat mit FrontierCode einen Benchmark und ein Leaderboard veröffentlicht, das bewertet, ob von KI-Modellen erstellte Pull Requests von Open-Source-Maintainern tatsächlich gemergt werden würden. Die Bewertung stützt sich auf Unit-Tests, Verifizierer und praxisnahe Rubriken von Maintainern.

    KI & AI· Sammlung

  • Link:Epoch AI

    Epoch AI stellt Dashboard für KI-Fähigkeiten und Benchmarks bereit

    Epoch AI bietet ein zentrales Dashboard, das Benchmark-Ergebnisse führender KI-Modelle sammelt und visualisiert. Die Plattform umfasst eigene Tests von Epoch AI sowie Daten externer Evaluierer zu Disziplinen wie Mathematik, Softwareentwicklung, Agenten und multimodalen Aufgaben.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.