ARC Prize 2026: Details zum interaktiven KI-Wettbewerb ARC-AGI-3

LinkAnkündigung

Die Veranstalter des ARC Prize stellen den Track ARC-AGI-3 für 2026 vor. Der Benchmark verlässt statische Testdaten und verlangt von KI-Agenten, unbekannte, dynamische Spielumgebungen ohne Vorgaben interaktiv zu erkunden und zu meistern. Insgesamt sind 850.000 US-Dollar an Preisgeldern ausgeschrieben.

Das Wichtigste

  1. Interaktiver Benchmark: Agenten agieren ohne vorgegebene Anweisungen in dynamischen Umgebungen statt auf statischen Datensätzen.
  2. Vier Kernfähigkeiten werden getestet: Exploration, Weltmodellierung, autonome Zielsetzung (Goal-setting) sowie Planung und Ausführung.
  3. Preispool von 850.000 US-Dollar: 700.000 US-Dollar Hauptpreis für 100 % Erfolgsquote, 75.000 US-Dollar für Höchstplatzierte sowie 75.000 US-Dollar für Open-Source-Meilensteine.
  4. Einreichung über Kaggle unter strikten Auflagen: Kein Internetzugang während der Evaluierung und Pflicht zur Veröffentlichung des Codes als Open Source für Preisberechtigung.

Warum das relevant ist

Bisherige LLM-Benchmarks messen oft statisches Wissen oder memorierte Muster. ARC-AGI-3 zwingt autonome Agenten, sich in Echtzeit an unbekannte Systeme anzupassen und eigenständig Hypothesen zu überprüfen. Dies ist ein entscheidender Schritt für die Entwicklung robuster KI-Agenten.

Einordnung

Mit ARC-AGI-3 verlagert sich der Fokus von Vorhersagen einzelner Token hin zu zielgerichtetem Handeln in geschlossenen Regelwerken. Die Koppelung der Preisgelder an Meilensteine und Open-Source-Veröffentlichungen soll den Fortschritt für die gesamte Entwickler-Community nachvollziehbar machen. Die strikte Trennung vom Internet während der Auswertung verhindert zudem das Nachladen externer Ressourcen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:arcprize.org

    ARC-AGI-3: Interaktiver Reasoning-Benchmark für KI-Agenten

    ARC-AGI-3 ist ein neuer interaktiver Benchmark zur Messung menschenähnlicher Intelligenz in KI-Agenten. Statt statischer Aufgaben müssen Agenten unbekannte Umgebungen interaktiv erkunden, Ziele eigenständig ableiten und Strategien über längere Zeithorizonte anpassen.

    KI & AI· Sammlung

  • Artikel:ARC Prize Foundation

    ARC-AGI-3: Neuer interaktiver Benchmark für autonome KI-Agenten

    Die ARC Prize Foundation stellt mit ARC-AGI-3 eine neue Benchmark-Generation vor, die agentische Intelligenz in neuartigen, interaktiven und rundenbasierten Umgebungen testet. Während Menschen 100 Prozent der kalibrierten Aufgaben lösen, liegen führende KI-Systeme im März 2026 bei unter einem Prozent.

    KI & AI· Forschung

  • Artikel:Terry Chen, Yeyin (Eva) Zhu, Zhifan Ye, Jean-Francois Puget and Humphrey Shi

    NVIDIA AVO erreicht 100 % im ARC-AGI-3-Benchmark

    NVIDIA präsentiert mit Agentic Variation Operators (AVO) eine Agentenarchitektur für langlaufende Aufgaben, die Claude Opus 5 zu einem perfekten Ergebnis im ARC-AGI-3-Benchmark verhilft.

    KI & AI· Forschung

  • Link:Rogerio Bonatti, Dan Zhao, Francesco Bonacci, et al.

    Windows Agent Arena: Großskaliges Benchmark für multimodale Windows-Agenten

    Forschende von Microsoft, der Carnegie Mellon University und der Columbia University haben mit Windows Agent Arena (WAA) ein Open-Source-Framework veröffentlicht, mit dem multimodale KI-Agenten in einer nativen Windows-11-Umgebung getestet werden können. Das System umfasst über 150 Alltagsaufgaben und lässt sich via Azure parallelisieren, wodurch vollständige Benchmark-Läufe in rund 20 Minuten statt mehreren Tagen durchlaufen. Ein begleitend vorgestellter Referenz-Agent namens Navi erreichte eine Erfolgsquote von 19,5 Prozent, verglichen mit 74,5 Prozent menschlicher Genauigkeit.

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.