NVIDIA AVO erreicht 100 % im ARC-AGI-3-Benchmark

ArtikelTerry Chen, Yeyin (Eva) Zhu, Zhifan Ye, Jean-Francois Puget and Humphrey ShiForschung

NVIDIA präsentiert mit Agentic Variation Operators (AVO) eine Agentenarchitektur für langlaufende Aufgaben, die Claude Opus 5 zu einem perfekten Ergebnis im ARC-AGI-3-Benchmark verhilft.

Das Wichtigste

  1. AVO schloss alle 25 Umgebungen und 183 Level des ARC-AGI-3-Public-Sets mit einem RHAE-Wert von 100,00 ab und benötigte dafür 6.624 Aktionen.
  2. Im Vergleich zum VISTA-System mit demselben Modell (Claude Opus 5) verbrauchte AVO rund 12 % weniger Interaktionsschritte.
  3. Die Kernmechanismen bestehen aus einem persistenten Gedächtnis zur Zustandsspeicherung und einer Supervisor-Komponente, die bei Stagnation eingreift.
  4. In einem vorangegangenen siebentägigen Testlauf auf DGX B200 optimierte AVO GPU-Attention-Kernel, die FlashAttention-4 um bis zu 10,5 % und cuDNN um bis zu 3,5 % übertrafen.
  5. Für ARC-AGI-3 nutzte das Modell eine reine Textmodalität mit einem 64x64-Textgitter pro Beobachtung ohne Bilddaten.

Warum das relevant ist

Das Experiment zeigt, dass für das Bewältigen komplexer, vielstufiger Aufgaben nicht allein das zugrunde liegende Sprachmodell ausschlaggebend ist, sondern die Systemarchitektur aus Memory, Werkzeugen, Feedbackschleifen und Aufsicht.

Einordnung

NVIDIA demonstriert, dass dieselbe Agentenschleife von der Low-Level-GPU-Optimierung auf interaktives Reasoning übertragbar ist. Der Erfolg beruht auf kontinuierlicher Hypothesenbildung und Fehlerkorrektur, während die Supervisor-Komponente verhindert, dass der Agent in ineffizienten Schleifen steckenbleibt.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Terry Chen, Zhifan Ye, Bing Xu, et al.

    AVO: Autonome Evolutionssuche optimiert GPU-Kernel mittels Coding-Agenten

    Ein Forschungsteam stellt mit Agentic Variation Operators (AVO) ein Framework vor, das klassische Mutations- und Crossover-Operatoren durch autonome KI-Agenten ersetzt. Auf NVIDIA Blackwell (B200) GPUs übertrafen die damit entwickelten Attention-Kernel etablierte Bibliotheken wie cuDNN und FlashAttention-4.

    KI & AI· Forschung

  • Artikel:ARC Prize Foundation

    ARC-AGI-3: Neuer interaktiver Benchmark für autonome KI-Agenten

    Die ARC Prize Foundation stellt mit ARC-AGI-3 eine neue Benchmark-Generation vor, die agentische Intelligenz in neuartigen, interaktiven und rundenbasierten Umgebungen testet. Während Menschen 100 Prozent der kalibrierten Aufgaben lösen, liegen führende KI-Systeme im März 2026 bei unter einem Prozent.

    KI & AI· Forschung

  • Link:arcprize.org

    ARC-AGI-3: Interaktiver Reasoning-Benchmark für KI-Agenten

    ARC-AGI-3 ist ein neuer interaktiver Benchmark zur Messung menschenähnlicher Intelligenz in KI-Agenten. Statt statischer Aufgaben müssen Agenten unbekannte Umgebungen interaktiv erkunden, Ziele eigenständig ableiten und Strategien über längere Zeithorizonte anpassen.

    KI & AI· Sammlung

  • Artikel:Chris Alexiuk and Chintan Patel

    NVIDIA Nemotron 3.5 Lightning: Kompaktes MoE-Modell für Agenten-Workflows

    NVIDIA hat Nemotron 3.5 Lightning vorgestellt, ein offenes Mixture-of-Experts-Modell (MoE) mit 30 Milliarden Gesamt- und 3 Milliarden aktiven Parametern. Es wurde speziell für die Ausführungsebene langlebiger KI-Agenten optimiert, um Routineaufgaben wie Tool-Aufrufe und Ergebnisvalidierung schnell und kostengünstig zu bewältigen.

    KI & AI· Ankündigung

  • Link:Rogerio Bonatti, Dan Zhao, Francesco Bonacci, et al.

    Windows Agent Arena: Großskaliges Benchmark für multimodale Windows-Agenten

    Forschende von Microsoft, der Carnegie Mellon University und der Columbia University haben mit Windows Agent Arena (WAA) ein Open-Source-Framework veröffentlicht, mit dem multimodale KI-Agenten in einer nativen Windows-11-Umgebung getestet werden können. Das System umfasst über 150 Alltagsaufgaben und lässt sich via Azure parallelisieren, wodurch vollständige Benchmark-Läufe in rund 20 Minuten statt mehreren Tagen durchlaufen. Ein begleitend vorgestellter Referenz-Agent namens Navi erreichte eine Erfolgsquote von 19,5 Prozent, verglichen mit 74,5 Prozent menschlicher Genauigkeit.

    KI & AI· Forschung

  • Link:arcprize.org

    ARC Prize 2026: Details zum interaktiven KI-Wettbewerb ARC-AGI-3

    Die Veranstalter des ARC Prize stellen den Track ARC-AGI-3 für 2026 vor. Der Benchmark verlässt statische Testdaten und verlangt von KI-Agenten, unbekannte, dynamische Spielumgebungen ohne Vorgaben interaktiv zu erkunden und zu meistern. Insgesamt sind 850.000 US-Dollar an Preisgeldern ausgeschrieben.

    KI & AI· Ankündigung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.