AutoResearchClaw: Multi-Agenten-Forschung mit iterativer Selbstkorrektur und Human-in-the-Loop

ArtikelJiaqi Liu et al.Forschung

Ein Forschungsteam um Jiaqi Liu stellt AutoResearchClaw vor, eine autonome Forschungspipeline auf Basis kooperierender Agenten. Das System bricht mit linearen Ausführungsmodellen und setzt auf iterative Fehlerkorrektur, überprüfbare Resultate sowie anpassbare menschliche Eingriffe. Im Benchmark ARC-Bench schlägt es vergleichbare Ansätze wie AI Scientist v2 deutlich.

Das Wichtigste

  1. Bestehende Systeme zur KI-Forschung agieren meist linear, brechen bei Fehlern ab und lernen nicht aus vorangegangenen Durchläufen.
  2. Strukturierte Multi-Agenten-Debatten unterstützen die Formulierung von Hypothesen und die Auswertung von Experimenten.
  3. Ein selbstkorrigierender Executor mit Pivot/Refine-Entscheidungsschleife nutzt Fehlschläge als Informationsquelle für den nächsten Versuch.
  4. Mechanismen für verifizierbare Berichte unterbinden erfundene Messwerte und fingierte Zitate.
  5. Sieben Abstufungen für Human-in-the-Loop-Interventionen ermöglichen von voller Autonomie bis zur Schritt-für-Schritt-Kontrolle flexible Zusammenarbeit.
  6. Auf dem Benchmark ARC-Bench mit 25 Themen übertrifft AutoResearchClaw das System AI Scientist v2 um 54,7 Prozent.

Warum das relevant ist

Vollständig autonome KI-Forschungspipelines neigen bisher zu Halluzinationen oder scheitern rasch an Code- und Logikfehlern in Experimenten. AutoResearchClaw zeigt, wie Multi-Agenten-Diskussionen, iterative Fehlerzyklen und gezielte menschliche Führung an Schlüsselstellen zu belastbareren Ergebnissen führen.

Einordnung

Das Papier positioniert AutoResearchClaw nicht als Ersatz für Forschende, sondern als Verstärker menschlicher Urteilskraft. Bemerkenswert ist das empirische Ergebnis der Ablationsstudie: Dauerhafte Schritt-für-Schritt-Überwachung bringt keinen Vorteil gegenüber gezielten, wohlplatzierten Korrekturen an Hebelpunkten. Das Design adressiert zentrale Schwächen von Sprachmodellen in der Wissenschaft, insbesondere erfundene Quellen und Datenfälschungen, indem es Verifikationsschichten und eine erfahrungsbasierte Evolution über mehrere Durchläufe hinweg etabliert.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li

    AutoDesign: Meta-Harness-Optimierung für agentenbasiertes Design

    Forschende stellen mit AutoDesign ein Framework vor, das multimodale Inhalte durch autonome Code-Agenten in strukturierte Medienformate wie Konferenzposter überführt. Über einen Meta-Harness-Optimizer verbessert das System sein Harness iterativ anhand von Feedback und übertrifft dabei kommerzielle Lösungen.

    KI & AI· Forschung

  • Artikel:Jiarui Lu, Thomas Holleis, Yizhe Zhang, Bernhard Aumayer, Feng Nan, Felix Bai, Shuang Ma, Shen Ma, Mengyu Li, Guoli Yin, Zirui Wang, Ruoming Pang

    ToolSandbox: Zustandsbasierter Benchmark für die Tool-Nutzung von LLMs

    ToolSandbox ist ein Evaluierungs-Benchmark, der die Fähigkeiten von Sprachmodellen bei der Werkzeugnutzung anhand zustandsbehafteter Umgebungen und mehrteiliger Dialoge testet.

    KI & AI· Forschung

  • Artikel:Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li

    AutoDesign: Meta-Harness-Optimierung für agentisches Design

    Forschende stellen mit AutoDesign ein Framework vor, das multimodale Inhalte wie wissenschaftliche Arbeiten autonom in strukturierte Medien wie Konferenzposter überführt. Ein Meta-Harness-Optimierer leitet einen Code-Agenten dazu an, die Test- und Ausführungsumgebung anhand von Rollout-Feedback iterativ zu verbessern.

    KI & AI· Forschung

  • Artikel:Kai Zheng

    Stanford Virtual Lab: Autonome KI-Agenten als Forschungsteams in der Onkologie

    Ein Forschungsteam an der Stanford University um James Zou hat das 'Virtual Lab' entwickelt, ein Multi-Agenten-System, das wissenschaftliche Forschungsprozesse weitgehend autonom durchführt. Spezialisierte KI-Agenten übernehmen dabei Rollen wie Projektleitung, Fachforschung und Kritik, um biomedizinische Entdeckungen und Krebsforschungen massiv zu beschleunigen.

    KI & AI· News

  • Artikel:Siru Ouyang, Jun Yan, I-Hung Hsu, et al.

    ReasoningBank: Selbstlernende KI-Agenten durch Reasoning Memory

    ReasoningBank ist ein neuartiges Speicher-Framework für LLM-Agenten, das verallgemeinerbare Denkstrategien aus selbst bewerteten Erfolgen und Fehlern destilliert, um kontinuierliches Lernen im laufenden Betrieb zu ermöglichen.

    KI & AI· Forschung

  • Artikel:Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao

    HASP: Ausführbare Skill-Programme als Leitplanken für LLM-Agenten

    Ein Forschungsteam stellt mit HASP (Harnessing LLM Agents with Skill Programs) ein Framework vor, das Erfahrungswerte von Sprachmodell-Agenten in ausführbare Programmfunktionen (PFs) überführt. Statt rein textbasierter Empfehlungen greifen diese Funktionen bei fehleranfälligen Zuständen aktiv in den Agenten-Loop ein, indem sie Aktionen anpassen oder korrigierenden Kontext einfügen.

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.