ToolSandbox: Zustandsbasierter Benchmark für die Tool-Nutzung von LLMs

ArtikelJiarui Lu, Thomas Holleis, Yizhe Zhang, Bernhard Aumayer, Feng Nan, Felix Bai, Shuang Ma, Shen Ma, Mengyu Li, Guoli Yin, Zirui Wang, Ruoming PangForschung

ToolSandbox ist ein Evaluierungs-Benchmark, der die Fähigkeiten von Sprachmodellen bei der Werkzeugnutzung anhand zustandsbehafteter Umgebungen und mehrteiliger Dialoge testet.

Das Wichtigste

  1. Bisherige Benchmarks bewerteten Werkzeuge meist zustandslos über RESTful APIs, Single-Turn-Prompts oder vorab festgelegte Dialogpfade.
  2. ToolSandbox implementiert zustandsbehaftete Werkzeugausführung, implizite Zustandsabhängigkeiten zwischen Werkzeugen sowie dynamische Meilenstein-Prüfungen.
  3. Ein integrierter Nutzersimulator ermöglicht interaktive On-Policy-Gesprächsabläufe über beliebige Pfade hinweg.
  4. Die Ergebnisse zeigen eine erhebliche Leistungslücke zwischen Open-Source-Modellen und proprietären Modellen.
  5. Herausforderungen wie State Dependency, Canonicalization und unzureichende Informationen überfordern selbst führende State-of-the-Art-Modelle.

Warum das relevant ist

In produktiven Systemen müssen KI-Agenten komplexe APIs bedienen, bei denen frühere Aktionen den späteren Systemzustand verändern. Einfache Single-Turn-Tests bilden diese Realität nicht ab; ToolSandbox schafft hierfür eine realistischere Testumgebung.

Einordnung

Das Forschungsteam adressiert eine zentrale Schwachstelle bisheriger Funktionsbewertungen: Reale Arbeitsabläufe sind selten zustandslos oder linear. Die Autoren demonstrieren, dass Modelle bei impliziten Abhängigkeiten und Informationsdefiziten schnell an ihre Grenzen stoßen, was die Notwendigkeit robusterer Planungs- und Interaktionsfähigkeiten bei Agenten unterstreicht.

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Jiaqi Liu et al.

    AutoResearchClaw: Multi-Agenten-Forschung mit iterativer Selbstkorrektur und Human-in-the-Loop

    Ein Forschungsteam um Jiaqi Liu stellt AutoResearchClaw vor, eine autonome Forschungspipeline auf Basis kooperierender Agenten. Das System bricht mit linearen Ausführungsmodellen und setzt auf iterative Fehlerkorrektur, überprüfbare Resultate sowie anpassbare menschliche Eingriffe. Im Benchmark ARC-Bench schlägt es vergleichbare Ansätze wie AI Scientist v2 deutlich.

    KI & AI· Forschung

  • Link:Shishir G. Patil, Huanzhi Mao, Charlie Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, Joseph E. Gonzalez

    Berkeley Function Calling Leaderboard (BFCL) V4

    Das Berkeley Function Calling Leaderboard (BFCL) V4 evaluiert die Fähigkeit von Sprachmodellen, Funktionen und Werkzeuge präzise aufzurufen. Version 4 erweitert frôhere Iterationen um eine ganzheitliche agentische Bewertung.

    KI & AI· Tool

  • Link:Rogerio Bonatti, Dan Zhao, Francesco Bonacci, et al.

    Windows Agent Arena: Großskaliges Benchmark für multimodale Windows-Agenten

    Forschende von Microsoft, der Carnegie Mellon University und der Columbia University haben mit Windows Agent Arena (WAA) ein Open-Source-Framework veröffentlicht, mit dem multimodale KI-Agenten in einer nativen Windows-11-Umgebung getestet werden können. Das System umfasst über 150 Alltagsaufgaben und lässt sich via Azure parallelisieren, wodurch vollständige Benchmark-Läufe in rund 20 Minuten statt mehreren Tagen durchlaufen. Ein begleitend vorgestellter Referenz-Agent namens Navi erreichte eine Erfolgsquote von 19,5 Prozent, verglichen mit 74,5 Prozent menschlicher Genauigkeit.

    KI & AI· Forschung

  • Link:arcprize.org

    ARC-AGI-3: Interaktiver Reasoning-Benchmark für KI-Agenten

    ARC-AGI-3 ist ein neuer interaktiver Benchmark zur Messung menschenähnlicher Intelligenz in KI-Agenten. Statt statischer Aufgaben müssen Agenten unbekannte Umgebungen interaktiv erkunden, Ziele eigenständig ableiten und Strategien über längere Zeithorizonte anpassen.

    KI & AI· Sammlung

  • Artikel:ARC Prize Foundation

    ARC-AGI-3: Neuer interaktiver Benchmark für autonome KI-Agenten

    Die ARC Prize Foundation stellt mit ARC-AGI-3 eine neue Benchmark-Generation vor, die agentische Intelligenz in neuartigen, interaktiven und rundenbasierten Umgebungen testet. Während Menschen 100 Prozent der kalibrierten Aufgaben lösen, liegen führende KI-Systeme im März 2026 bei unter einem Prozent.

    KI & AI· Forschung

  • Artikel:Siru Ouyang, Jun Yan, I-Hung Hsu, et al.

    ReasoningBank: Selbstlernende KI-Agenten durch Reasoning Memory

    ReasoningBank ist ein neuartiges Speicher-Framework für LLM-Agenten, das verallgemeinerbare Denkstrategien aus selbst bewerteten Erfolgen und Fehlern destilliert, um kontinuierliches Lernen im laufenden Betrieb zu ermöglichen.

    KI & AI· Forschung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.