Programmatic Tool Calling gegen natives JSON: Wann Agenten Code schreiben sollten

LinkMasato OkuwakiForschung

Masato Okuwaki analysiert eine Studie von PwC, die natives JSON-Tool-Calling mit programmgesteuertem Tool Calling (PTC) via Python-Skripten vergleicht. Auf einem 309 Aufgaben umfassenden Subset des Benchmarks BFCL v4 erzielten elf von vierzehn Modellen von Anthropic und OpenAI mit Code bessere oder gleiche Ergebnisse wie mit Standard-JSON.

Das Wichtigste

  1. Beim programmgesteuerten Tool Calling (PTC) generiert das Modell ein Python-Skript, das Funktions-Stubs importiert und ausführt, anstatt JSON-Objekte für Tool Calls auszugeben.
  2. Um gleiche Rechenzeit zu garantieren, beendet eine Middleware den Agenten-Loop nach der Skriptausführung ohne zusätzliche Inferenzschritte.
  3. Elf von vierzehn getesteten Modellen übertrafen oder erreichten mit PTC ihr JSON-Niveau; Claude Sonnet 4.6 legte um 6,5 Prozentpunkte zu, Varianten von GPT-5.6 gewannen bis zu 10,6 Punkte.
  4. Drei Modelle (GPT-4o, GPT-4.1 und GPT-5.4-mini) brachen um 20 bis 27 Punkte ein, weil sie Zeilenumbrüche als literale Zeichenkette '\n' anstelle echter Zeilenumbrüche ausgaben, was zu Syntaxfehlern führte.
  5. Die Fehleranalyse zeigt laut Autor, dass der Unterschied weniger an der Modellfamilie als an der Modellgeneration und deren Fähigkeit zur sauberen Code-Serialisierung liegt.

Warum das relevant ist

JSON-Tool-Calling gilt heute bei den meisten Entwicklern als unhinterfragter Standard für KI-Agenten. Wenn neuere Sprachmodelle durch normale Python-Skripte verlässlichere und flexiblere Funktionsaufrufe erzeugen, könnte Code-Generierung starre API-JSON-Schemata mittelfristig ablösen.

Einordnung

Okuwaki ordnet die Ergebnisse im Sinne von Rich Suttons 'Bitter Lesson' ein: Allgemeine Fähigkeiten wie Code-Generierung profitieren langfristig stärker von Modellfortschritten als fest verdrahtete Schnittstellenstrukturen wie JSON. Die drastischen Einbrüche bei drei OpenAI-Modellen betrachtet er als reines Serialisierungs- und Formatierungsproblem, das in produktiven Pipelines mit einfachen Retry-Mechanismen abgefangen werden könnte. Dennoch warnt die Untersuchung davor, PTC blind zu implementieren, da die Ausführung von generiertem Code in Shell-Subprozessen andere Sicherheitsanforderungen und Bedrohungsmodelle mit sich bringt als reine JSON-Validierung.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Ishan Patel, Sahil Sen, Elias Lumer, Vamse Kumar Subbiah

    Studie vergleicht programmatischen Tool-Aufruf mit JSON-Tool-Calling

    Ein Forschungsteam untersucht Programmatic Tool Calling (PTC) im Vergleich zum nativen JSON-Tool-Calling über 14 Sprachmodelle hinweg im Benchmark BFCL v4. Bei PTC werden Werkzeuge als typisierte Python-Stubs bereitgestellt, die das Modell per Code in einem Durchgang ausführt. PTC erreicht bei 11 von 14 Modellen gleichwertige oder bessere Ergebnisse als der JSON-Standard.

    KI & AI· Forschung

  • Link:Shishir G. Patil, Huanzhi Mao, Charlie Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, Joseph E. Gonzalez

    Berkeley Function Calling Leaderboard (BFCL) V4

    Das Berkeley Function Calling Leaderboard (BFCL) V4 evaluiert die Fähigkeit von Sprachmodellen, Funktionen und Werkzeuge präzise aufzurufen. Version 4 erweitert frôhere Iterationen um eine ganzheitliche agentische Bewertung.

    KI & AI· Tool

  • Artikel:DeepInfra

    Die besten LLMs für OpenClaw im Praxiseinsatz

    Ein Leitfaden von DeepInfra vergleicht Modelle mit offenen Gewichten für den autonomen Agenten OpenClaw. Im Fokus stehen Kriterien wie zuverlässige Tool-Aufrufe, Kontextstabilität und reale Kosten pro Aufgabe.

    KI & AI· Sammlung

  • Artikel:Anthropic

    Anthropic stellt Claude Sonnet 4.5 und Claude Agent SDK vor

    Anthropic hat Claude Sonnet 4.5 veröffentlicht. Das Modell bringt signifikante Fortschritte beim Programmieren, bei komplexen Agenten-Workflows und bei der autonomen Computerbedienung. Flankiert wird der Launch von neuen Entwickler-Tools wie dem Claude Agent SDK und Checkpoints in Claude Code.

    KI & AI· Ankündigung

  • Link:deep-reinforce.com

    Ornith-1.0: Open-Source-Modellfamilie für Coding-Agenten mit Self-Scaffolding

    Mit Ornith-1.0 erscheint eine Open-Source-Modellreihe für agentenbasierte Programmieraufgaben in Größen von 9B bis 397B Parametern. Durch ein neuartiges RL-Verfahren generieren die Modelle während des Trainings sowohl die Lösung als auch das unterstützende Task-Harness selbst.

    KI & AI· Ankündigung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.