Studie vergleicht programmatischen Tool-Aufruf mit JSON-Tool-Calling

ArtikelIshan Patel, Sahil Sen, Elias Lumer, Vamse Kumar SubbiahForschung

Ein Forschungsteam untersucht Programmatic Tool Calling (PTC) im Vergleich zum nativen JSON-Tool-Calling über 14 Sprachmodelle hinweg im Benchmark BFCL v4. Bei PTC werden Werkzeuge als typisierte Python-Stubs bereitgestellt, die das Modell per Code in einem Durchgang ausführt. PTC erreicht bei 11 von 14 Modellen gleichwertige oder bessere Ergebnisse als der JSON-Standard.

Das Wichtigste

  1. Vergleich von programmatischem Tool-Aufruf über Python-Code mit nativem JSON-Tool-Calling bei 14 LLMs auf Basis von BFCL v4.
  2. Programmatic Tool Calling übertrifft oder erreicht die native JSON-Methode in 11 von 14 getesteten Modellen.
  3. Die Modellfamilie GPT-5.6 erzielt mit PTC eine Leistungssteigerung von 10,6 Prozent gegenüber der JSON-Baseline.
  4. Bei parallelem Fan-out schneidet PTC bei 13 von 14 Modellen gleich gut oder besser ab.
  5. Unter Bedingungen mit Kontext-Degeneration (Context Rot) bleibt PTC stabil, während die JSON-Baseline im Schnitt um 2,3 Prozent abfällt.

Warum das relevant ist

JSON-basiertes Function Calling stößt bei komplexen Verkettungen und parallelen Aufrufen an Grenzen. Die Bereitstellung von Tools als Programmcode nutzt die Programmierfähigkeiten moderner Modelle besser aus und reduziert Anfälligkeiten gegenüber Kontextüberlastung.

Einordnung

Die Untersuchung zeigt, dass Code als Schnittstelle für LLMs natürlicher skaliert als starre JSON-Schemata. Indem Modelle Werkzeuge direkt über Python-Skripte verketten und ausführen, lassen sich Aufrufe bündeln und die Trefferquote steigern, insbesondere bei Modellen neuerer Generationen wie GPT-5.6.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Masato Okuwaki

    Programmatic Tool Calling gegen natives JSON: Wann Agenten Code schreiben sollten

    Masato Okuwaki analysiert eine Studie von PwC, die natives JSON-Tool-Calling mit programmgesteuertem Tool Calling (PTC) via Python-Skripten vergleicht. Auf einem 309 Aufgaben umfassenden Subset des Benchmarks BFCL v4 erzielten elf von vierzehn Modellen von Anthropic und OpenAI mit Code bessere oder gleiche Ergebnisse wie mit Standard-JSON.

    KI & AI· Forschung

  • Link:Shishir G. Patil, Huanzhi Mao, Charlie Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, Joseph E. Gonzalez

    Berkeley Function Calling Leaderboard (BFCL) V4

    Das Berkeley Function Calling Leaderboard (BFCL) V4 evaluiert die Fähigkeit von Sprachmodellen, Funktionen und Werkzeuge präzise aufzurufen. Version 4 erweitert frôhere Iterationen um eine ganzheitliche agentische Bewertung.

    KI & AI· Tool

  • Artikel:Jiarui Lu, Thomas Holleis, Yizhe Zhang, Bernhard Aumayer, Feng Nan, Felix Bai, Shuang Ma, Shen Ma, Mengyu Li, Guoli Yin, Zirui Wang, Ruoming Pang

    ToolSandbox: Zustandsbasierter Benchmark für die Tool-Nutzung von LLMs

    ToolSandbox ist ein Evaluierungs-Benchmark, der die Fähigkeiten von Sprachmodellen bei der Werkzeugnutzung anhand zustandsbehafteter Umgebungen und mehrteiliger Dialoge testet.

    KI & AI· Forschung

  • Repository:alexfazio/artificial-analysis-compare

    artificial-analysis-compare: LLM-Vergleich via Artificial Analysis API

    Ein Python-basiertes Skill-Tool, das die API von Artificial Analysis abfragt, um Sprachmodelle wie GPT-5, Claude und Gemini hinsichtlich Leistung, Benchmark-Werten, Kosten und Latenz zu vergleichen.

    12SternePython

    KI & AI· Tool

  • Link:aicodingdaily.com

    AI Coding Daily: Benchmarks, Workflows und Tools für KI-Entwickler

    Die Website AI Coding Daily veröffentlicht laufend Tests, Benchmarks und Video-Tutorials zum praktischen Einsatz von Sprachmodellen in der Softwareentwicklung. Im Fokus stehen Vergleiche von Spitzenmodellen, lokale LLMs und Sicherheitswerkzeuge für Entwickler.

    KI & AI· Sammlung

  • Link:nekuda-ai

    WindTunnel: Offener Benchmark vergleicht WebMCP mit Computer Use und DOM-Parsing

    Nekuda-ai hat mit WindTunnel einen reproduzierbaren Open-Source-Benchmark vorgestellt, der WebMCP mit visuellen Screen-Agents und DOM-basierten Ansätzen vergleicht. Der Benchmark testet 49 Aufgaben auf acht realen Websites mit jeweils drei Durchläufen über Modelle wie GPT-5.6 Luna, Gemini 3.6 Flash und Sonnet 5.

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.