Berkeley Function Calling Leaderboard (BFCL) V4

LinkShishir G. Patil, Huanzhi Mao, Charlie Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, Joseph E. GonzalezTool

Das Berkeley Function Calling Leaderboard (BFCL) V4 evaluiert die Fähigkeit von Sprachmodellen, Funktionen und Werkzeuge präzise aufzurufen. Version 4 erweitert frôhere Iterationen um eine ganzheitliche agentische Bewertung.

Das Wichtigste

  1. BFCL bewertet Werkzeugaufrufe auf Basis realer Daten; V1 brachte AST-Metriken, V2 Enterprise- und Open-Source-Funktionen, V3 Multi-Turn-Interaktionen und V4 agentische Auswertungen.
  2. Unterschieden wird zwischen Modellen mit nativer Funktionsunterstützung (FC) und rein promptbasierten Behelfslösungen (Prompt).
  3. Die Metriken umfassen Gesamtexaktheit (ungewichteter Durchschnitt der Teilkategorien), Latenz in Sekunden sowie geschätzte Kosten in US-Dollar.
  4. Testläufe sind reproduzierbar über das PyPI-Paket bfcl-eval==2025.12.17 und ein öffentliches Git-Repository.
  5. Die Seite bietet neben der Bestenliste ein interaktives Demo-Werkzeug mit Code- und OpenAI-kompatibler Ausgabe sowie eine Vergleichsansicht ('Wagon Wheel').

Warum das relevant ist

Zuverlässige Funktionsaufrufe sind das Rückgrat autonomer KI-Agenten und praktischer API-Integrationen. BFCL liefert einen standardisierten und reproduzierbaren Vergleich für Entwickler, die Modelle nach Genauigkeit, Latenz und Kosten bewerten müssen.

Einordnung

Mit Version 4 vollzieht der Benchmark den Schritt von isolierten Tool-Calls hin zu komplexen agentischen Arbeitsabläufen. Die methodische Trennung zwischen nativer API-Unterstützung und Prompt-Workarounds verdeutlicht architektonische Unterschiede verschiedener Modellfamilien. Gleichzeitig ermöglicht das bereitgestellte Python-Evaluationspaket eigene Audits und das Nachvollziehen sämtlicher Benchmarkergebnisse.

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Ishan Patel, Sahil Sen, Elias Lumer, Vamse Kumar Subbiah

    Studie vergleicht programmatischen Tool-Aufruf mit JSON-Tool-Calling

    Ein Forschungsteam untersucht Programmatic Tool Calling (PTC) im Vergleich zum nativen JSON-Tool-Calling über 14 Sprachmodelle hinweg im Benchmark BFCL v4. Bei PTC werden Werkzeuge als typisierte Python-Stubs bereitgestellt, die das Modell per Code in einem Durchgang ausführt. PTC erreicht bei 11 von 14 Modellen gleichwertige oder bessere Ergebnisse als der JSON-Standard.

    KI & AI· Forschung

  • Artikel:Jiarui Lu, Thomas Holleis, Yizhe Zhang, Bernhard Aumayer, Feng Nan, Felix Bai, Shuang Ma, Shen Ma, Mengyu Li, Guoli Yin, Zirui Wang, Ruoming Pang

    ToolSandbox: Zustandsbasierter Benchmark für die Tool-Nutzung von LLMs

    ToolSandbox ist ein Evaluierungs-Benchmark, der die Fähigkeiten von Sprachmodellen bei der Werkzeugnutzung anhand zustandsbehafteter Umgebungen und mehrteiliger Dialoge testet.

    KI & AI· Forschung

  • Link:clickrank.ai

    LLM Leaderboards 2026: Benchmarks, Methoden und Modelle im Vergleich

    Ein Leitfaden von ClickRank AI analysiert den Stand der LLM-Ranglisten im Jahr 2026. Da traditionelle Tests wie MMLU und HumanEval übersättigt sind, stützen sich Vergleiche heute auf anspruchsvollere Benchmarks, menschliche Blindvergleiche und kombinierte Metriken aus Leistung, Geschwindigkeit und Token-Preisen.

    KI & AI· Sammlung

  • Link:The Cognition Team

    FrontierCode: Neuer Benchmark für Merge-Fähigkeit von KI-Code

    Cognition hat mit FrontierCode einen Benchmark und ein Leaderboard veröffentlicht, das bewertet, ob von KI-Modellen erstellte Pull Requests von Open-Source-Maintainern tatsächlich gemergt werden würden. Die Bewertung stützt sich auf Unit-Tests, Verifizierer und praxisnahe Rubriken von Maintainern.

    KI & AI· Sammlung

  • Link:Masato Okuwaki

    Programmatic Tool Calling gegen natives JSON: Wann Agenten Code schreiben sollten

    Masato Okuwaki analysiert eine Studie von PwC, die natives JSON-Tool-Calling mit programmgesteuertem Tool Calling (PTC) via Python-Skripten vergleicht. Auf einem 309 Aufgaben umfassenden Subset des Benchmarks BFCL v4 erzielten elf von vierzehn Modellen von Anthropic und OpenAI mit Code bessere oder gleiche Ergebnisse wie mit Standard-JSON.

    KI & AI· Forschung

  • Repository:alexfazio/artificial-analysis-compare

    artificial-analysis-compare: LLM-Vergleich via Artificial Analysis API

    Ein Python-basiertes Skill-Tool, das die API von Artificial Analysis abfragt, um Sprachmodelle wie GPT-5, Claude und Gemini hinsichtlich Leistung, Benchmark-Werten, Kosten und Latenz zu vergleichen.

    12SternePython

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.