Agentystan na 11 października 2026

BFCL

BFCL (Berkeley Function Calling Leaderboard) mierzy, jak dokładnie modele wywołują funkcje (narzędzia) — fundament działania agentów. Zbiór zawiera pytania z funkcjami zapisanymi jako JSON Schema w stylu Python/Java/JavaScript oraz REST API, a w kolejnych wersjach dodano: funkcje korporacyjne i od społeczności (v2), interakcje wieloturowe (v3) oraz ewaluację agentyczną z wyszukiwaniem w sieci (v4).

Kategorie i punktacja

Zadania dzielą się na: wywołanie pojedynczej funkcji, funkcji wielokrotnych, równoległych i równoległych wielokrotnych oraz wykrywanie trafności (relevance detection). Odpowiedź modelu jest parsowana do wywołania i porównywana ze wzorcem przez exact match na drzewie składniowym (AST) — sprawdzana jest nazwa funkcji i wartości argumentów, z częściowym uznaniem za poprawny typ. Wynik końcowy to nieważona średnia dokładności z podkategorii.

Główny scorer

Scorery używane w tym benchmarku

Źródła

  1. Oficjalny leaderboard BFCL (gorilla.cs.berkeley.edu)(stan na 2026-10-10)
  2. Blog: Berkeley Function Calling Leaderboard v1 — wprowadzenie i metryka AST(stan na 2026-10-10)
  3. Blog: BFCL v4 — ewaluacja agentyczna z wyszukiwaniem w sieci(stan na 2026-10-10)
  4. Repozytorium Gorilla / BFCL (GitHub, ShishirPatil)(stan na 2026-10-10)
BFCL — ashigiri