BFCL
BFCL (Berkeley Function Calling Leaderboard) mierzy, jak dokładnie modele wywołują funkcje (narzędzia) — fundament działania agentów. Zbiór zawiera pytania z funkcjami zapisanymi jako JSON Schema w stylu Python/Java/JavaScript oraz REST API, a w kolejnych wersjach dodano: funkcje korporacyjne i od społeczności (v2), interakcje wieloturowe (v3) oraz ewaluację agentyczną z wyszukiwaniem w sieci (v4).
Kategorie i punktacja
Zadania dzielą się na: wywołanie pojedynczej funkcji, funkcji wielokrotnych, równoległych i równoległych wielokrotnych oraz wykrywanie trafności (relevance detection). Odpowiedź modelu jest parsowana do wywołania i porównywana ze wzorcem przez exact match na drzewie składniowym (AST) — sprawdzana jest nazwa funkcji i wartości argumentów, z częściowym uznaniem za poprawny typ. Wynik końcowy to nieważona średnia dokładności z podkategorii.
Główny scorer
Scorery używane w tym benchmarku
Źródła
- Oficjalny leaderboard BFCL (gorilla.cs.berkeley.edu)(stan na 2026-10-10)
- Blog: Berkeley Function Calling Leaderboard v1 — wprowadzenie i metryka AST(stan na 2026-10-10)
- Blog: BFCL v4 — ewaluacja agentyczna z wyszukiwaniem w sieci(stan na 2026-10-10)
- Repozytorium Gorilla / BFCL (GitHub, ShishirPatil)(stan na 2026-10-10)