Benchmarki
Benchmark to zbiór zadań i kontekst testu — scorer to funkcja, która zamienia odpowiedzi w wynik. Poniżej testy opisane w encyklopedii, każdy z linkiem do żywego leaderboardu.
Matematyka
Kod
Aider Polyglot
Aider Polyglot to benchmark zdolności modeli do edytowania istniejącego kodu — nie generowania kodu od zera. Test składa się z 225 ćwiczeń programistycznych z platformy Exercism w sześciu językach: C++, Go, Java, JavaScript, Python i Rust. Model, sterowa
liczony m.in. przez: pass@k
LiveCodeBench
LiveCodeBench to benchmark generowania kodu, który nie starzeje się: zadania są stale dobierane z konkursów programistycznych na LeetCode, AtCoder i Codeforces, publikowanych po dacie odcięcia wiedzy testowanych modeli. Dzięki temu wyniki są z definicji od
liczony m.in. przez: pass@k
SWE-bench Pro
SWE-bench Pro Scale AI podnosi poprzeczkę względem SWE-bench: 1 865 problemów z 41 aktywnie utrzymywanych repozytoriów — aplikacji biznesowych, usług B2B i narzędzi deweloperskich — w tym zadania długohoryzontalne, których rozwiązanie zajęłoby inżynierow
liczony m.in. przez: Resolved rate (testy przechodzą)
SWE-bench Verified
SWE-bench Verified to zwalidowany przez ludzi podzbiór 500 zadań z SWE-bench: model lub agent kodujący dostaje realne zgłoszenie błędu issue z popularnego repozytorium Pythona i musi wygenerować łatkę, która przechodzi testy weryfikujące naprawę FA
liczony m.in. przez: Resolved rate (testy przechodzą)
Agenty
BFCL
BFCL Berkeley Function Calling Leaderboard mierzy, jak dokładnie modele wywołują funkcje narzędzia — fundament działania agentów. Zbiór zawiera pytania z funkcjami zapisanymi jako JSON Schema w stylu Python/Java/JavaScript oraz REST API, a w kolejnyc
liczony m.in. przez: Exact match (i znormalizowany)
Terminal-Bench 2.0
Terminal-Bench 2.0 ocenia agentów działających w izolowanych środowiskach terminala Docker : 89 starannie wyselekcjonowanych zadań inspirowanych realnymi przepływami pracy — od operacji na plikach i konfiguracji, po analizę danych i zadania z zakresu inży
liczony m.in. przez: Resolved rate (testy przechodzą)
τ2-bench
τ2-bench to benchmark konwersacyjnych agentów w środowisku podwójnej kontroli dual-control : nie tylko agent, lecz także użytkownik aktywnie działa narzędziami we wspólnym, dynamicznym świecie — wzorowanym na domenie telekomunikacyjnej i modelowanym jak
liczony m.in. przez: LLM-as-judge: direct scoring
Preferencje
Wiedza
GPQA Diamond
GPQA Graduate-Level Google-Proof Q&A to zbiór 448 pytań wielokrotnego wyboru z biologii, fizyki i chemii, pisanych przez ekspertów z doktoratami i zaprojektowanych tak, by były „odporne na Google": wykwalifikowani nie-eksperci z nieograniczonym dostępe
liczony m.in. przez: Exact match (i znormalizowany)
HLE (Humanity’s Last Exam)
Humanity's Last Exam HLE to benchmark „ostatniego egzaminu akademickiego": 2 500 pytań z dziesiątek dziedzin matematyki, nauk przyrodniczych i humanistyki, zebranych od blisko tysiąca ekspertów z ponad 500 instytucji i wybranych tak, by stawiać opór najn
liczony m.in. przez: Exact match (i znormalizowany)
MMLU-Pro
MMLU-Pro to utwardzona, mocniej wymagająca wersja klasycznego MMLU, stworzona, gdy wyniki najlepszych modeli na oryginalnym teście zaczęły się wysycać. Zbiór zawiera ponad 12 tysięcy pytań wielokrotnego wyboru z 14 dziedzin matematyka, fizyka, prawo, inży
liczony m.in. przez: Exact match (i znormalizowany)