Wprowadzenie

Scorer a benchmark — dwie różne role

Aktualizacja: 11 października 2026

Dwie role w jednej pętli ewaluacji

Scorer i benchmark bywają mylone, bo w raportach pojawiają się razem. To dwa różne poziomy abstrakcji:

  • Scorer ocenia jedną odpowiedź — jedną próbkę. Jego wynik to liczba lub kategoria o zdefiniowanej skali.
  • Benchmark agreguje oceny wielu próbek według ustalonego protokołu i odpowiada na pytanie „jak dobrze model radzi sobie z tą klasą zadań".

Benchmark definiuje więc: zbiór zadań, podział (np. dev/test), protokół (liczba próbek na zadanie, temperatura, limity), co najmniej jeden scorer oraz sposób agregacji (średnia, przedział ufności, ranking).

Formalnie benchmark agreguje scorer po zadaniach:

ScoreB(M)=agg⁡(s(o1,r1,c1),…,s(oN,rN,cN))Score_B(M) = \operatorname{agg}\left(s(o_1, r_1, c_1), \ldots, s(o_N, r_N, c_N)\right)

gdzie MM to model, ss — scorer, a agg⁡\operatorname{agg} to reguła agregacji (średnia, mediana, ranking). Ta jedna linijka streszcza cały rozdział ról.

Tabela różnic

WymiarScorerBenchmark
Jednostka ocenyjedna odpowiedźzbiór zadań
Wynikliczba / kategoria / paraśrednia, dystrybucja, ranking
Cykl życiastabilne narzędzie pomiaruwersjonowany zbiór i protokół
PrzykładResolved rateSWE-bench Verified

Przykłady złożeń

Dlaczego to rozróżnienie ma znaczenie

  1. Zmiana scorera zmienia wyniki bez zmiany modelu. Ten sam zestaw odpowiedzi może dać inny ranking po zamianie exact match na F1.
  2. Porównywalność istnieje tylko w obrębie protokołu. „Wynik na benchmarku X" znaczy coś wyłącznie przy tej samej wersji zbioru, tym samym scorerze i tych samych ustawieniach próbkowania.
  3. Dobry scorer przeżywa benchmarki. Miary takie jak F1 obsługują dziesiątki benchmarków; sam benchmark bywa jednorazowy.
  4. Poprawny raport to trójka. Wiarygodny wynik to zawsze: który model, na którym zbiorze (i w jakiej wersji), policzony jakim scorerem. Brak jednego z tych elementów to czerwona flaga przy czytaniu tabel wyników.
Scorer a benchmark — dwie różne role