Scorery oparte na modelu (LLM-as-judge)
Dlaczego LLM-as-judge wymaga kalibracji
Aktualizacja: 11 października 2026
Skala sędziego nie jest skalą absolutną
Sędzia-LLM zwraca liczbę, ale to nie jest pomiar w sensie fizycznym: ta sama odpowiedź dostaje różne oceny przy zmianie kolejności opcji, sformułowania promptu czy pozycji w kontekście. Zanim wynikom sędziego zaufasz, trzeba je skalibrować — zmierzyć, jak bardzo zgadzają się z etykietami odniesienia i same ze sobą.
Dwa poziomy kalibracji
- Zgodność z ludźmi. Na podzbiorze próbek porównaj oceny sędziego z etykietami ludzkimi. Standardowa miara dla ocen kategorycznych to kappa Cohena:
gdzie to zaobserwowana zgodność, a zgodność losowa. Niska oznacza, że sędzia nie mierzy tego, co ludzie. Skale sędziego dryfują też w czasie: nowsze modele zmieniają rozkład ocen na tych samych tekstach, dlatego kalibrację powtarza się przy każdej zmianie sędziego.
- Stabilność sędziego. Ten sam sędzia powinien dawać ten sam werdykt po zamianie kolejności opcji i po powtórnym wywołaniu. Brak stabilności to wariancja, której nie naprawi większa próbka odpowiedzi.
Znane pułapki systematyczne
- uprzedzenie pozycyjne — sędzia faworyzuje pierwszą (lub drugą) opcję; mitygacja: oceniaj każdą parę w obu kolejnościach i żądaj spójności;
- nagradzanie długości — dłuższe odpowiedzi dostają lepsze oceny niezależnie od treści;
- preferencja własnej rodziny — sędzia wyżej ocenia odpowiedzi modeli podobnych do siebie (Wang i in.).
Protokół minimalny
def pairwise_verdict(judge, a, b) -> str:
v1 = judge(first=a, second=b) # porządek A, B
v2 = judge(first=b, second=a) # porządek B, A
if v1.winner != v2.loser: # brak spójności po zamianie
return "tie" # nie licz jako wygranej
return v1.winnerWerdykty z takiej procedury agreguj dopiero potem w Win rate lub Elo / Bradley-Terry.
Jak raportować kalibrację
Przy publikacji wyników sędziego podaj: wersję modelu sędziego, prompt (hash lub pełny tekst), temperaturę, liczbę próbek kalibracyjnych i miarę zgodności (np. ). Bez tych metadanych werdykty sędziego są nieodtwarzalne — a nieodtwarzalny pomiar to anegdota.