Scorery oparte na modelu (LLM-as-judge)

Dlaczego LLM-as-judge wymaga kalibracji

Aktualizacja: 11 października 2026

Skala sędziego nie jest skalą absolutną

Sędzia-LLM zwraca liczbę, ale to nie jest pomiar w sensie fizycznym: ta sama odpowiedź dostaje różne oceny przy zmianie kolejności opcji, sformułowania promptu czy pozycji w kontekście. Zanim wynikom sędziego zaufasz, trzeba je skalibrować — zmierzyć, jak bardzo zgadzają się z etykietami odniesienia i same ze sobą.

Dwa poziomy kalibracji

  1. Zgodność z ludźmi. Na podzbiorze próbek porównaj oceny sędziego z etykietami ludzkimi. Standardowa miara dla ocen kategorycznych to kappa Cohena:

κ=po−pe1−pe\kappa = \frac{p_o - p_e}{1 - p_e}

gdzie pop_o to zaobserwowana zgodność, a pep_e zgodność losowa. Niska κ\kappa oznacza, że sędzia nie mierzy tego, co ludzie. Skale sędziego dryfują też w czasie: nowsze modele zmieniają rozkład ocen na tych samych tekstach, dlatego kalibrację powtarza się przy każdej zmianie sędziego.

  1. Stabilność sędziego. Ten sam sędzia powinien dawać ten sam werdykt po zamianie kolejności opcji i po powtórnym wywołaniu. Brak stabilności to wariancja, której nie naprawi większa próbka odpowiedzi.

Znane pułapki systematyczne

  • uprzedzenie pozycyjne — sędzia faworyzuje pierwszą (lub drugą) opcję; mitygacja: oceniaj każdą parę w obu kolejnościach i żądaj spójności;
  • nagradzanie długości — dłuższe odpowiedzi dostają lepsze oceny niezależnie od treści;
  • preferencja własnej rodziny — sędzia wyżej ocenia odpowiedzi modeli podobnych do siebie (Wang i in.).

Protokół minimalny

def pairwise_verdict(judge, a, b) -> str:
    v1 = judge(first=a, second=b)   # porządek A, B
    v2 = judge(first=b, second=a)   # porządek B, A
    if v1.winner != v2.loser:       # brak spójności po zamianie
        return "tie"                # nie licz jako wygranej
    return v1.winner

Werdykty z takiej procedury agreguj dopiero potem w Win rate lub Elo / Bradley-Terry.

Jak raportować kalibrację

Przy publikacji wyników sędziego podaj: wersję modelu sędziego, prompt (hash lub pełny tekst), temperaturę, liczbę próbek kalibracyjnych i miarę zgodności (np. κ\kappa). Bez tych metadanych werdykty sędziego są nieodtwarzalne — a nieodtwarzalny pomiar to anegdota.

Dlaczego LLM-as-judge wymaga kalibracji