Scorery oparte na modelu (LLM-as-judge)

LLM-as-judge: przegląd

Aktualizacja: 11 października 2026

Model jako narzędzie pomiaru

Gdy odpowiedź jest otwarta (esej, plan, rozmowa), referencja nie istnieje albo nie wystarcza. Wtedy scorera zastępuje sędzia-LLM: model ocenia odpowiedź według kryterium z promptu. Podejście spopularyzowała praca o ocenianiu z MT-Bench i Chatbot Arena (Zheng i in.).

Formalnie sędzia to

s(o,c)=judge⁡θ(p,o,c)s(o, c) = \operatorname{judge}_{\theta}(p, o, c)

gdzie θ\theta to parametry modelu sędziego, a pp — prompt z kryterium oceny. Wszystko, czego nie ma w pp ani w cc, sędzia dopowiada sobie sam — stąd wariancja i pułapki opisane niżej.

Trzy podstawowe tryby

TrybWejścieWynikTypowe użycie
Direct scoringinstrukcja, odpowiedźocena liczbowa lub etykietazgodność z instrukcją, styl
Rubryka (G-Eval)kryteria + definicjeważona ocenawielokryterialna ocena otwarta
Pairwisepara odpowiedziwygrana / remispreferencje, rankingi

Karty: LLM-as-judge: direct scoring, G-Eval, LLM-as-judge: pairwise.

Minimalne wywołanie

prompt = (
    "Oceń odpowiedź pod kątem zgodności z instrukcją w skali 1-5. "
    "Odpowiedz wyłącznie liczbą.\n"
    f"Instrukcja: {instruction}\n"
    f"Odpowiedź: {answer}"
)
score = call_llm(prompt, temperature=0.0)

Trzy decyzje projektowe widać już w tym szkicu: jawna skala (1–5), wymuszony format wyjścia (tylko liczba) i temperatura 0 (powtarzalność).

Co daje sędzia-LLM

  • ocenę znaczenia, nie formy — rozumie parafrazy i intencje;
  • pracę bez referencji — kryterium zastępuje odpowiedź wzorcową;
  • elastyczność — ten sam sędzia obsługuje nowe domeny przez zmianę promptu;
  • uzasadnienia — sędzia może zwrócić ocenę wraz z wyjaśnieniem, które da się zdebugować jak zwykły kod.

Kiedy sędzia-LLM jest właściwym wyborem

Sędzia sprawdza się, gdy kryterium jest semantyczne (uprzejmość, przydatność, zgodność z intencją), referencja nie istnieje albo jest droga, a skala ocen wymaga uzasadnienia. Nie używaj sędziego tam, gdzie wystarczy deterministyczne porównanie z kluczem — przepłacasz i dodajesz wariancję, którą potem trzeba mierzyć.

Co zabiera

  • koszt — każde porównanie to wywołania modelu;
  • wariancję — kolejność opcji, dobór przykładów i wybór sędziego wpływają na wynik;
  • pułapki systematyczne — preferencja odpowiedzi własnej rodziny, uprzedzenie pozycyjne, nagradzanie gadatliwości.

Te koszty nie dyskwalifikują sędziego — zmuszają do kalibracji (zob. Dlaczego LLM-as-judge wymaga kalibracji).

LLM-as-judge: przegląd