Scorery oparte na modelu (LLM-as-judge)
LLM-as-judge: przegląd
Aktualizacja: 11 października 2026
Model jako narzędzie pomiaru
Gdy odpowiedź jest otwarta (esej, plan, rozmowa), referencja nie istnieje albo nie wystarcza. Wtedy scorera zastępuje sędzia-LLM: model ocenia odpowiedź według kryterium z promptu. Podejście spopularyzowała praca o ocenianiu z MT-Bench i Chatbot Arena (Zheng i in.).
Formalnie sędzia to
gdzie to parametry modelu sędziego, a — prompt z kryterium oceny. Wszystko, czego nie ma w ani w , sędzia dopowiada sobie sam — stąd wariancja i pułapki opisane niżej.
Trzy podstawowe tryby
| Tryb | Wejście | Wynik | Typowe użycie |
|---|---|---|---|
| Direct scoring | instrukcja, odpowiedź | ocena liczbowa lub etykieta | zgodność z instrukcją, styl |
| Rubryka (G-Eval) | kryteria + definicje | ważona ocena | wielokryterialna ocena otwarta |
| Pairwise | para odpowiedzi | wygrana / remis | preferencje, rankingi |
Karty: LLM-as-judge: direct scoring, G-Eval, LLM-as-judge: pairwise.
Minimalne wywołanie
prompt = (
"Oceń odpowiedź pod kątem zgodności z instrukcją w skali 1-5. "
"Odpowiedz wyłącznie liczbą.\n"
f"Instrukcja: {instruction}\n"
f"Odpowiedź: {answer}"
)
score = call_llm(prompt, temperature=0.0)Trzy decyzje projektowe widać już w tym szkicu: jawna skala (1–5), wymuszony format wyjścia (tylko liczba) i temperatura 0 (powtarzalność).
Co daje sędzia-LLM
- ocenę znaczenia, nie formy — rozumie parafrazy i intencje;
- pracę bez referencji — kryterium zastępuje odpowiedź wzorcową;
- elastyczność — ten sam sędzia obsługuje nowe domeny przez zmianę promptu;
- uzasadnienia — sędzia może zwrócić ocenę wraz z wyjaśnieniem, które da się zdebugować jak zwykły kod.
Kiedy sędzia-LLM jest właściwym wyborem
Sędzia sprawdza się, gdy kryterium jest semantyczne (uprzejmość, przydatność, zgodność z intencją), referencja nie istnieje albo jest droga, a skala ocen wymaga uzasadnienia. Nie używaj sędziego tam, gdzie wystarczy deterministyczne porównanie z kluczem — przepłacasz i dodajesz wariancję, którą potem trzeba mierzyć.
Co zabiera
- koszt — każde porównanie to wywołania modelu;
- wariancję — kolejność opcji, dobór przykładów i wybór sędziego wpływają na wynik;
- pułapki systematyczne — preferencja odpowiedzi własnej rodziny, uprzedzenie pozycyjne, nagradzanie gadatliwości.
Te koszty nie dyskwalifikują sędziego — zmuszają do kalibracji (zob. Dlaczego LLM-as-judge wymaga kalibracji).