LLM-as-judge: direct scoring
aliasy: LLM-as-a-judge (direct)sędzia LLM — ocena bezpośredniarubric scoring
Ocena jakości odpowiedzi przez model językowy działający jako sędzia: czyta prompt, kryteria i odpowiedź, po czym wystawia notę z uzasadnieniem. Stosowany, gdy nie ma jednoznacznego klucza odpowiedzi.
Co mierzy
Mierzy jakość odpowiedzi względem rubryki zdefiniowanej w prompcie — np. przydatność, poprawność, przestrzeganie instrukcji — i zwraca ocenę liczbową (np. 1–10) wraz z wyjaśnieniem. Ocena jest subiektywna w tym sensie, że zależy od modelu-sędziego, treści rubryki i kolejności elementów w prompcie. W benchmarkach agentowych (τ-bench) sędzia sprawdza także, czy działania agenta spełniły warunki zadania użytkownika; wiarygodność metryki wymaga wykazania zgodności z ocenami ludzkimi.
Wzór
Ten scorer nie ma jednego kanonicznego wzoru — logika opisana wyżej.
Wejścia
- odpowiedź do oceny
- prompt z kryteriami lub rubryką
- model-sędzia (LLM)
Wyjścia
- ocena liczbowa (np. 1–10)
- uzasadnienie werdyktu
Używany w
Typowe pułapki
- Bias pozycyjny: kolejność odpowiedzi lub kryteriów w prompcie potrafi zmienić ocenę; MT-Bench pokazuje, że zamiana kolejności odwraca werdykty.
- Verbosity bias: dłuższe i rozbudowane odpowiedzi bywają oceniane wyżej niezależnie od treści.
- Self-preference: sędzia faworyzuje odpowiedzi zbliżone do własnego stylu, a czasem własne odpowiedzi — stąd konieczność testów zgodności z ludźmi.
- Wrażliwość na prompt: drobne zmiany rubryki zmieniają rozkład ocen, więc wyniki różnych ewaluacji rzadko są porównywalne.
- Koszt: każda ocena to pełne wywołanie modelu; w benchmarkach agentowych koszt sędziego bywa porównywalny z kosztem samego zadania.
Źródła
- Zheng i in., „Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena", NeurIPS 2023 (arXiv:2306.05685)(stan na 2026-10-10)
- Yao i in., „τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains" (arXiv:2406.12045)(stan na 2026-10-10)
- Wang i in., „Large Language Models are not Fair Evaluators" (arXiv:2305.17926) — bias pozycyjny i wrażliwość na prompt(stan na 2026-10-10)
- LMSYS, MT-Bench — żywy leaderboard ocen sędziów-LLM(stan na 2026-10-10)