Oparty na modelustan na 11 października 2026

LLM-as-judge: direct scoring

aliasy: LLM-as-a-judge (direct)sędzia LLM — ocena bezpośredniarubric scoring

Ocena jakości odpowiedzi przez model językowy działający jako sędzia: czyta prompt, kryteria i odpowiedź, po czym wystawia notę z uzasadnieniem. Stosowany, gdy nie ma jednoznacznego klucza odpowiedzi.

Co mierzy

Mierzy jakość odpowiedzi względem rubryki zdefiniowanej w prompcie — np. przydatność, poprawność, przestrzeganie instrukcji — i zwraca ocenę liczbową (np. 1–10) wraz z wyjaśnieniem. Ocena jest subiektywna w tym sensie, że zależy od modelu-sędziego, treści rubryki i kolejności elementów w prompcie. W benchmarkach agentowych (τ-bench) sędzia sprawdza także, czy działania agenta spełniły warunki zadania użytkownika; wiarygodność metryki wymaga wykazania zgodności z ocenami ludzkimi.

Wzór

Ten scorer nie ma jednego kanonicznego wzoru — logika opisana wyżej.

Wejścia

  • odpowiedź do oceny
  • prompt z kryteriami lub rubryką
  • model-sędzia (LLM)

Wyjścia

  • ocena liczbowa (np. 1–10)
  • uzasadnienie werdyktu

Używany w

Typowe pułapki

  • Bias pozycyjny: kolejność odpowiedzi lub kryteriów w prompcie potrafi zmienić ocenę; MT-Bench pokazuje, że zamiana kolejności odwraca werdykty.
  • Verbosity bias: dłuższe i rozbudowane odpowiedzi bywają oceniane wyżej niezależnie od treści.
  • Self-preference: sędzia faworyzuje odpowiedzi zbliżone do własnego stylu, a czasem własne odpowiedzi — stąd konieczność testów zgodności z ludźmi.
  • Wrażliwość na prompt: drobne zmiany rubryki zmieniają rozkład ocen, więc wyniki różnych ewaluacji rzadko są porównywalne.
  • Koszt: każda ocena to pełne wywołanie modelu; w benchmarkach agentowych koszt sędziego bywa porównywalny z kosztem samego zadania.

Źródła

  1. Zheng i in., „Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena", NeurIPS 2023 (arXiv:2306.05685)(stan na 2026-10-10)
  2. Yao i in., „τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains" (arXiv:2406.12045)(stan na 2026-10-10)
  3. Wang i in., „Large Language Models are not Fair Evaluators" (arXiv:2305.17926) — bias pozycyjny i wrażliwość na prompt(stan na 2026-10-10)
  4. LMSYS, MT-Bench — żywy leaderboard ocen sędziów-LLM(stan na 2026-10-10)
LLM-as-judge: direct scoring — ashigiri