Oparty na modelustan na 11 października 2026

LLM-as-judge: pairwise

aliasy: LLM-as-a-judge (pairwise)porównanie paramiarena judgebattle

Porównanie dwóch odpowiedzi na to samo pytanie przez sędziego-LLM, który wskazuje lepszą (lub remis) i uzasadnia wybór. Surowiec rankingów typu Chatbot Arena i podstawowych win rate’ów.

Co mierzy

Mierzy względną preferencję między dwiema odpowiedziami: sędzia dostaje pytanie i parę (A, B), a zwraca werdykt A wygrywa / B wygrywa / remis z uzasadnieniem. Wynik ma sens tylko w kontekście pary i puli pytań — pojedynczy werdykt nie mówi nic o poziomie absolutnym. Zbiorcze werdykty z wielu bitew są następnie agregowane w win rate lub w ratingi Elo/Bradley-Terry; porównania parami redukują problem kalibracji skali liczbowej, ale dziedziczą biasy sędziego.

Wzór

Ten scorer nie ma jednego kanonicznego wzoru — logika opisana wyżej.

Wejścia

  • dwie odpowiedzi (A i B) na to samo pytanie
  • prompt bazowy
  • model-sędzia (LLM)

Wyjścia

  • werdykt: A wygrywa / B wygrywa / remis
  • uzasadnienie wyboru

Używany w

Typowe pułapki

  • Bias pozycyjny: ten sam sędzia potrafi zmienić werdykt po zamianie kolejności odpowiedzi — standardem jest losowanie kolejności i uśrednianie obu ustawień.
  • Verbosity bias: dłuższe odpowiedzi wygrywają częściej niezależnie od jakości; sędzia nagradza styl, niekoniecznie treść.
  • Self-enhancement bias: sędzia preferuje odpowiedzi podobne do własnych generacji, co faworyzuje modele z tej samej rodziny.
  • Werdykt zależy od puli pytań — zmiana zestawu bitew przesuwa rankingi, więc wyniki z różnych aren nie są porównywalne.
  • Pojedyncze porównanie nie daje skali absolutnej; sens nabiera dopiero agregacja wielu bitew (win rate, Elo), która z kolei wymaga kontroli liczebności i wariancji.

Źródła

  1. Chiang i in., „Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference" (arXiv:2403.04132)(stan na 2026-10-10)
  2. Zheng i in., „Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena" (arXiv:2306.05685) — bias pozycyjny i zgodność z ludźmi(stan na 2026-10-10)
  3. LMArena — żywy leaderboard porównań parami(stan na 2026-10-10)
  4. Li i in., „From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline" (arXiv:2406.11939)(stan na 2026-10-10)
LLM-as-judge: pairwise — ashigiri