LLM-as-judge: pairwise
aliasy: LLM-as-a-judge (pairwise)porównanie paramiarena judgebattle
Porównanie dwóch odpowiedzi na to samo pytanie przez sędziego-LLM, który wskazuje lepszą (lub remis) i uzasadnia wybór. Surowiec rankingów typu Chatbot Arena i podstawowych win rate’ów.
Co mierzy
Mierzy względną preferencję między dwiema odpowiedziami: sędzia dostaje pytanie i parę (A, B), a zwraca werdykt A wygrywa / B wygrywa / remis z uzasadnieniem. Wynik ma sens tylko w kontekście pary i puli pytań — pojedynczy werdykt nie mówi nic o poziomie absolutnym. Zbiorcze werdykty z wielu bitew są następnie agregowane w win rate lub w ratingi Elo/Bradley-Terry; porównania parami redukują problem kalibracji skali liczbowej, ale dziedziczą biasy sędziego.
Wzór
Ten scorer nie ma jednego kanonicznego wzoru — logika opisana wyżej.
Wejścia
- dwie odpowiedzi (A i B) na to samo pytanie
- prompt bazowy
- model-sędzia (LLM)
Wyjścia
- werdykt: A wygrywa / B wygrywa / remis
- uzasadnienie wyboru
Używany w
Typowe pułapki
- Bias pozycyjny: ten sam sędzia potrafi zmienić werdykt po zamianie kolejności odpowiedzi — standardem jest losowanie kolejności i uśrednianie obu ustawień.
- Verbosity bias: dłuższe odpowiedzi wygrywają częściej niezależnie od jakości; sędzia nagradza styl, niekoniecznie treść.
- Self-enhancement bias: sędzia preferuje odpowiedzi podobne do własnych generacji, co faworyzuje modele z tej samej rodziny.
- Werdykt zależy od puli pytań — zmiana zestawu bitew przesuwa rankingi, więc wyniki z różnych aren nie są porównywalne.
- Pojedyncze porównanie nie daje skali absolutnej; sens nabiera dopiero agregacja wielu bitew (win rate, Elo), która z kolei wymaga kontroli liczebności i wariancji.
Źródła
- Chiang i in., „Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference" (arXiv:2403.04132)(stan na 2026-10-10)
- Zheng i in., „Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena" (arXiv:2306.05685) — bias pozycyjny i zgodność z ludźmi(stan na 2026-10-10)
- LMArena — żywy leaderboard porównań parami(stan na 2026-10-10)
- Li i in., „From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline" (arXiv:2406.11939)(stan na 2026-10-10)