Statystyczny agregatstan na 11 października 2026

Win rate

aliasy: win ratebattle win rateWR

Odsetek bitew, które model wygrywa z danym przeciwnikiem (z opcjonalnym 0,5 punktu za remis). Najprostsza i najbardziej intuicyjna agregacja porównań parami z aren.

Co mierzy

Mierzy, jak często odpowiedzi modelu są preferowane nad odpowiedziami konkretnego przeciwnika w porównaniach parami; remisy dzieli się zwykle po połowie między strony. Jest to miara relacyjna — win rate istnieje tylko dla pary (model, przeciwnik), a „globalny" win rate to średnia po przeciwnikach, silnie zależna od składu puli. W Chatbot Arena win rate jest raportowany obok ratingów Elo/Bradley-Terry, bo bywa czytelniejszy, ale niesie mniej informacji o strukturze porównań.

Wzór

WR(i)=ni≻j+12ni∼jni≻j+nj≻i+ni∼j\mathrm{WR}(i)=\frac{n_{i\succ j}+\tfrac{1}{2}n_{i\sim j}}{n_{i\succ j}+n_{j\succ i}+n_{i\sim j}}

Wejścia

  • zbiór porównań parami dla pary modeli
  • werdykty (wygrana / remis)

Wyjścia

  • win rate w [0,1]
  • procent wygranych bitew

Używany w

Typowe pułapki

  • Win rate bez kontekstu pary nic nie znaczy: „70%" musi określać, przeciw komu i na jakiej puli pytań zostało wyliczone.
  • Dziedziczy biasy sędziów z porównań parami — pozycyjny, verbosity i self-preference — bo jest tylko agregacją ich werdyktów.
  • Przy małej liczbie bitew przedział ufności bywa ogromny; LMArena raportuje CI właśnie po to, by różnice rzędu punktów procentowych nie były nadinterpretowane.
  • Sposób traktowania remisów (czy w ogóle występują i czy liczą się jako 0,5) zmienia wyniki — trzeba podawać konwencję.
  • Średnia po przeciwnikach maskuje strukturę: model może wygrywać z łatwymi przeciwnikami i przegrywać z trudnymi przy tym samym uśrednionym win rate.

Źródła

  1. Chiang i in., „Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference" (arXiv:2403.04132)(stan na 2026-10-10)
  2. LMArena — żywy leaderboard (win rate i ratingi)(stan na 2026-10-10)
  3. Li i in., „Arena-Hard and BenchBuilder Pipeline" (arXiv:2406.11939) — win rate jako miara preferencji(stan na 2026-10-10)
  4. lmarena-ai/leaderboard-dataset — publiczne dane bitew LMArena(stan na 2026-10-10)
Win rate — ashigiri