Statystyczny agregatstan na 11 października 2026
Win rate
aliasy: win ratebattle win rateWR
Odsetek bitew, które model wygrywa z danym przeciwnikiem (z opcjonalnym 0,5 punktu za remis). Najprostsza i najbardziej intuicyjna agregacja porównań parami z aren.
Co mierzy
Mierzy, jak często odpowiedzi modelu są preferowane nad odpowiedziami konkretnego przeciwnika w porównaniach parami; remisy dzieli się zwykle po połowie między strony. Jest to miara relacyjna — win rate istnieje tylko dla pary (model, przeciwnik), a „globalny" win rate to średnia po przeciwnikach, silnie zależna od składu puli. W Chatbot Arena win rate jest raportowany obok ratingów Elo/Bradley-Terry, bo bywa czytelniejszy, ale niesie mniej informacji o strukturze porównań.
Wzór
Wejścia
- zbiór porównań parami dla pary modeli
- werdykty (wygrana / remis)
Wyjścia
- win rate w [0,1]
- procent wygranych bitew
Używany w
Typowe pułapki
- Win rate bez kontekstu pary nic nie znaczy: „70%" musi określać, przeciw komu i na jakiej puli pytań zostało wyliczone.
- Dziedziczy biasy sędziów z porównań parami — pozycyjny, verbosity i self-preference — bo jest tylko agregacją ich werdyktów.
- Przy małej liczbie bitew przedział ufności bywa ogromny; LMArena raportuje CI właśnie po to, by różnice rzędu punktów procentowych nie były nadinterpretowane.
- Sposób traktowania remisów (czy w ogóle występują i czy liczą się jako 0,5) zmienia wyniki — trzeba podawać konwencję.
- Średnia po przeciwnikach maskuje strukturę: model może wygrywać z łatwymi przeciwnikami i przegrywać z trudnymi przy tym samym uśrednionym win rate.
Źródła
- Chiang i in., „Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference" (arXiv:2403.04132)(stan na 2026-10-10)
- LMArena — żywy leaderboard (win rate i ratingi)(stan na 2026-10-10)
- Li i in., „Arena-Hard and BenchBuilder Pipeline" (arXiv:2406.11939) — win rate jako miara preferencji(stan na 2026-10-10)
- lmarena-ai/leaderboard-dataset — publiczne dane bitew LMArena(stan na 2026-10-10)