Statystyczny agregatstan na 11 października 2026

Elo / Bradley-Terry

aliasy: EloBradley-TerryBT modelrating

Statystyczne modele zamieniające wyniki porównań parami na ciągłą skalę siły modeli. Elo aktualizuje rating po każdej bitwie; Bradley-Terry estymuje siły metodą największej wiarygodności z całej macierzy porównań.

Co mierzy

Mierzy względną siłę modeli na wspólnej skali liczbowej wyznaczonej wyłącznie z wyników bitew. Model Bradleya-Terry’ego zakłada, że prawdopodobieństwo wygranej i nad j zależy tylko od różnicy sił r_i, r_j; Chatbot Arena dopasowuje go do wszystkich zebranych porównań i raportuje ratingi z przedziałami ufności. Elo (z szachów) robi to samo przyrostowo: po każdej bitwie koryguje rating o K razy różnicę między wynikiem a oczekiwaniem. Skala jest względna — zależy od puli porównań, a nie od absolutnego poziomu umiejętności.

Wzór

P(i≻j)=erieri+erj,Ei=11+10(Rj−Ri)/400,Ri′=Ri+K⋅(Si−Ei)P(i\succ j)=\frac{e^{r_i}}{e^{r_i}+e^{r_j}},\qquad E_i=\frac{1}{1+10^{(R_j-R_i)/400}},\qquad R'_i=R_i+K\cdot(S_i-E_i)

Wejścia

  • wyniki porównań parami (kto kogo pokonał)
  • kolejność bitew (dla aktualizacji Elo)

Wyjścia

  • rating Elo lub siła Bradley-Terry
  • przedziały ufności ratingów

Używany w

Typowe pułapki

  • Ratingi zależą od puli porównań: ten sam model dostanie inny rating, gdy zmieni się zestaw przeciwników i pytań w arenie.
  • Modele z małą liczbą bitew mają ogromną wariancję ratingu — pojedyncze wyniki potrafią przetasować ranking.
  • Model zakłada stacjonarność i przechodniość preferencji; naruszenia (A wygrywa z B, B z C, ale C z A) osłabiają sens pojedynczej liczby.
  • Wartość K, warunki startowe i renormalizacja zmieniają skalę — porównywanie surowych liczb między arenami jest bezsensowne.
  • Rating nie mierzy poziomu absolutnego: mówi tylko, kto jest silniejszy w danej populacji porównań.

Źródła

  1. Bradley, Terry, „Rank Analysis of Incomplete Block Designs: I. The Method of Paired Comparisons", Biometrika 39(3/4), 1952(stan na 2026-10-10)
  2. Chiang i in., „Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference" (arXiv:2403.04132) — dopasowanie Bradley-Terry i przedziały ufności(stan na 2026-10-10)
  3. LMArena — żywy leaderboard z ratingami(stan na 2026-10-10)
  4. FIDE, „Anniversary of Arpad Elo — rating system that changed chess world" — geneza systemu Elo(stan na 2026-10-10)
Elo / Bradley-Terry — ashigiri