Wiedzastan na 11 października 2026

MMLU-Pro

MMLU-Pro to utwardzona, mocniej wymagająca wersja klasycznego MMLU, stworzona, gdy wyniki najlepszych modeli na oryginalnym teście zaczęły się wysycać. Zbiór zawiera ponad 12 tysięcy pytań wielokrotnego wyboru z 14 dziedzin (matematyka, fizyka, prawo, inżynieria, biologia, ekonomia, filozofia i inne), opartych na oryginalnych pytaniach MMLU oraz nowych, trudniejszych pozycjach — z naciskiem na rozumowanie, a nie czystą wiedzę encyklopedyczną.

Format zadań i punktacja

Każde pytanie ma 10 opcji odpowiedzi zamiast 4, co dziesięciokrotnie obniża szansę zgadnięcia (próg losowy spada do 10%). Wynik to odsetek poprawnych odpowiedzi: Exact match porównuje wskazaną opcję ze wzorcem, a końcowy rezultat jest agregowany jako dokładność testu wielokrotnego wyboru:

accuracy=liczba poprawnych odpowiedziliczba wszystkich pytanˊaccuracy = \frac{\text{liczba poprawnych odpowiedzi}}{\text{liczba wszystkich pytań}}

Czym się wyróżnia

Autorzy usunęli trywialne i zaszumione pytania z MMLU; w porównaniu z oryginałem wyniki modeli spadają o kilkanaście do kilkudziesięciu punktów procentowych, a wrażliwość na zmianę promptu zmalała do około 2%. To dziś jeden ze standardowych testów „wiedzy ogólnej" w kartach modeli.

Główny scorer

Scorery używane w tym benchmarku

Źródła

  1. ArXiv: MMLU-Pro — A More Robust and Challenging Multi-Task Language Understanding Benchmark(stan na 2026-10-10)
  2. Żywy leaderboard MMLU-Pro (Hugging Face, TIGER-Lab)(stan na 2026-10-10)
  3. Zbiór danych MMLU-Pro (Hugging Face Datasets)(stan na 2026-10-10)
  4. Repozytorium MMLU-Pro (GitHub, TIGER-AI-Lab)(stan na 2026-10-10)
MMLU-Pro — ashigiri