MMLU-Pro
MMLU-Pro to utwardzona, mocniej wymagająca wersja klasycznego MMLU, stworzona, gdy wyniki najlepszych modeli na oryginalnym teście zaczęły się wysycać. Zbiór zawiera ponad 12 tysięcy pytań wielokrotnego wyboru z 14 dziedzin (matematyka, fizyka, prawo, inżynieria, biologia, ekonomia, filozofia i inne), opartych na oryginalnych pytaniach MMLU oraz nowych, trudniejszych pozycjach — z naciskiem na rozumowanie, a nie czystą wiedzę encyklopedyczną.
Format zadań i punktacja
Każde pytanie ma 10 opcji odpowiedzi zamiast 4, co dziesięciokrotnie obniża szansę zgadnięcia (próg losowy spada do 10%). Wynik to odsetek poprawnych odpowiedzi: Exact match porównuje wskazaną opcję ze wzorcem, a końcowy rezultat jest agregowany jako dokładność testu wielokrotnego wyboru:
Czym się wyróżnia
Autorzy usunęli trywialne i zaszumione pytania z MMLU; w porównaniu z oryginałem wyniki modeli spadają o kilkanaście do kilkudziesięciu punktów procentowych, a wrażliwość na zmianę promptu zmalała do około 2%. To dziś jeden ze standardowych testów „wiedzy ogólnej" w kartach modeli.
Główny scorer
Scorery używane w tym benchmarku
Źródła
- ArXiv: MMLU-Pro — A More Robust and Challenging Multi-Task Language Understanding Benchmark(stan na 2026-10-10)
- Żywy leaderboard MMLU-Pro (Hugging Face, TIGER-Lab)(stan na 2026-10-10)
- Zbiór danych MMLU-Pro (Hugging Face Datasets)(stan na 2026-10-10)
- Repozytorium MMLU-Pro (GitHub, TIGER-AI-Lab)(stan na 2026-10-10)