MMMU-Pro
MMMU-Pro to utwardzona wersja MMMU — benchmarku wielodyscyplinarnego rozumienia multimodalnego na poziomie akademickim. Zbiór (1 730 pytań) obejmuje 6 dyscyplin i 30 przedmiotów — od sztuki i biznesu po medycynę i inżynierię — z 32 typami obrazów: wykresy, diagramy, mapy, tabele, nuty czy struktury chemiczne.
Jak powstawał i jak jest punktowany
Względem MMMU autorzy zastosowali trzy kroki: (1) odfiltrowali pytania rozwiązywalne bez patrzenia na obraz, (2) rozszerzyli liczbę opcji odpowiedzi aż do 10, (3) dodali ustawienie vision-only, w którym treść pytania jest osadzona w obrazie. Wynik to dokładność wielokrotnego wyboru — odsetek pytań z poprawnie wskazaną opcją.
Czym się wyróżnia
Ustawienie vision-only zmusza model do jednoczesnego „czytania" i „widzenia" — integracji tekstu i obrazu, czyli umiejętności kluczowej dla ludzi, a trudnej dla modeli. Wyniki na MMMU-Pro są wyraźnie niższe niż na MMMU, a łańcuch myślenia zwykle pomaga, podczas gdy podpowiedzi OCR mają znikomy wpływ.
Główny scorer
Scorery używane w tym benchmarku
Źródła
- ArXiv: MMMU-Pro — A More Robust Multi-discipline Multimodal Understanding Benchmark(stan na 2026-10-10)
- Oficjalny leaderboard MMMU / MMMU-Pro(stan na 2026-10-10)
- Repozytorium MMMU (GitHub)(stan na 2026-10-10)
- Zbiór danych MMMU_Pro (Hugging Face Datasets)(stan na 2026-10-10)