Multimodalnestan na 11 października 2026

MMMU-Pro

MMMU-Pro to utwardzona wersja MMMU — benchmarku wielodyscyplinarnego rozumienia multimodalnego na poziomie akademickim. Zbiór (1 730 pytań) obejmuje 6 dyscyplin i 30 przedmiotów — od sztuki i biznesu po medycynę i inżynierię — z 32 typami obrazów: wykresy, diagramy, mapy, tabele, nuty czy struktury chemiczne.

Jak powstawał i jak jest punktowany

Względem MMMU autorzy zastosowali trzy kroki: (1) odfiltrowali pytania rozwiązywalne bez patrzenia na obraz, (2) rozszerzyli liczbę opcji odpowiedzi aż do 10, (3) dodali ustawienie vision-only, w którym treść pytania jest osadzona w obrazie. Wynik to dokładność wielokrotnego wyboru — odsetek pytań z poprawnie wskazaną opcją.

Czym się wyróżnia

Ustawienie vision-only zmusza model do jednoczesnego „czytania" i „widzenia" — integracji tekstu i obrazu, czyli umiejętności kluczowej dla ludzi, a trudnej dla modeli. Wyniki na MMMU-Pro są wyraźnie niższe niż na MMMU, a łańcuch myślenia zwykle pomaga, podczas gdy podpowiedzi OCR mają znikomy wpływ.

Główny scorer

Scorery używane w tym benchmarku

Źródła

  1. ArXiv: MMMU-Pro — A More Robust Multi-discipline Multimodal Understanding Benchmark(stan na 2026-10-10)
  2. Oficjalny leaderboard MMMU / MMMU-Pro(stan na 2026-10-10)
  3. Repozytorium MMMU (GitHub)(stan na 2026-10-10)
  4. Zbiór danych MMMU_Pro (Hugging Face Datasets)(stan na 2026-10-10)
MMMU-Pro — ashigiri