Deterministycznystan na 11 października 2026

Accuracy (wielokrotny wybór)

aliasy: accuracyACCdokładność

Udział pytań, w których model wskazał poprawną opcję spośród kilku możliwych. Podstawowa miara benchmarków wielokrotnego wyboru — od MMLU po MMMU-Pro i HLE.

Co mierzy

Mierzy odsetek instancji, w których wybrana przez model opcja (zazwyczaj ta z najwyższym prawdopodobieństwem) zgadza się z kluczem odpowiedzi. Nie ocenia rozumowania ani częściowej wiedzy — liczy się tylko trafność wyboru litery lub treści opcji. W praktyce implementacje różnią się szczegółem: porównanie może dotyczyć wygenerowanej litery, tekstu opcji albo rozkładu logitów nad opcjami.

Wzór

ACC=1n∑i=1n1 ⁣[arg⁡max⁡j∈{1,…,m}pi,j=yi]\mathrm{ACC}=\frac{1}{n}\sum_{i=1}^{n}\mathbb{1}\!\left[\arg\max_{j\in\{1,\dots,m\}}p_{i,j}=y_i\right]

Wejścia

  • wybrana opcja (lub rozkład prawdopodobieństw nad opcjami)
  • klucz odpowiedzi

Wyjścia

  • udział trafień w [0,1]
  • procent poprawnych odpowiedzi

Używany w

Typowe pułapki

  • Wysoki próg szansy: przy m opcjach losowy model zgaduje 1/m, więc małe różnice nad losowością mogą być szumem, zwłaszcza przy małym n.
  • Nie nagradza częściowej wiedzy ani jakości rozumowania — model, który trafnie eliminuje trzy błędne opcje i zgaduje z dwóch, dostaje to samo 0 co zgadujący z dziesięciu.
  • Wynik zależy od sposobu parsowania odpowiedzi: porównywanie wygenerowanej litery (A–D) bywa inne niż porównywanie treści opcji, co utrudnia porównania między ewaluacjami.
  • Modele bywają tendencyjne co do pozycji poprawnej odpowiedzi (bias pozycyjny), co może zawyżać lub zaniżać accuracy w zależności od układu klucza.
  • Nie mierzy kalibracji — model z identyczną accuracy może podawać kompletnie rozstrojone prawdopodobieństwa.

Źródła

  1. Hendrycks i in., „Measuring Massive Multitask Language Understanding" (arXiv:2009.03300) — accuracy na 57 zadaniach MC(stan na 2026-10-10)
  2. Hugging Face Evaluate — metryka accuracy(stan na 2026-10-10)
  3. Wang i in., „MMLU-Pro" (arXiv:2406.01574) — 10 opcji, wybór z rozumowaniem(stan na 2026-10-10)
  4. Yue i in., „MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark" (arXiv:2409.02813)(stan na 2026-10-10)
  5. Phan i in., „Humanity’s Last Exam" (arXiv:2501.14249)(stan na 2026-10-10)
Accuracy (wielokrotny wybór) — ashigiri