Deterministycznystan na 11 października 2026

Exact match (i znormalizowany)

aliasy: EMexact matchdokładne dopasowanie

Zero-jedynkowa metryka porównująca przewidzianą odpowiedź z wzorcową po normalizacji (wielkość liter, interpunkcja, odstępy). Standard w QA i benchmarkach wiedzy, gdzie liczy się dosłowna zgodność z kluczem.

Co mierzy

Mierzy, czy odpowiedź modelu po normalizacji jest identyczna z odpowiedzią wzorcową; każda instancja daje 1 lub 0, a wynik to średnia po zbiorze. Normalizacja w duchu SQuAD usuwa wielkość liter, interpunkcję i nadmiarowe odstępy, ale nie rozwiązuje różnic semantycznych ani formatu liczb. W benchmarkach z łańcuchem rozumowania (MMLU-Pro) najpierw wyodrębnia się odpowiedź finalną z generacji, a dopiero potem porównuje z kluczem.

Wzór

EM=1n∑i=1n1 ⁣[norm(ai)=norm(a^i)]\mathrm{EM}=\frac{1}{n}\sum_{i=1}^{n}\mathbb{1}\!\left[\mathrm{norm}(a_i)=\mathrm{norm}(\hat{a}_i)\right]

Wejścia

  • przewidywana odpowiedź modelu
  • odpowiedź wzorcowa (referencyjna)

Wyjścia

  • udział poprawnych odpowiedzi w [0,1]
  • procent poprawnych odpowiedzi

Używany w

Typowe pułapki

  • Wrażliwość na format: merytorycznie poprawna odpowiedź w innym zapisie (np. „17,5" zamiast „17.5") liczy się jak błąd; normalizacja SQuAD usuwa tylko część różnic.
  • Nie przyznaje punktów cząstkowych — odpowiedź niemal poprawna dostaje tyle samo, co całkowicie błędna (to motywacja dla tokenowej F1 z SQuAD).
  • Przy zadaniach z rozumowaniem wynik zależy od parsera wyodrębniającego odpowiedź finalną (MMLU-Pro), więc błąd ekstrakcji obniża score niezależnie od jakości rozumowania.
  • W benchmarkach numerycznych (np. AIME) wymagana jest normalizacja zapisu liczbowego; bez niej wyniki różnych ewaluacji są nieporównywalne.
  • BFCL sprawdza poprawność wywołań funkcji przez porównanie strukturalne (AST), a nie dosłowną zgodność stringów — tam „exact match" bywa definiowany inaczej niż w QA.
  • Binarny wynik ignoruje pewność modelu i kalibrację; dwie odpowiedzi z identycznym EM mogą różnić się drastycznie co do jakości.

Źródła

  1. Rajpurkar i in., „SQuAD: 100,000+ Questions for Machine Comprehension of Text" (arXiv:1606.05250) — definicja EM i F1(stan na 2026-10-10)
  2. Hugging Face Evaluate — metryka exact_match(stan na 2026-10-10)
  3. Wang i in., „MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark" (arXiv:2406.01574)(stan na 2026-10-10)
  4. Rein i in., „GPQA: A Graduate-Level Google-Proof Q&A Benchmark" (arXiv:2311.12022)(stan na 2026-10-10)
  5. Phan i in., „Humanity’s Last Exam" (arXiv:2501.14249) — grading przez exact match(stan na 2026-10-10)
  6. Berkeley Function-Calling Leaderboard (BFCL) — artykuł ICML 2025 o ewaluacji wywołań funkcji(stan na 2026-10-10)
Exact match (i znormalizowany) — ashigiri