Deterministycznystan na 11 października 2026
Exact match (i znormalizowany)
aliasy: EMexact matchdokładne dopasowanie
Zero-jedynkowa metryka porównująca przewidzianą odpowiedź z wzorcową po normalizacji (wielkość liter, interpunkcja, odstępy). Standard w QA i benchmarkach wiedzy, gdzie liczy się dosłowna zgodność z kluczem.
Co mierzy
Mierzy, czy odpowiedź modelu po normalizacji jest identyczna z odpowiedzią wzorcową; każda instancja daje 1 lub 0, a wynik to średnia po zbiorze. Normalizacja w duchu SQuAD usuwa wielkość liter, interpunkcję i nadmiarowe odstępy, ale nie rozwiązuje różnic semantycznych ani formatu liczb. W benchmarkach z łańcuchem rozumowania (MMLU-Pro) najpierw wyodrębnia się odpowiedź finalną z generacji, a dopiero potem porównuje z kluczem.
Wzór
Wejścia
- przewidywana odpowiedź modelu
- odpowiedź wzorcowa (referencyjna)
Wyjścia
- udział poprawnych odpowiedzi w [0,1]
- procent poprawnych odpowiedzi
Używany w
Typowe pułapki
- Wrażliwość na format: merytorycznie poprawna odpowiedź w innym zapisie (np. „17,5" zamiast „17.5") liczy się jak błąd; normalizacja SQuAD usuwa tylko część różnic.
- Nie przyznaje punktów cząstkowych — odpowiedź niemal poprawna dostaje tyle samo, co całkowicie błędna (to motywacja dla tokenowej F1 z SQuAD).
- Przy zadaniach z rozumowaniem wynik zależy od parsera wyodrębniającego odpowiedź finalną (MMLU-Pro), więc błąd ekstrakcji obniża score niezależnie od jakości rozumowania.
- W benchmarkach numerycznych (np. AIME) wymagana jest normalizacja zapisu liczbowego; bez niej wyniki różnych ewaluacji są nieporównywalne.
- BFCL sprawdza poprawność wywołań funkcji przez porównanie strukturalne (AST), a nie dosłowną zgodność stringów — tam „exact match" bywa definiowany inaczej niż w QA.
- Binarny wynik ignoruje pewność modelu i kalibrację; dwie odpowiedzi z identycznym EM mogą różnić się drastycznie co do jakości.
Źródła
- Rajpurkar i in., „SQuAD: 100,000+ Questions for Machine Comprehension of Text" (arXiv:1606.05250) — definicja EM i F1(stan na 2026-10-10)
- Hugging Face Evaluate — metryka exact_match(stan na 2026-10-10)
- Wang i in., „MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark" (arXiv:2406.01574)(stan na 2026-10-10)
- Rein i in., „GPQA: A Graduate-Level Google-Proof Q&A Benchmark" (arXiv:2311.12022)(stan na 2026-10-10)
- Phan i in., „Humanity’s Last Exam" (arXiv:2501.14249) — grading przez exact match(stan na 2026-10-10)
- Berkeley Function-Calling Leaderboard (BFCL) — artykuł ICML 2025 o ewaluacji wywołań funkcji(stan na 2026-10-10)