Deterministycznystan na 11 października 2026

F1 (na tokenach)

aliasy: F1token-level F1SQuAD F1macro-averaged F1

Średnia harmoniczna precyzji i kompletności liczonych na tokenach wspólnych dla odpowiedzi wzorcowej i przewidywanej. Karze częściowe dopasowania łagodniej niż exact match i jest standardem zadań QA typu SQuAD.

Co mierzy

Mierzy częściową zgodność tekstów: precyzja to udział tokenów przewidywanych występujących we wzorcu, kompletność — udział tokenów wzorca pokrytych przez predykcję, a F1 je równoważy. Wszystkie tokeny ważą tyle samo, więc metryka nagradza trafione słowa kluczowe, ale nie rozumie znaczenia ani ważności tokenów. W SQuAD F1 i EM raportowane są razem, bo F1 łagodzi zero-jedynkowość EM przy dłuższych odpowiedziach.

Wzór

F1=2PRP+R,P=∣Ta∩Ta^∣∣Ta^∣,R=∣Ta∩Ta^∣∣Ta∣F_1=\frac{2PR}{P+R},\qquad P=\frac{|T_a\cap T_{\hat{a}}|}{|T_{\hat{a}}|},\qquad R=\frac{|T_a\cap T_{\hat{a}}|}{|T_a|}

Wejścia

  • odpowiedź przewidywana
  • odpowiedź wzorcowa

Wyjścia

  • F1 w [0,1]
  • precyzja i kompletność (osobno)

Używany w

Brak powiązanych benchmarków w encyklopedii.

Typowe pułapki

  • Ignoruje znaczenie: poprawna parafraza lub synonim liczy się jak błąd, bo metryka widzi tylko nakładanie się tokenów.
  • Wynik zależy od tokenizacji i normalizacji (interpunkcja, wielkość liter) — te same teksty dają różne F1 w różnych implementacjach.
  • Równe wagi tokenów oznaczają, że błahe słowa funkcyjne liczą się tak samo jak kluczowe terminy merytoryczne.
  • Nie nadaje się do generacji swobodnej (tłumaczenie, streszczanie, dialogi) — tam dominują BLEU/ROUGE i metryki semantyczne.

Źródła

  1. Rajpurkar i in., „SQuAD: 100,000+ Questions for Machine Comprehension of Text" (arXiv:1606.05250) — definicja tokenowej F1(stan na 2026-10-10)
  2. Hugging Face Evaluate — metryka squad (EM i F1)(stan na 2026-10-10)
  3. Zhang i in., „BERTScore: Evaluating Text Generation with BERT" (arXiv:1904.09675) — omówienie ograniczeń F1 na tokenach(stan na 2026-10-10)
F1 (na tokenach) — ashigiri