Deterministycznystan na 11 października 2026
F1 (na tokenach)
aliasy: F1token-level F1SQuAD F1macro-averaged F1
Średnia harmoniczna precyzji i kompletności liczonych na tokenach wspólnych dla odpowiedzi wzorcowej i przewidywanej. Karze częściowe dopasowania łagodniej niż exact match i jest standardem zadań QA typu SQuAD.
Co mierzy
Mierzy częściową zgodność tekstów: precyzja to udział tokenów przewidywanych występujących we wzorcu, kompletność — udział tokenów wzorca pokrytych przez predykcję, a F1 je równoważy. Wszystkie tokeny ważą tyle samo, więc metryka nagradza trafione słowa kluczowe, ale nie rozumie znaczenia ani ważności tokenów. W SQuAD F1 i EM raportowane są razem, bo F1 łagodzi zero-jedynkowość EM przy dłuższych odpowiedziach.
Wzór
Wejścia
- odpowiedź przewidywana
- odpowiedź wzorcowa
Wyjścia
- F1 w [0,1]
- precyzja i kompletność (osobno)
Używany w
Brak powiązanych benchmarków w encyklopedii.
Typowe pułapki
- Ignoruje znaczenie: poprawna parafraza lub synonim liczy się jak błąd, bo metryka widzi tylko nakładanie się tokenów.
- Wynik zależy od tokenizacji i normalizacji (interpunkcja, wielkość liter) — te same teksty dają różne F1 w różnych implementacjach.
- Równe wagi tokenów oznaczają, że błahe słowa funkcyjne liczą się tak samo jak kluczowe terminy merytoryczne.
- Nie nadaje się do generacji swobodnej (tłumaczenie, streszczanie, dialogi) — tam dominują BLEU/ROUGE i metryki semantyczne.
Źródła
- Rajpurkar i in., „SQuAD: 100,000+ Questions for Machine Comprehension of Text" (arXiv:1606.05250) — definicja tokenowej F1(stan na 2026-10-10)
- Hugging Face Evaluate — metryka squad (EM i F1)(stan na 2026-10-10)
- Zhang i in., „BERTScore: Evaluating Text Generation with BERT" (arXiv:1904.09675) — omówienie ograniczeń F1 na tokenach(stan na 2026-10-10)