Semantycznystan na 11 października 2026
BERTScore
aliasy: BERTScore-F1BS-F1BERTScore-PBERTScore-R
Podobieństwo semantyczne tekstów mierzone kosinusem między kontekstowymi embeddingami BERT dla każdej pary tokenów, z wagami idf. Koreluje z oceną ludzką lepiej niż metryki n-gramowe.
Co mierzy
Dla każdego tokenu referencji znajduje najbardziej podobny token kandydata (i symetrycznie) po kosinusie embeddingów kontekstowych, następnie agreguje z wagami idf w recall, precision i F1. Wagi idf obniżają wpływ częstych słów funkcyjnych, a opcjonalne przeskalowanie z baseline’em poprawia czytelność wyniku. Mierzy podobieństwo znaczeniowe, ale nie weryfikuje faktów ani spójności logicznej tekstu.
Wzór
Wejścia
- tekst kandydujący
- tekst referencyjny
- model embeddingowy (np. BERT, RoBERTa)
Wyjścia
- precision, recall i F1 BERTScore
- wektory podobieństwa per token
Używany w
Brak powiązanych benchmarków w encyklopedii.
Typowe pułapki
- Wynik zależy od wyboru modelu embeddingowego i warstwy — porównywać można tylko wartości liczone tym samym modelem i konfiguracją.
- Podobieństwo embeddingów nie wykrywa negacji i sprzeczności: zdania o odwróconym znaczeniu mogą mieć wysoką zgodność tokenową.
- Kosztowniejsza obliczeniowo niż metryki n-gramowe, co przy dużych korpusach wymaga GPU lub batchowania.
- Wagi idf wymagają korpusu referencyjnego; przy nietypowej domenie domyślne wagi mogą wypaczać wynik.
- Nie zastępuje oceny poprawności faktycznej — tekst płynny i bliski semantycznie może nadal zmyślać fakty.
Źródła
- Zhang i in., „BERTScore: Evaluating Text Generation with BERT", ICLR 2020 (arXiv:1904.09675)(stan na 2026-10-10)
- Tiiiger/bert_score — oficjalne repozytorium implementacji(stan na 2026-10-10)
- Hugging Face Evaluate — metryka bertscore(stan na 2026-10-10)