Semantycznystan na 11 października 2026

BERTScore

aliasy: BERTScore-F1BS-F1BERTScore-PBERTScore-R

Podobieństwo semantyczne tekstów mierzone kosinusem między kontekstowymi embeddingami BERT dla każdej pary tokenów, z wagami idf. Koreluje z oceną ludzką lepiej niż metryki n-gramowe.

Co mierzy

Dla każdego tokenu referencji znajduje najbardziej podobny token kandydata (i symetrycznie) po kosinusie embeddingów kontekstowych, następnie agreguje z wagami idf w recall, precision i F1. Wagi idf obniżają wpływ częstych słów funkcyjnych, a opcjonalne przeskalowanie z baseline’em poprawia czytelność wyniku. Mierzy podobieństwo znaczeniowe, ale nie weryfikuje faktów ani spójności logicznej tekstu.

Wzór

RBERT=1∣x∣∑xi∈xidf(xi)max⁡x^j∈x^xi⊤x^j∥xi∥∥x^j∥,FBERT=2 PBERTRBERTPBERT+RBERTR_{\mathrm{BERT}}=\frac{1}{|x|}\sum_{x_i\in x}\mathrm{idf}(x_i)\max_{\hat{x}_j\in\hat{x}}\frac{x_i^{\top}\hat{x}_j}{\lVert x_i\rVert\lVert\hat{x}_j\rVert},\qquad F_{\mathrm{BERT}}=\frac{2\,P_{\mathrm{BERT}}R_{\mathrm{BERT}}}{P_{\mathrm{BERT}}+R_{\mathrm{BERT}}}

Wejścia

  • tekst kandydujący
  • tekst referencyjny
  • model embeddingowy (np. BERT, RoBERTa)

Wyjścia

  • precision, recall i F1 BERTScore
  • wektory podobieństwa per token

Używany w

Brak powiązanych benchmarków w encyklopedii.

Typowe pułapki

  • Wynik zależy od wyboru modelu embeddingowego i warstwy — porównywać można tylko wartości liczone tym samym modelem i konfiguracją.
  • Podobieństwo embeddingów nie wykrywa negacji i sprzeczności: zdania o odwróconym znaczeniu mogą mieć wysoką zgodność tokenową.
  • Kosztowniejsza obliczeniowo niż metryki n-gramowe, co przy dużych korpusach wymaga GPU lub batchowania.
  • Wagi idf wymagają korpusu referencyjnego; przy nietypowej domenie domyślne wagi mogą wypaczać wynik.
  • Nie zastępuje oceny poprawności faktycznej — tekst płynny i bliski semantycznie może nadal zmyślać fakty.

Źródła

  1. Zhang i in., „BERTScore: Evaluating Text Generation with BERT", ICLR 2020 (arXiv:1904.09675)(stan na 2026-10-10)
  2. Tiiiger/bert_score — oficjalne repozytorium implementacji(stan na 2026-10-10)
  3. Hugging Face Evaluate — metryka bertscore(stan na 2026-10-10)
BERTScore — ashigiri