Deterministycznystan na 11 października 2026

ROUGE

aliasy: ROUGE-NROUGE-LROUGE-LsumROUGE-W

Rodzina metryk pokrycia n-gramów i najdłuższej wspólnej podsekwencji (LCS) między streszczeniem a referencją. Od dwóch dekad domyślny standard automatycznej oceny streszczania.

Co mierzy

ROUGE-N liczy recall (a w wariantach także F) n-gramów referencji pokrytych przez streszczenie; ROUGE-L opiera się na najdłuższej wspólnej podsekwencji, nagradzając zachowanie kolejności, a ROUGE-Lsum dzieli tekst na zdania przed liczeniem LCS. Metryka mierzy powierzchniowe pokrycie treści referencji, bez oceny spójności, wierności faktom czy jakości językowej streszczenia.

Wzór

RLCS=∣LCS(X,Y)∣∣X∣,PLCS=∣LCS(X,Y)∣∣Y∣,FLCS=(1+β2) RLCSPLCSRLCS+β2PLCSR_{\mathrm{LCS}}=\frac{|\mathrm{LCS}(X,Y)|}{|X|},\qquad P_{\mathrm{LCS}}=\frac{|\mathrm{LCS}(X,Y)|}{|Y|},\qquad F_{\mathrm{LCS}}=\frac{(1+\beta^{2})\,R_{\mathrm{LCS}}P_{\mathrm{LCS}}}{R_{\mathrm{LCS}}+\beta^{2}P_{\mathrm{LCS}}}

Wejścia

  • streszczenie kandydujące
  • jedno lub więcej streszczeń referencyjnych

Wyjścia

  • ROUGE-N / ROUGE-L w [0,1]
  • recall, precision i F (osobno)

Używany w

Brak powiązanych benchmarków w encyklopedii.

Typowe pułapki

  • Systemy ekstrakcyjne, które kopiują zdania z dokumentu, osiągają wysokie ROUGE przy niskiej jakości streszczenia — metryka nagradza zapożyczenia.
  • Słaba korelacja z oceną ludzką dla streszczeń abstrakcyjnych: spójność i wierność faktom są dla ROUGE niewidoczne.
  • Wynik zależy od wariantu (ROUGE-N vs ROUGE-L), stemmingu i tokenizacji — bez podania konfiguracji liczby są nieporównywalne.
  • Nie wykrywa halucynacji ani błędów faktycznych — streszczenie zmyślone może dostać wysoki wynik, jeśli zawiera n-gramy referencji.
  • Jakość pomiaru ogranicza liczba i jakość referencji; jedna referencja nie pokrywa dopuszczalnych parafraz.

Źródła

  1. Lin, „ROUGE: A Package for Automatic Evaluation of Summaries", ACL 2004(stan na 2026-10-10)
  2. Hugging Face Evaluate — metryka rouge(stan na 2026-10-10)
  3. google-research — oficjalna implementacja ROUGE w Pythonie(stan na 2026-10-10)
  4. Zhang i in., „BERTScore" (arXiv:1904.09675) — krytyka korelacji metryk n-gramowych z oceną ludzką(stan na 2026-10-10)
ROUGE — ashigiri