Deterministycznystan na 11 października 2026
ROUGE
aliasy: ROUGE-NROUGE-LROUGE-LsumROUGE-W
Rodzina metryk pokrycia n-gramów i najdłuższej wspólnej podsekwencji (LCS) między streszczeniem a referencją. Od dwóch dekad domyślny standard automatycznej oceny streszczania.
Co mierzy
ROUGE-N liczy recall (a w wariantach także F) n-gramów referencji pokrytych przez streszczenie; ROUGE-L opiera się na najdłuższej wspólnej podsekwencji, nagradzając zachowanie kolejności, a ROUGE-Lsum dzieli tekst na zdania przed liczeniem LCS. Metryka mierzy powierzchniowe pokrycie treści referencji, bez oceny spójności, wierności faktom czy jakości językowej streszczenia.
Wzór
Wejścia
- streszczenie kandydujące
- jedno lub więcej streszczeń referencyjnych
Wyjścia
- ROUGE-N / ROUGE-L w [0,1]
- recall, precision i F (osobno)
Używany w
Brak powiązanych benchmarków w encyklopedii.
Typowe pułapki
- Systemy ekstrakcyjne, które kopiują zdania z dokumentu, osiągają wysokie ROUGE przy niskiej jakości streszczenia — metryka nagradza zapożyczenia.
- Słaba korelacja z oceną ludzką dla streszczeń abstrakcyjnych: spójność i wierność faktom są dla ROUGE niewidoczne.
- Wynik zależy od wariantu (ROUGE-N vs ROUGE-L), stemmingu i tokenizacji — bez podania konfiguracji liczby są nieporównywalne.
- Nie wykrywa halucynacji ani błędów faktycznych — streszczenie zmyślone może dostać wysoki wynik, jeśli zawiera n-gramy referencji.
- Jakość pomiaru ogranicza liczba i jakość referencji; jedna referencja nie pokrywa dopuszczalnych parafraz.
Źródła
- Lin, „ROUGE: A Package for Automatic Evaluation of Summaries", ACL 2004(stan na 2026-10-10)
- Hugging Face Evaluate — metryka rouge(stan na 2026-10-10)
- google-research — oficjalna implementacja ROUGE w Pythonie(stan na 2026-10-10)
- Zhang i in., „BERTScore" (arXiv:1904.09675) — krytyka korelacji metryk n-gramowych z oceną ludzką(stan na 2026-10-10)