Deterministycznystan na 11 października 2026
BLEU / chrF
aliasy: BLEUchrFchrF++SacreBLEUsBLEU
Precyzja n-gramowa z karą za zbyt krótkie tłumaczenia (BLEU) oraz F-score na n-gramach znakowych (chrF). Domyślne automatyczne metryki jakości tłumaczenia maszynowego.
Co mierzy
BLEU porównuje n-gramy (zazwyczaj 1–4) tłumaczenia kandydującego z referencjami, mnożąc precyzję przez brevity penalty karzącą tłumaczenia krótsze od wzorca. chrF liczy F-score na n-gramach znakowych, co czyni go mniej czułym na morfologię i formy słów, a chrF++ dodaje n-gramy wyrazowe. Obie metryki oceniają powierzchniowe podobieństwo do referencji, nie znaczenie ani poprawność merytoryczną.
Wzór
Wejścia
- tłumaczenie kandydujące
- jedno lub więcej tłumaczeń referencyjnych
Wyjścia
- BLEU w [0,1] (lub skala 0–100)
- chrF w [0,1]
Używany w
Brak powiązanych benchmarków w encyklopedii.
Typowe pułapki
- BLEU słabo koreluje z oceną ludzką poza tłumaczeniem maszynowym — bywa bezzasadnie używany do QA, streszczania czy dialogów.
- Brevity penalty systematycznie karze krótsze tłumaczenia; zmiany tokenizacji i wygładzania (smoothing) zmieniają wynik, stąd postulat SacreBLEU o raportowaniu pełnych parametrów.
- Wszystkie n-gramy ważą tyle samo — metryka nie rozróżnia błędów krytycznych od kosmetycznych.
- Wrażliwość na język: BLEU jest niesprawiedliwy dla języków o bogatej fleksji; chrF jest tu odporniejszy dzięki n-gramom znakowym.
- Pojedyncza liczba maskuje zachowanie systemu — WMT raportuje metryki łącznie z oceną ludzką i analizą błędów.
Źródła
- Papineni i in., „BLEU: a Method for Automatic Evaluation of Machine Translation", ACL 2002(stan na 2026-10-10)
- Popović, „chrF: character n-gram F-score for automatic MT evaluation", WMT 2015(stan na 2026-10-10)
- Post, „A Call for Clarity in Reporting BLEU Scores" (arXiv:1804.08771) — SacreBLEU i pułapki raportowania(stan na 2026-10-10)
- Hugging Face Evaluate — metryka bleu(stan na 2026-10-10)
- WMT25 — strona konferencji i żywe wyniki kampanii ewaluacyjnych(stan na 2026-10-10)