Deterministycznystan na 11 października 2026

BLEU / chrF

aliasy: BLEUchrFchrF++SacreBLEUsBLEU

Precyzja n-gramowa z karą za zbyt krótkie tłumaczenia (BLEU) oraz F-score na n-gramach znakowych (chrF). Domyślne automatyczne metryki jakości tłumaczenia maszynowego.

Co mierzy

BLEU porównuje n-gramy (zazwyczaj 1–4) tłumaczenia kandydującego z referencjami, mnożąc precyzję przez brevity penalty karzącą tłumaczenia krótsze od wzorca. chrF liczy F-score na n-gramach znakowych, co czyni go mniej czułym na morfologię i formy słów, a chrF++ dodaje n-gramy wyrazowe. Obie metryki oceniają powierzchniowe podobieństwo do referencji, nie znaczenie ani poprawność merytoryczną.

Wzór

BLEU=BP⋅exp⁡ ⁣(∑n=1Nwnln⁡pn),BP={1c>re1−r/cc≤rchrFβ=(1+β2) chrP⋅chrRβ2 chrP+chrR\mathrm{BLEU}=\mathrm{BP}\cdot\exp\!\left(\sum_{n=1}^{N}w_n\ln p_n\right),\qquad \mathrm{BP}=\begin{cases}1 & c>r\\ e^{1-r/c} & c\le r\end{cases}\\ \mathrm{chrF}_{\beta}=\frac{(1+\beta^{2})\,\mathrm{chrP}\cdot\mathrm{chrR}}{\beta^{2}\,\mathrm{chrP}+\mathrm{chrR}}

Wejścia

  • tłumaczenie kandydujące
  • jedno lub więcej tłumaczeń referencyjnych

Wyjścia

  • BLEU w [0,1] (lub skala 0–100)
  • chrF w [0,1]

Używany w

Brak powiązanych benchmarków w encyklopedii.

Typowe pułapki

  • BLEU słabo koreluje z oceną ludzką poza tłumaczeniem maszynowym — bywa bezzasadnie używany do QA, streszczania czy dialogów.
  • Brevity penalty systematycznie karze krótsze tłumaczenia; zmiany tokenizacji i wygładzania (smoothing) zmieniają wynik, stąd postulat SacreBLEU o raportowaniu pełnych parametrów.
  • Wszystkie n-gramy ważą tyle samo — metryka nie rozróżnia błędów krytycznych od kosmetycznych.
  • Wrażliwość na język: BLEU jest niesprawiedliwy dla języków o bogatej fleksji; chrF jest tu odporniejszy dzięki n-gramom znakowym.
  • Pojedyncza liczba maskuje zachowanie systemu — WMT raportuje metryki łącznie z oceną ludzką i analizą błędów.

Źródła

  1. Papineni i in., „BLEU: a Method for Automatic Evaluation of Machine Translation", ACL 2002(stan na 2026-10-10)
  2. Popović, „chrF: character n-gram F-score for automatic MT evaluation", WMT 2015(stan na 2026-10-10)
  3. Post, „A Call for Clarity in Reporting BLEU Scores" (arXiv:1804.08771) — SacreBLEU i pułapki raportowania(stan na 2026-10-10)
  4. Hugging Face Evaluate — metryka bleu(stan na 2026-10-10)
  5. WMT25 — strona konferencji i żywe wyniki kampanii ewaluacyjnych(stan na 2026-10-10)
BLEU / chrF — ashigiri