Oparty na modelustan na 11 października 2026

G-Eval

aliasy: G-Eval (GPT-4 evaluation)gevalform-filling evaluator

Framework oceny NLG, w którym model ocenia tekst według kryteriów z łańcuchem myśli, a końcowy wynik to suma wartości ocen ważona prawdopodobieństwami tokenów. Lepsza korelacja z ludźmi niż BLEU/ROUGE.

Co mierzy

Mierzy wymiary jakości definiowane rubryką (spójność, płynność, trafność, zgodność ze stylem): model generuje kroki rozumowania (chain-of-thought), a potem w paradygmacie form-filling przypisuje tekstowi ocenę z dyskretnej skali. Zamiast pojedynczego tokenu bierze się rozkład prawdopodobieństw nad wartościami ocen i liczy wartość oczekiwaną, co stabilizuje wynik. Metryka jest referencyjna lub bezreferencyjna, a jej jakość zależy od modelu-sędziego.

Wzór

scoreG-Eval=∑i=1np(si)⋅si,p(si)=P(token oceny si∣prompt z kryteriami i CoT)\mathrm{score}_{\mathrm{G\text{-}Eval}}=\sum_{i=1}^{n}p(s_i)\cdot s_i,\qquad p(s_i)=\mathbb{P}(\text{token oceny }s_i\mid\text{prompt z kryteriami i CoT})

Wejścia

  • tekst do oceny
  • definicja kryterium i kroki CoT
  • referencja (opcjonalnie, dla zadań referencyjnych)

Wyjścia

  • ocena według rubryki (np. 1–5)
  • rozkład prawdopodobieństw nad ocenami

Używany w

Brak powiązanych benchmarków w encyklopedii.

Typowe pułapki

  • Bias wobec tekstów generowanych przez LLM: sami autorzy G-Eval zauważają, że sędzia-LLM może preferować teksty modeli nad ludzkimi.
  • Probabilistyczna suma ocen bywa niestabilna przy małej liczbie próbek — warto raportować rozkład, a nie tylko wartość oczekiwaną.
  • Koszt: chain-of-thought plus form-filling dla każdego wymiaru jakości to wiele wywołań modelu na jedną ocenę.
  • Wyniki zależą od wersji modelu-sędziego i treści rubryki; bez kalibracji między sędziami wyniki nie są przenośne między ewaluacjami.
  • Sprawdza się dla kryteriów definiowalnych rubryką (spójność, płynność, trafność), a nie dla weryfikacji faktów.

Źródła

  1. Liu i in., „G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment", EMNLP 2023 (arXiv:2303.16634)(stan na 2026-10-10)
  2. nlpyang/geval — oficjalne repozytorium G-Eval(stan na 2026-10-10)
  3. G-Eval w ACL Anthology (EMNLP 2023)(stan na 2026-10-10)
  4. Wang i in., „Large Language Models are not Fair Evaluators" (arXiv:2305.17926) — biasy ocen LLM(stan na 2026-10-10)
G-Eval — ashigiri