G-Eval
aliasy: G-Eval (GPT-4 evaluation)gevalform-filling evaluator
Framework oceny NLG, w którym model ocenia tekst według kryteriów z łańcuchem myśli, a końcowy wynik to suma wartości ocen ważona prawdopodobieństwami tokenów. Lepsza korelacja z ludźmi niż BLEU/ROUGE.
Co mierzy
Mierzy wymiary jakości definiowane rubryką (spójność, płynność, trafność, zgodność ze stylem): model generuje kroki rozumowania (chain-of-thought), a potem w paradygmacie form-filling przypisuje tekstowi ocenę z dyskretnej skali. Zamiast pojedynczego tokenu bierze się rozkład prawdopodobieństw nad wartościami ocen i liczy wartość oczekiwaną, co stabilizuje wynik. Metryka jest referencyjna lub bezreferencyjna, a jej jakość zależy od modelu-sędziego.
Wzór
Wejścia
- tekst do oceny
- definicja kryterium i kroki CoT
- referencja (opcjonalnie, dla zadań referencyjnych)
Wyjścia
- ocena według rubryki (np. 1–5)
- rozkład prawdopodobieństw nad ocenami
Używany w
Brak powiązanych benchmarków w encyklopedii.
Typowe pułapki
- Bias wobec tekstów generowanych przez LLM: sami autorzy G-Eval zauważają, że sędzia-LLM może preferować teksty modeli nad ludzkimi.
- Probabilistyczna suma ocen bywa niestabilna przy małej liczbie próbek — warto raportować rozkład, a nie tylko wartość oczekiwaną.
- Koszt: chain-of-thought plus form-filling dla każdego wymiaru jakości to wiele wywołań modelu na jedną ocenę.
- Wyniki zależą od wersji modelu-sędziego i treści rubryki; bez kalibracji między sędziami wyniki nie są przenośne między ewaluacjami.
- Sprawdza się dla kryteriów definiowalnych rubryką (spójność, płynność, trafność), a nie dla weryfikacji faktów.
Źródła
- Liu i in., „G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment", EMNLP 2023 (arXiv:2303.16634)(stan na 2026-10-10)
- nlpyang/geval — oficjalne repozytorium G-Eval(stan na 2026-10-10)
- G-Eval w ACL Anthology (EMNLP 2023)(stan na 2026-10-10)
- Wang i in., „Large Language Models are not Fair Evaluators" (arXiv:2305.17926) — biasy ocen LLM(stan na 2026-10-10)