Indeks scorerów
Scorer to funkcja, która zamienia odpowiedzi modelu w liczbę. Każda karta ma ten sam układ — wzór, wejścia i wyjścia, pułapki, źródła — żeby dało się je porównywać wzrokiem.
Accuracy (wielokrotny wybór)
Deterministycznyaliasy: accuracy, ACC, dokładność
Udział pytań, w których model wskazał poprawną opcję spośród kilku możliwych. Podstawowa miara benchmarków wielokrotnego wyboru — od MMLU po MMMU-Pro i HLE.
BERTScore
Semantycznyaliasy: BERTScore-F1, BS-F1, BERTScore-P, BERTScore-R
Podobieństwo semantyczne tekstów mierzone kosinusem między kontekstowymi embeddingami BERT dla każdej pary tokenów, z wagami idf. Koreluje z oceną ludzką lepiej niż metryki n-gramowe.
BLEU / chrF
Deterministycznyaliasy: BLEU, chrF, chrF++, SacreBLEU, sBLEU
Precyzja n-gramowa z karą za zbyt krótkie tłumaczenia (BLEU) oraz F-score na n-gramach znakowych (chrF). Domyślne automatyczne metryki jakości tłumaczenia maszynowego.
Elo / Bradley-Terry
Statystyczny agregataliasy: Elo, Bradley-Terry, BT model, rating
Statystyczne modele zamieniające wyniki porównań parami na ciągłą skalę siły modeli. Elo aktualizuje rating po każdej bitwie; Bradley-Terry estymuje siły metodą największej wiarygodności z całej macierzy porównań.
Exact match (i znormalizowany)
Deterministycznyaliasy: EM, exact match, dokładne dopasowanie
Zero-jedynkowa metryka porównująca przewidzianą odpowiedź z wzorcową po normalizacji (wielkość liter, interpunkcja, odstępy). Standard w QA i benchmarkach wiedzy, gdzie liczy się dosłowna zgodność z kluczem.
F1 (na tokenach)
Deterministycznyaliasy: F1, token-level F1, SQuAD F1, macro-averaged F1
Średnia harmoniczna precyzji i kompletności liczonych na tokenach wspólnych dla odpowiedzi wzorcowej i przewidywanej. Karze częściowe dopasowania łagodniej niż exact match i jest standardem zadań QA typu SQuAD.
G-Eval
Oparty na modelualiasy: G-Eval (GPT-4 evaluation), geval, form-filling evaluator
Framework oceny NLG, w którym model ocenia tekst według kryteriów z łańcuchem myśli, a końcowy wynik to suma wartości ocen ważona prawdopodobieństwami tokenów. Lepsza korelacja z ludźmi niż BLEU/ROUGE.
LLM-as-judge: direct scoring
Oparty na modelualiasy: LLM-as-a-judge (direct), sędzia LLM — ocena bezpośrednia, rubric scoring
Ocena jakości odpowiedzi przez model językowy działający jako sędzia: czyta prompt, kryteria i odpowiedź, po czym wystawia notę z uzasadnieniem. Stosowany, gdy nie ma jednoznacznego klucza odpowiedzi.
LLM-as-judge: pairwise
Oparty na modelualiasy: LLM-as-a-judge (pairwise), porównanie parami, arena judge, battle
Porównanie dwóch odpowiedzi na to samo pytanie przez sędziego-LLM, który wskazuje lepszą (lub remis) i uzasadnia wybór. Surowiec rankingów typu Chatbot Arena i podstawowych win rate’ów.
ROUGE
Deterministycznyaliasy: ROUGE-N, ROUGE-L, ROUGE-Lsum, ROUGE-W
Rodzina metryk pokrycia n-gramów i najdłuższej wspólnej podsekwencji (LCS) między streszczeniem a referencją. Od dwóch dekad domyślny standard automatycznej oceny streszczania.
Resolved rate (testy przechodzą)
Deterministycznyaliasy: resolved rate, resolution rate, success rate
Odsetek instancji — np. zadań z realnych zgłoszeń na GitHubie — które patch modelu rozwiązuje w całości, czyli przechodzi wszystkie testy. Główna miara sukcesu agentów programistycznych w SWE-bench i Terminal-Bench.
Scorery RAG (faithfulness, relevance)
Oparty na modelualiasy: RAGAS, faithfulness, answer relevance, context relevance, RAG triad
Rodzina metryk bez referencji oceniających systemy RAG: wierność odpowiedzi względem kontekstu (faithfulness) oraz trafność odpowiedzi i kontekstu (relevance). Wdrożone m.in. w RAGAS i TruLens.
Win rate
Statystyczny agregataliasy: win rate, battle win rate, WR
Odsetek bitew, które model wygrywa z danym przeciwnikiem (z opcjonalnym 0,5 punktu za remis). Najprostsza i najbardziej intuicyjna agregacja porównań parami z aren.
pass@k
Deterministycznyaliasy: pass rate@k, pass@1, pass@10, pass@100
Prawdopodobieństwo, że wśród k wygenerowanych próbek znajdzie się co najmniej jedna przechodząca testy. Standard ewaluacji generowania kodu, wprowadzony w pracy o Codex i HumanEval.