Indeks scorerów

Scorer to funkcja, która zamienia odpowiedzi modelu w liczbę. Każda karta ma ten sam układ — wzór, wejścia i wyjścia, pułapki, źródła — żeby dało się je porównywać wzrokiem.

Accuracy (wielokrotny wybór)

Deterministyczny

aliasy: accuracy, ACC, dokładność

Udział pytań, w których model wskazał poprawną opcję spośród kilku możliwych. Podstawowa miara benchmarków wielokrotnego wyboru — od MMLU po MMMU-Pro i HLE.

BERTScore

Semantyczny

aliasy: BERTScore-F1, BS-F1, BERTScore-P, BERTScore-R

Podobieństwo semantyczne tekstów mierzone kosinusem między kontekstowymi embeddingami BERT dla każdej pary tokenów, z wagami idf. Koreluje z oceną ludzką lepiej niż metryki n-gramowe.

BLEU / chrF

Deterministyczny

aliasy: BLEU, chrF, chrF++, SacreBLEU, sBLEU

Precyzja n-gramowa z karą za zbyt krótkie tłumaczenia (BLEU) oraz F-score na n-gramach znakowych (chrF). Domyślne automatyczne metryki jakości tłumaczenia maszynowego.

Elo / Bradley-Terry

Statystyczny agregat

aliasy: Elo, Bradley-Terry, BT model, rating

Statystyczne modele zamieniające wyniki porównań parami na ciągłą skalę siły modeli. Elo aktualizuje rating po każdej bitwie; Bradley-Terry estymuje siły metodą największej wiarygodności z całej macierzy porównań.

Exact match (i znormalizowany)

Deterministyczny

aliasy: EM, exact match, dokładne dopasowanie

Zero-jedynkowa metryka porównująca przewidzianą odpowiedź z wzorcową po normalizacji (wielkość liter, interpunkcja, odstępy). Standard w QA i benchmarkach wiedzy, gdzie liczy się dosłowna zgodność z kluczem.

F1 (na tokenach)

Deterministyczny

aliasy: F1, token-level F1, SQuAD F1, macro-averaged F1

Średnia harmoniczna precyzji i kompletności liczonych na tokenach wspólnych dla odpowiedzi wzorcowej i przewidywanej. Karze częściowe dopasowania łagodniej niż exact match i jest standardem zadań QA typu SQuAD.

G-Eval

Oparty na modelu

aliasy: G-Eval (GPT-4 evaluation), geval, form-filling evaluator

Framework oceny NLG, w którym model ocenia tekst według kryteriów z łańcuchem myśli, a końcowy wynik to suma wartości ocen ważona prawdopodobieństwami tokenów. Lepsza korelacja z ludźmi niż BLEU/ROUGE.

LLM-as-judge: direct scoring

Oparty na modelu

aliasy: LLM-as-a-judge (direct), sędzia LLM — ocena bezpośrednia, rubric scoring

Ocena jakości odpowiedzi przez model językowy działający jako sędzia: czyta prompt, kryteria i odpowiedź, po czym wystawia notę z uzasadnieniem. Stosowany, gdy nie ma jednoznacznego klucza odpowiedzi.

LLM-as-judge: pairwise

Oparty na modelu

aliasy: LLM-as-a-judge (pairwise), porównanie parami, arena judge, battle

Porównanie dwóch odpowiedzi na to samo pytanie przez sędziego-LLM, który wskazuje lepszą (lub remis) i uzasadnia wybór. Surowiec rankingów typu Chatbot Arena i podstawowych win rate’ów.

ROUGE

Deterministyczny

aliasy: ROUGE-N, ROUGE-L, ROUGE-Lsum, ROUGE-W

Rodzina metryk pokrycia n-gramów i najdłuższej wspólnej podsekwencji (LCS) między streszczeniem a referencją. Od dwóch dekad domyślny standard automatycznej oceny streszczania.

Resolved rate (testy przechodzą)

Deterministyczny

aliasy: resolved rate, resolution rate, success rate

Odsetek instancji — np. zadań z realnych zgłoszeń na GitHubie — które patch modelu rozwiązuje w całości, czyli przechodzi wszystkie testy. Główna miara sukcesu agentów programistycznych w SWE-bench i Terminal-Bench.

Scorery RAG (faithfulness, relevance)

Oparty na modelu

aliasy: RAGAS, faithfulness, answer relevance, context relevance, RAG triad

Rodzina metryk bez referencji oceniających systemy RAG: wierność odpowiedzi względem kontekstu (faithfulness) oraz trafność odpowiedzi i kontekstu (relevance). Wdrożone m.in. w RAGAS i TruLens.

Win rate

Statystyczny agregat

aliasy: win rate, battle win rate, WR

Odsetek bitew, które model wygrywa z danym przeciwnikiem (z opcjonalnym 0,5 punktu za remis). Najprostsza i najbardziej intuicyjna agregacja porównań parami z aren.

pass@k

Deterministyczny

aliasy: pass rate@k, pass@1, pass@10, pass@100

Prawdopodobieństwo, że wśród k wygenerowanych próbek znajdzie się co najmniej jedna przechodząca testy. Standard ewaluacji generowania kodu, wprowadzony w pracy o Codex i HumanEval.

Indeks scorerów — ashigiri