Scorery oparte na modelu (LLM-as-judge)

Scorery RAG: faithfulness, context i answer relevance

Aktualizacja: 11 października 2026

Trzy pytania o system RAG

System RAG odpowiada na pytanie, korzystając z pobranych dokumentów. Jego ewaluacja rozdziela dwa źródła błędów: retriever (czy pobrano właściwe dokumenty) i generator (czy odpowiedź jest wierna pobranym dokumentom). Standardowe miary pochodzą z RAGAS (Es i in.) i prac pokrewnych — karta zbiorcza: Scorery RAG.

Faithfulness — czy odpowiedź trzyma się dokumentów

Sędzia dzieli odpowiedź na twierdzenia, po czym sprawdza każde z nich wobec kontekstu:

F=∣V∣∣S∣F = \frac{|V|}{|S|}

gdzie ∣S∣|S| to liczba wyodrębnionych twierdzeń, a ∣V∣|V| liczba twierdzeń popartych kontekstem. Wynik 1 oznacza brak halucynacji; wynik 0 — żadne twierdzenie nie wynika z dokumentów. Podział na twierdzenia robi sędzia-LLM, więc cała miara dziedziczy wymagania kalibracji opisane w Dlaczego LLM-as-judge wymaga kalibracji.

claims = extract_claims(answer)          # LLM: lista twierdzeń
supported = [c for c in claims
             if judge(f"Twierdzenie: {c}\nKontekst: {context}") == "YES"]
faithfulness = len(supported) / len(claims)

Answer relevance — czy odpowiedź dotyczy pytania

Model generuje nn pytań, na które odpowiedź mogłaby odpowiadać, a wynik to średnie podobieństwo embeddingów tych pytań do pytania oryginalnego:

AR=1n∑i=1ncos⁡(E(qi),E(q))AR = \frac{1}{n}\sum_{i=1}^{n} \cos\left(E(q_i), E(q)\right)

Context precision / relevance — czy pobrano właściwe dokumenty

Po stronie retrievera sędzia ocenia, czy każdy pobrany fragment jest istotny dla pytania (context precision: istotne fragmenty wysoko w rankingu; context relevance: odsetek fragmentów istotnych). Rozdzielenie tych miar pozwala stwierdzić, czy słaby wynik to wina pobierania, czy generowania.

Diagnozuj w tej kolejności: context relevance (retriever), faithfulness (generator), answer relevance (spójność z pytaniem). Słaba faithfulness przy dobrym kontekście to problem generatora, nie retrievera.

Pułapki

  • ekstrakcja twierdzeń — błędy podziału na twierdzenia przenoszą się wprost do wyniku;
  • ocena binarna sędziego — „YES/NO" bez uzasadnienia bywa hałaśliwe; żądaj uzasadnienia lub skali;
  • embeddingi — answer relevance dziedziczy ograniczenia miar embeddingowych (zob. BERTScore);
  • koszt — każda próbka wymaga kilku wywołań sędziego (ekstrakcja twierdzeń plus weryfikacja); na dużych zbiorach próbkuj.
Scorery RAG: faithfulness, context i answer relevance