Oparty na modelustan na 11 października 2026

Scorery RAG (faithfulness, relevance)

aliasy: RAGASfaithfulnessanswer relevancecontext relevanceRAG triad

Rodzina metryk bez referencji oceniających systemy RAG: wierność odpowiedzi względem kontekstu (faithfulness) oraz trafność odpowiedzi i kontekstu (relevance). Wdrożone m.in. w RAGAS i TruLens.

Co mierzy

Faithfulness dzieli odpowiedź na stwierdzenia i sprawdza sędzią-LLM, które są wsparte odzyskanym kontekstem — udział wspartych to wynik; wykrywa halucynacje nieobecne w kontekście. Answer relevance każe modelowi wygenerować pytania, na które odpowiedź mogłaby odpowiadać, i liczy średni kosinus ich embeddingów z pytaniem oryginalnym. Context relevance ocenia, jak duża część kontekstu jest potrzebna do odpowiedzi. Metryki działają bez złotych referencji, ale opierają się na modelach-sędziach i embeddingach.

Wzór

faithfulness=∣{stwierdzenia wsparte kontekstem}∣∣{wszystkie stwierdzenia odpowiedzi}∣,answer relevance=1n∑k=1ncos⁡(eq,eqk)\mathrm{faithfulness}=\frac{|\{\text{stwierdzenia wsparte kontekstem}\}|}{|\{\text{wszystkie stwierdzenia odpowiedzi}\}|},\qquad \mathrm{answer\ relevance}=\frac{1}{n}\sum_{k=1}^{n}\cos(e_q,e_{q_k})

Wejścia

  • pytanie użytkownika
  • kontekst odzyskany przez system RAG
  • odpowiedź systemu RAG
  • model-sędzia (LLM)

Wyjścia

  • faithfulness w [0,1]
  • answer relevance w [0,1]
  • context relevance w [0,1]

Używany w

Brak powiązanych benchmarków w encyklopedii.

Typowe pułapki

  • Faithfulness zależy od dekompozycji odpowiedzi na stwierdzenia — różne parsery i prompty dają różne wyniki dla tego samego tekstu.
  • Metryki oparte na LLM dziedziczą biasy sędziego: wrażliwość na prompt, kolejność kontekstu i wybór modelu oceniającego.
  • Relevance liczona kosinusem embeddingów bywa zawodna przy fragmentach bliskich semantycznie, ale nieistotnych — wymaga sanity checków.
  • Brak referencji oznacza brak „ground truth": metryki oceniają względem siebie nawzajem i wymagają walidacji, np. przez kontrastowe pary dobre/złe (podejście ARES).
  • Korelacja z oceną ludzką bywa umiarkowana; bez kalibracji na domenie liczby nie powinny być porównywane między projektami.

Źródła

  1. Es i in., „Ragas: Automated Evaluation of Retrieval Augmented Generation" (arXiv:2309.15217)(stan na 2026-10-10)
  2. Ragas — dokumentacja metryki faithfulness(stan na 2026-10-10)
  3. Saad-Falcon i in., „ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems" (arXiv:2311.09476)(stan na 2026-10-10)
  4. TruLens (truera/trulens) — implementacja RAG Triad: context relevance, groundedness, answer relevance(stan na 2026-10-10)
Scorery RAG (faithfulness, relevance) — ashigiri