Blog

Notatki o tym, co naprawdę liczą testy modeli — i jak to czytać, żeby nie dać się zwieść pojedynczej liczbie.

  • 3 min czytania

    Dlaczego LLM-as-judge wymaga kalibracji

    LLM-as-judge skaluje ocenianie, ale dziedziczy uprzedzenia modelu-sędziego: bias pozycyjny, self-preference, wrażliwość na prompt. Ufać mu można dopiero po kalibracji na ludzkich etykietach.

    LLM-as-judgeMetodyka
Blog — ashigiri