Benchmarki

Przegląd benchmarków

Aktualizacja: 11 października 2026

Co robi benchmark

Benchmark zamienia pytanie „czy model jest dobry" na mierzalne „jak model wypada na tym zbiorze zadań, w tym protokole, według tego scorera". Składa się ze zbioru zadań, protokołu (próbkowanie, limity, wersja), co najmniej jednego scorera i reguł raportowania. Wartość benchmarku zależy od trudności zadań i od odporności na kontaminację — szerzej w Pułapki i kontaminacja danych.

Najprostszy protokół to średnia ze scorerów po zadaniach:

ScoreB(M)=1N∑i=1Ns(oi,ri)Score_B(M) = \frac{1}{N}\sum_{i=1}^{N} s(o_i, r_i)

Rankingi preferencji używają zamiast średniej Elo / Bradley-Terry, a benchmarki agentowe — wskaźnika rozwiązania w środowisku.

Mapa benchmarków wg domeny

BenchmarkDomenaDominujący scorerUwaga
MMLU-Prowiedza ogólnaAccuracy (wielokrotny wybór)10 opcji — mniej zgadywania
GPQA Diamondnauki ścisłeaccuracypytania weryfikowane przez ekspertów
SWE-bench Verifiedkod, naprawa issueResolved rateweryfikacja testami w repozytorium
LiveCodeBenchkodpass@kzadania publikowane po dacie odcięcia treningu
Chatbot ArenapreferencjeElo / Bradley-Terrygłosy ludzi, ranking na żywo
HLEtrudne pytania zamknięteaccuracyczęść zbioru trzymana w tajemnicy
AIME 2025matematykaaccuracy (odpowiedź liczbowa)arkusze konkursowe z 2025 r.
τ2-benchagenci i narzędziaweryfikacja w środowiskurealistyczne zadania z narzędziami

Źródła zbiorów: MMLU-Pro, GPQA, SWE-bench, LiveCodeBench, Chatbot Arena, HLE, τ2-bench (repozytorium), arkusze AIME 2025.

Jak czytać wyniki benchmarku

  1. Ta sama wersja. Benchmarki są aktualizowane (nowe zadania, poprawki etykiet); porównuj tylko wyniki z tej samej wersji.
  2. Ten sam scorer i protokół. Zmiana temperatury czy liczby próbek zmienia wynik bez zmiany modelu.
  3. Kontaminacja. Publiczny zbiór mógł trafić do danych treningowych — patrz na daty publikacji i deklaracje decontaminacji.
  4. Rankingi się starzeją. Konkretnych liczb nie publikujemy na kartach; aktualne wyniki znajdziesz w zewnętrznych leaderboardach: LMArena dla preferencji, SWE-bench dla kodu, LiveCodeBench dla świeżych zadań programistycznych, HLE dla trudnych pytań, AIME 2025 (Artificial Analysis) i MMLU-Pro (Hugging Face).
Przegląd benchmarków