Benchmarki
Przegląd benchmarków
Aktualizacja: 11 października 2026
Co robi benchmark
Benchmark zamienia pytanie „czy model jest dobry" na mierzalne „jak model wypada na tym zbiorze zadań, w tym protokole, według tego scorera". Składa się ze zbioru zadań, protokołu (próbkowanie, limity, wersja), co najmniej jednego scorera i reguł raportowania. Wartość benchmarku zależy od trudności zadań i od odporności na kontaminację — szerzej w Pułapki i kontaminacja danych.
Najprostszy protokół to średnia ze scorerów po zadaniach:
Rankingi preferencji używają zamiast średniej Elo / Bradley-Terry, a benchmarki agentowe — wskaźnika rozwiązania w środowisku.
Mapa benchmarków wg domeny
| Benchmark | Domena | Dominujący scorer | Uwaga |
|---|---|---|---|
| MMLU-Pro | wiedza ogólna | Accuracy (wielokrotny wybór) | 10 opcji — mniej zgadywania |
| GPQA Diamond | nauki ścisłe | accuracy | pytania weryfikowane przez ekspertów |
| SWE-bench Verified | kod, naprawa issue | Resolved rate | weryfikacja testami w repozytorium |
| LiveCodeBench | kod | pass@k | zadania publikowane po dacie odcięcia treningu |
| Chatbot Arena | preferencje | Elo / Bradley-Terry | głosy ludzi, ranking na żywo |
| HLE | trudne pytania zamknięte | accuracy | część zbioru trzymana w tajemnicy |
| AIME 2025 | matematyka | accuracy (odpowiedź liczbowa) | arkusze konkursowe z 2025 r. |
| τ2-bench | agenci i narzędzia | weryfikacja w środowisku | realistyczne zadania z narzędziami |
Źródła zbiorów: MMLU-Pro, GPQA, SWE-bench, LiveCodeBench, Chatbot Arena, HLE, τ2-bench (repozytorium), arkusze AIME 2025.
Jak czytać wyniki benchmarku
- Ta sama wersja. Benchmarki są aktualizowane (nowe zadania, poprawki etykiet); porównuj tylko wyniki z tej samej wersji.
- Ten sam scorer i protokół. Zmiana temperatury czy liczby próbek zmienia wynik bez zmiany modelu.
- Kontaminacja. Publiczny zbiór mógł trafić do danych treningowych — patrz na daty publikacji i deklaracje decontaminacji.
- Rankingi się starzeją. Konkretnych liczb nie publikujemy na kartach; aktualne wyniki znajdziesz w zewnętrznych leaderboardach: LMArena dla preferencji, SWE-bench dla kodu, LiveCodeBench dla świeżych zadań programistycznych, HLE dla trudnych pytań, AIME 2025 (Artificial Analysis) i MMLU-Pro (Hugging Face).