Kodstan na 11 października 2026

LiveCodeBench

LiveCodeBench to benchmark generowania kodu, który nie starzeje się: zadania są stale dobierane z konkursów programistycznych na LeetCode, AtCoder i Codeforces, publikowanych po dacie odcięcia wiedzy testowanych modeli. Dzięki temu wyniki są z definicji odporne na kontaminację danymi treningowymi.

Format zadań i punktacja

Poza klasyczną generacją kodu benchmark testuje też samonaprawę (self-repair), wykonywanie kodu i przewidywanie wyniku testów. Rozwiązanie jest sprawdzane przez wykonanie ukrytych testów jednostkowych; wynik raportowany jest jako pass@k — prawdopodobieństwo, że wśród kk próbek znajdzie się co najmniej jedna przechodząca wszystkie testy:

pass@k=E[1−(n−ck)(nk)]pass@k = \mathbb{E}\left[1 - \frac{\binom{n-c}{k}}{\binom{n}{k}}\right]

gdzie nn to liczba próbek, a cc liczba próbek poprawnych.

Główny scorer

pass@kDeterministyczny

Scorery używane w tym benchmarku

Źródła

  1. ArXiv: LiveCodeBench — Holistic and Contamination Free Evaluation of LLMs for Code(stan na 2026-10-10)
  2. Żywy leaderboard LiveCodeBench(stan na 2026-10-10)
  3. Repozytorium LiveCodeBench (GitHub)(stan na 2026-10-10)
  4. Zbiór danych code_generation_lite (Hugging Face Datasets)(stan na 2026-10-10)
LiveCodeBench — ashigiri