Kodstan na 11 października 2026

SWE-bench Verified

SWE-bench Verified to zwalidowany przez ludzi podzbiór 500 zadań z SWE-bench: model (lub agent kodujący) dostaje realne zgłoszenie błędu (issue) z popularnego repozytorium Pythona i musi wygenerować łatkę, która przechodzi testy weryfikujące naprawę (FAIL_TO_PASS), nie psując przy tym testów regresji (PASS_TO_PASS).

Jak liczony jest wynik

Zadanie uznaje się za rozwiązane tylko wtedy, gdy wszystkie testy FAIL_TO_PASS przechodzą, a wszystkie PASS_TO_PASS nadal przechodzą. Wynik to resolved rate — odsetek rozwiązanych zadań:

resolved rate=zadania z przechodzącymi testamiwszystkie zadaniaresolved\ rate = \frac{\text{zadania z przechodzącymi testami}}{\text{wszystkie zadania}}

Czym się wyróżnia

Walidacja OpenAI usunęła zadania ze słabymi testami, wyciekiem rozwiązania w treści zgłoszenia i niejednoznaczną specyfikacją — dzięki temu Verified jest znacznie bardziej miarodajny niż surowy SWE-bench. To standardowy test agentów programistycznych, ale wynik silnie zależy od rusztowania (harnessu) agenta, a nie tylko od modelu.

Główny scorer

Scorery używane w tym benchmarku

Źródła

  1. ArXiv: SWE-bench — Can Language Models Resolve Real-World GitHub Issues?(stan na 2026-10-10)
  2. OpenAI: Introducing SWE-bench Verified (ogłoszenie podzbioru)(stan na 2026-10-10)
  3. Oficjalny leaderboard SWE-bench Verified (swebench.com)(stan na 2026-10-10)
  4. Zbiór danych SWE-bench Verified (Hugging Face Datasets)(stan na 2026-10-10)
  5. Repozytorium SWE-bench (GitHub)(stan na 2026-10-10)
SWE-bench Verified — ashigiri