SWE-bench Verified
SWE-bench Verified to zwalidowany przez ludzi podzbiór 500 zadań z SWE-bench: model (lub agent kodujący) dostaje realne zgłoszenie błędu (issue) z popularnego repozytorium Pythona i musi wygenerować łatkę, która przechodzi testy weryfikujące naprawę (FAIL_TO_PASS), nie psując przy tym testów regresji (PASS_TO_PASS).
Jak liczony jest wynik
Zadanie uznaje się za rozwiązane tylko wtedy, gdy wszystkie testy FAIL_TO_PASS przechodzą, a wszystkie PASS_TO_PASS nadal przechodzą. Wynik to resolved rate — odsetek rozwiązanych zadań:
Czym się wyróżnia
Walidacja OpenAI usunęła zadania ze słabymi testami, wyciekiem rozwiązania w treści zgłoszenia i niejednoznaczną specyfikacją — dzięki temu Verified jest znacznie bardziej miarodajny niż surowy SWE-bench. To standardowy test agentów programistycznych, ale wynik silnie zależy od rusztowania (harnessu) agenta, a nie tylko od modelu.
Główny scorer
Scorery używane w tym benchmarku
Źródła
- ArXiv: SWE-bench — Can Language Models Resolve Real-World GitHub Issues?(stan na 2026-10-10)
- OpenAI: Introducing SWE-bench Verified (ogłoszenie podzbioru)(stan na 2026-10-10)
- Oficjalny leaderboard SWE-bench Verified (swebench.com)(stan na 2026-10-10)
- Zbiór danych SWE-bench Verified (Hugging Face Datasets)(stan na 2026-10-10)
- Repozytorium SWE-bench (GitHub)(stan na 2026-10-10)