Deterministycznystan na 11 października 2026
Resolved rate (testy przechodzą)
aliasy: resolved rateresolution ratesuccess rate
Odsetek instancji — np. zadań z realnych zgłoszeń na GitHubie — które patch modelu rozwiązuje w całości, czyli przechodzi wszystkie testy. Główna miara sukcesu agentów programistycznych w SWE-bench i Terminal-Bench.
Co mierzy
Mierzy, czy wygenerowana łata w pełni rozwiązuje zadanie: instancja liczy się jako rozwiązana tylko wtedy, gdy po zastosowaniu patcha wszystkie testy (w SWE-bench: FAIL_TO_PASS i PASS_TO_PASS) przechodzą w środowisku wykonawczym. To miara binarna i end-to-end — obejmuje zrozumienie zgłoszenia, edycję kodu i poprawność względem testów, a nie tylko podobieństwo do wzorca. Równolegle raportuje się często składowe (np. udział testów FAIL_TO_PASS), by pokazać postęp cząstkowy.
Wzór
Wejścia
- patch wygenerowany przez model
- repozytorium i zestaw testów instancji
- logi środowiska wykonawczego
Wyjścia
- udział w pełni rozwiązanych instancji w [0,1]
- procent rozwiązanych instancji
Używany w
Typowe pułapki
- Binarność ukrywa postęp: patch przechodzący 90% testów liczy się jak 0, dlatego SWE-bench raportuje dodatkowo cząstkowe wskaźniki (FAIL_TO_PASS, PASS_TO_PASS).
- Wynik zależy od niezawodności harnessu ewaluacyjnego — testy flaky, różne wersje środowiska czy zmiany specyfikacji potrafią przesuwać wyniki bez zmiany modelu.
- Publiczne instancje narażone są na kontaminację danych treningowych; dlatego SWE-bench Pro utrzymuje zestawy held-out i komercyjne.
- Kosztowna ewaluacja: każda instancja wymaga uruchomienia pełnego środowiska i testów, co ogranicza skalę i częstotliwość pomiarów.
- Nie ocenia jakości kodu, czytelności ani bezpieczeństwa patcha — mierzy wyłącznie to, że testy przechodzą.
Źródła
- Jimenez i in., „SWE-bench: Can Language Models Resolve Real-World GitHub Issues?" (arXiv:2310.06770)(stan na 2026-10-10)
- SWE-bench — oficjalna strona i żywy leaderboard(stan na 2026-10-10)
- Scale AI i in., „SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?" (arXiv:2509.16941)(stan na 2026-10-10)
- Merrill i in., „Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces" (arXiv:2601.11868)(stan na 2026-10-10)
- Terminal-Bench — oficjalna strona i żywy leaderboard(stan na 2026-10-10)