Deterministycznystan na 11 października 2026

Resolved rate (testy przechodzą)

aliasy: resolved rateresolution ratesuccess rate

Odsetek instancji — np. zadań z realnych zgłoszeń na GitHubie — które patch modelu rozwiązuje w całości, czyli przechodzi wszystkie testy. Główna miara sukcesu agentów programistycznych w SWE-bench i Terminal-Bench.

Co mierzy

Mierzy, czy wygenerowana łata w pełni rozwiązuje zadanie: instancja liczy się jako rozwiązana tylko wtedy, gdy po zastosowaniu patcha wszystkie testy (w SWE-bench: FAIL_TO_PASS i PASS_TO_PASS) przechodzą w środowisku wykonawczym. To miara binarna i end-to-end — obejmuje zrozumienie zgłoszenia, edycję kodu i poprawność względem testów, a nie tylko podobieństwo do wzorca. Równolegle raportuje się często składowe (np. udział testów FAIL_TO_PASS), by pokazać postęp cząstkowy.

Wzór

resolved=1N∑i=1N1 ⁣[patch przechodzi wszystkie testy instancji i]\mathrm{resolved}=\frac{1}{N}\sum_{i=1}^{N}\mathbb{1}\!\left[\text{patch przechodzi wszystkie testy instancji }i\right]

Wejścia

  • patch wygenerowany przez model
  • repozytorium i zestaw testów instancji
  • logi środowiska wykonawczego

Wyjścia

  • udział w pełni rozwiązanych instancji w [0,1]
  • procent rozwiązanych instancji

Używany w

Typowe pułapki

  • Binarność ukrywa postęp: patch przechodzący 90% testów liczy się jak 0, dlatego SWE-bench raportuje dodatkowo cząstkowe wskaźniki (FAIL_TO_PASS, PASS_TO_PASS).
  • Wynik zależy od niezawodności harnessu ewaluacyjnego — testy flaky, różne wersje środowiska czy zmiany specyfikacji potrafią przesuwać wyniki bez zmiany modelu.
  • Publiczne instancje narażone są na kontaminację danych treningowych; dlatego SWE-bench Pro utrzymuje zestawy held-out i komercyjne.
  • Kosztowna ewaluacja: każda instancja wymaga uruchomienia pełnego środowiska i testów, co ogranicza skalę i częstotliwość pomiarów.
  • Nie ocenia jakości kodu, czytelności ani bezpieczeństwa patcha — mierzy wyłącznie to, że testy przechodzą.

Źródła

  1. Jimenez i in., „SWE-bench: Can Language Models Resolve Real-World GitHub Issues?" (arXiv:2310.06770)(stan na 2026-10-10)
  2. SWE-bench — oficjalna strona i żywy leaderboard(stan na 2026-10-10)
  3. Scale AI i in., „SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?" (arXiv:2509.16941)(stan na 2026-10-10)
  4. Merrill i in., „Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces" (arXiv:2601.11868)(stan na 2026-10-10)
  5. Terminal-Bench — oficjalna strona i żywy leaderboard(stan na 2026-10-10)
Resolved rate (testy przechodzą) — ashigiri