SWE-bench Pro
SWE-bench Pro (Scale AI) podnosi poprzeczkę względem SWE-bench: 1 865 problemów z 41 aktywnie utrzymywanych repozytoriów — aplikacji biznesowych, usług B2B i narzędzi deweloperskich — w tym zadania długohoryzontalne, których rozwiązanie zajęłoby inżynierowi godziny lub dni i często wymaga zmian w wielu plikach.
Struktura zbioru i punktacja
Problemy dzielą się na zbiór publiczny (11 repozytoriów), zbiór utajniony (held-out, 12 repozytoriów) i komercyjny (18 zastrzeżonych repozytoriów, wyniki publikowane). Zadanie jest rozwiązane, gdy łatka agenta przechodzi testy naprawiające błąd i nie psuje pozostałych — wynik to resolved rate (odsetek rozwiązanych zadań).
Czym się wyróżnia
Podział na zbiory publiczny i utajnione ma chronić przed dopasowywaniem agentów do konkretnych zadań i kontaminacją. Wyniki raportowane są głównie na zbiorze publicznym i części utajnionej, co utrudnia „uczenie się pod test".
Główny scorer
Scorery używane w tym benchmarku
Źródła
- ArXiv: SWE-Bench Pro — Can AI Agents Solve Long-Horizon Software Engineering Tasks?(stan na 2026-10-10)
- Oficjalny leaderboard SWE-Bench Pro (Scale AI)(stan na 2026-10-10)
- Repozytorium SWE-bench_Pro-os (GitHub, Scale AI)(stan na 2026-10-10)