Kodstan na 11 października 2026

SWE-bench Pro

SWE-bench Pro (Scale AI) podnosi poprzeczkę względem SWE-bench: 1 865 problemów z 41 aktywnie utrzymywanych repozytoriów — aplikacji biznesowych, usług B2B i narzędzi deweloperskich — w tym zadania długohoryzontalne, których rozwiązanie zajęłoby inżynierowi godziny lub dni i często wymaga zmian w wielu plikach.

Struktura zbioru i punktacja

Problemy dzielą się na zbiór publiczny (11 repozytoriów), zbiór utajniony (held-out, 12 repozytoriów) i komercyjny (18 zastrzeżonych repozytoriów, wyniki publikowane). Zadanie jest rozwiązane, gdy łatka agenta przechodzi testy naprawiające błąd i nie psuje pozostałych — wynik to resolved rate (odsetek rozwiązanych zadań).

Czym się wyróżnia

Podział na zbiory publiczny i utajnione ma chronić przed dopasowywaniem agentów do konkretnych zadań i kontaminacją. Wyniki raportowane są głównie na zbiorze publicznym i części utajnionej, co utrudnia „uczenie się pod test".

Główny scorer

Scorery używane w tym benchmarku

Źródła

  1. ArXiv: SWE-Bench Pro — Can AI Agents Solve Long-Horizon Software Engineering Tasks?(stan na 2026-10-10)
  2. Oficjalny leaderboard SWE-Bench Pro (Scale AI)(stan na 2026-10-10)
  3. Repozytorium SWE-bench_Pro-os (GitHub, Scale AI)(stan na 2026-10-10)
SWE-bench Pro — ashigiri