Terminal-Bench 2.0
Terminal-Bench 2.0 ocenia agentów działających w izolowanych środowiskach terminala (Docker): 89 starannie wyselekcjonowanych zadań inspirowanych realnymi przepływami pracy — od operacji na plikach i konfiguracji, po analizę danych i zadania z zakresu inżynierii oprogramowania. Każde zadanie ma unikalne środowisko, napisane przez człowieka rozwiązanie referencyjne oraz komplet testów weryfikujących.
Jak liczony jest wynik
Zadanie jest rozwiązane, gdy agent doprowadzi środowisko do stanu spełniającego wszystkie testy weryfikujące. Wynik to resolved rate — odsetek rozwiązanych zadań, raportowany na żywym leaderboardzie wraz z kosztem i zużyciem tokenów oraz 95% przedziałami ufności.
Czym się wyróżnia
W odróżnieniu od benchmarków „jednej odpowiedzi" Terminal-Bench mierzy autonomiczne, wielokrokowe działanie w systemie plików i powłoce — czyli dokładnie to, co robią agenci terminalowi. Publikacja podkreśla, że na zbiorze 2.0 najlepsze modele i agenty rozwiązują mniej niż dwie trzecie zadań.
Główny scorer
Scorery używane w tym benchmarku
Źródła
- ArXiv: Terminal-Bench — Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces (publikacja Terminal-Bench 2.0)(stan na 2026-10-10)
- Oficjalny leaderboard Terminal-Bench (tbench.ai)(stan na 2026-10-10)
- Repozytorium terminal-bench (GitHub, Laude Institute)(stan na 2026-10-10)
- Repozytorium terminal-bench (GitHub, Harbor Framework)(stan na 2026-10-10)