Agentystan na 11 października 2026

Terminal-Bench 2.0

Terminal-Bench 2.0 ocenia agentów działających w izolowanych środowiskach terminala (Docker): 89 starannie wyselekcjonowanych zadań inspirowanych realnymi przepływami pracy — od operacji na plikach i konfiguracji, po analizę danych i zadania z zakresu inżynierii oprogramowania. Każde zadanie ma unikalne środowisko, napisane przez człowieka rozwiązanie referencyjne oraz komplet testów weryfikujących.

Jak liczony jest wynik

Zadanie jest rozwiązane, gdy agent doprowadzi środowisko do stanu spełniającego wszystkie testy weryfikujące. Wynik to resolved rate — odsetek rozwiązanych zadań, raportowany na żywym leaderboardzie wraz z kosztem i zużyciem tokenów oraz 95% przedziałami ufności.

Czym się wyróżnia

W odróżnieniu od benchmarków „jednej odpowiedzi" Terminal-Bench mierzy autonomiczne, wielokrokowe działanie w systemie plików i powłoce — czyli dokładnie to, co robią agenci terminalowi. Publikacja podkreśla, że na zbiorze 2.0 najlepsze modele i agenty rozwiązują mniej niż dwie trzecie zadań.

Główny scorer

Scorery używane w tym benchmarku

Źródła

  1. ArXiv: Terminal-Bench — Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces (publikacja Terminal-Bench 2.0)(stan na 2026-10-10)
  2. Oficjalny leaderboard Terminal-Bench (tbench.ai)(stan na 2026-10-10)
  3. Repozytorium terminal-bench (GitHub, Laude Institute)(stan na 2026-10-10)
  4. Repozytorium terminal-bench (GitHub, Harbor Framework)(stan na 2026-10-10)
Terminal-Bench 2.0 — ashigiri