τ2-bench
τ2-bench to benchmark konwersacyjnych agentów w środowisku podwójnej kontroli (dual-control): nie tylko agent, lecz także użytkownik aktywnie działa narzędziami we wspólnym, dynamicznym świecie — wzorowanym na domenie telekomunikacyjnej i modelowanym jako Dec-POMDP. Agent musi jednocześnie rozumować, koordynować działania i skutecznie prowadzić użytkownika (np. przez wsparcie techniczne), zamiast traktować go jako bierne źródło informacji.
Jak liczony jest wynik
Zadania generowane są kompozycyjnie z atomowych komponentów, dzięki czemu są zróżnicowane i weryfikowalne. Po zakończeniu rozmowy stan bazy danych porównuje się ze stanem docelowym, a ocenę jakości całej interakcji wystawia sędzia LLM według rubryki. W rodzinie τ-benchów raportuje się też — odsetek zadań rozwiązanych co najmniej raz w niezależnych próbach — jako miarę niezawodności agenta.
Czym się wyróżnia
W eksperymentach z publikacji przejście ze scenariusza bez użytkownika do podwójnej kontroli wyraźnie obniża wyniki agentów — prowadzenie użytkownika okazuje się twardszym problemem niż samo rozumowanie. Benchmark jest następcą τ-bench (domeny retail i linie lotnicze).
Główny scorer
Scorery używane w tym benchmarku
Źródła
- ArXiv: τ²-Bench — Evaluating Conversational Agents in a Dual-Control Environment(stan na 2026-10-10)
- Repozytorium τ2-bench / τ3-bench (GitHub, Sierra Research)(stan na 2026-10-10)
- ArXiv: τ-bench — A Benchmark for Tool-Agent-User Interaction in Real-World Domains(stan na 2026-10-10)
- Repozytorium τ-bench (GitHub, Sierra Research)(stan na 2026-10-10)