Agentystan na 11 października 2026

τ2-bench

τ2-bench to benchmark konwersacyjnych agentów w środowisku podwójnej kontroli (dual-control): nie tylko agent, lecz także użytkownik aktywnie działa narzędziami we wspólnym, dynamicznym świecie — wzorowanym na domenie telekomunikacyjnej i modelowanym jako Dec-POMDP. Agent musi jednocześnie rozumować, koordynować działania i skutecznie prowadzić użytkownika (np. przez wsparcie techniczne), zamiast traktować go jako bierne źródło informacji.

Jak liczony jest wynik

Zadania generowane są kompozycyjnie z atomowych komponentów, dzięki czemu są zróżnicowane i weryfikowalne. Po zakończeniu rozmowy stan bazy danych porównuje się ze stanem docelowym, a ocenę jakości całej interakcji wystawia sędzia LLM według rubryki. W rodzinie τ-benchów raportuje się też passk\text{pass}^k — odsetek zadań rozwiązanych co najmniej raz w kk niezależnych próbach — jako miarę niezawodności agenta.

Czym się wyróżnia

W eksperymentach z publikacji przejście ze scenariusza bez użytkownika do podwójnej kontroli wyraźnie obniża wyniki agentów — prowadzenie użytkownika okazuje się twardszym problemem niż samo rozumowanie. Benchmark jest następcą τ-bench (domeny retail i linie lotnicze).

Główny scorer

Scorery używane w tym benchmarku

Źródła

  1. ArXiv: τ²-Bench — Evaluating Conversational Agents in a Dual-Control Environment(stan na 2026-10-10)
  2. Repozytorium τ2-bench / τ3-bench (GitHub, Sierra Research)(stan na 2026-10-10)
  3. ArXiv: τ-bench — A Benchmark for Tool-Agent-User Interaction in Real-World Domains(stan na 2026-10-10)
  4. Repozytorium τ-bench (GitHub, Sierra Research)(stan na 2026-10-10)
τ2-bench — ashigiri