Kodstan na 11 października 2026

Aider Polyglot

Aider Polyglot to benchmark zdolności modeli do edytowania istniejącego kodu — nie generowania kodu od zera. Test składa się z 225 ćwiczeń programistycznych z platformy Exercism w sześciu językach: C++, Go, Java, JavaScript, Python i Rust. Model, sterowany narzędziem Aider w terminalu, ma edytować pliki repozytorium tak, by przejść dostarczone testy.

Jak liczony jest wynik

Każde ćwiczenie ma dwie próby. Wynik raportowany jest jako odsetek zadań rozwiązanych w pierwszej próbie (pass rate 1) i w drugiej (pass rate 2) — w duchu metryki pass@k: kk prób na zadanie zwiększa szansę sukcesu. Obok skuteczności leaderboard pokazuje też koszt, poprawność formatu edycji (diff/whole) oraz liczbę próśb o pomoc do użytkownika.

Czym się wyróżnia

Polyglot mierzy pracę w realnym przepływie deweloperskim: edycję wielu plików w istniejącym repozytorium, zgodność z formatem edycji i samodzielność. To inny profil umiejętności niż HumanEval — model świetny w generowaniu kodu może słabo edytować cudzy kod.

Główny scorer

pass@kDeterministyczny

Scorery używane w tym benchmarku

Źródła

  1. Leaderboard Aider Polyglot (aider.chat)(stan na 2026-10-10)
  2. Blog: The Aider polyglot benchmark (wprowadzenie benchmarku)(stan na 2026-10-10)
  3. Repozytorium Aider (GitHub)(stan na 2026-10-10)
  4. Exercism — źródło ćwiczeń użytych w benchmarku(stan na 2026-10-10)
Aider Polyglot — ashigiri