Aider Polyglot
Aider Polyglot to benchmark zdolności modeli do edytowania istniejącego kodu — nie generowania kodu od zera. Test składa się z 225 ćwiczeń programistycznych z platformy Exercism w sześciu językach: C++, Go, Java, JavaScript, Python i Rust. Model, sterowany narzędziem Aider w terminalu, ma edytować pliki repozytorium tak, by przejść dostarczone testy.
Jak liczony jest wynik
Każde ćwiczenie ma dwie próby. Wynik raportowany jest jako odsetek zadań rozwiązanych w pierwszej próbie (pass rate 1) i w drugiej (pass rate 2) — w duchu metryki pass@k: prób na zadanie zwiększa szansę sukcesu. Obok skuteczności leaderboard pokazuje też koszt, poprawność formatu edycji (diff/whole) oraz liczbę próśb o pomoc do użytkownika.
Czym się wyróżnia
Polyglot mierzy pracę w realnym przepływie deweloperskim: edycję wielu plików w istniejącym repozytorium, zgodność z formatem edycji i samodzielność. To inny profil umiejętności niż HumanEval — model świetny w generowaniu kodu może słabo edytować cudzy kod.
Główny scorer
Scorery używane w tym benchmarku
Źródła
- Leaderboard Aider Polyglot (aider.chat)(stan na 2026-10-10)
- Blog: The Aider polyglot benchmark (wprowadzenie benchmarku)(stan na 2026-10-10)
- Repozytorium Aider (GitHub)(stan na 2026-10-10)
- Exercism — źródło ćwiczeń użytych w benchmarku(stan na 2026-10-10)