Wiedzastan na 11 października 2026

HLE (Humanity’s Last Exam)

Humanity's Last Exam (HLE) to benchmark „ostatniego egzaminu akademickiego": 2 500 pytań z dziesiątek dziedzin matematyki, nauk przyrodniczych i humanistyki, zebranych od blisko tysiąca ekspertów z ponad 500 instytucji i wybranych tak, by stawiać opór najnowszym modelom. Pytanie przechodziło do puli tylko wtedy, gdy żaden z czołowych modeli nie potrafił na nie poprawnie odpowiedzieć.

Format zadań i punktacja

Pytania mają zamknięte, jednoznacznie weryfikowalne odpowiedzi: część to pytania otwarte z krótką odpowiedzią, część — wielokrotnego wyboru (ok. 24%), a ~14% wymaga analizy obrazu. Odpowiedź jest ekstrahowana automatycznie i oceniana przez exact match; wynik to dokładność na zbiorze publicznym, a obok niej raportowany jest błąd kalibracji (modele systematycznie przeceniają swoje szanse).

Czym się wyróżnia

Publikacja (Nature, 2026) pokazała duży rozziew między pewnością siebie modeli a ich rzeczywistą skutecznością. Obok zbioru publicznego istnieje utajniony zestaw do wykrywania przetrenowania, a od października 2025 rozwijany jest wariant HLE-Rolling.

Główny scorer

Scorery używane w tym benchmarku

Źródła

  1. ArXiv: Humanity’s Last Exam(stan na 2026-10-10)
  2. Oficjalna strona Humanity’s Last Exam (lastexam.ai)(stan na 2026-10-10)
  3. Oficjalny leaderboard HLE (Scale AI)(stan na 2026-10-10)
  4. Zbiór danych cais/hle (Hugging Face Datasets)(stan na 2026-10-10)
  5. Repozytorium HLE (GitHub, Center for AI Safety)(stan na 2026-10-10)
HLE (Humanity’s Last Exam) — ashigiri