HLE (Humanity’s Last Exam)
Humanity's Last Exam (HLE) to benchmark „ostatniego egzaminu akademickiego": 2 500 pytań z dziesiątek dziedzin matematyki, nauk przyrodniczych i humanistyki, zebranych od blisko tysiąca ekspertów z ponad 500 instytucji i wybranych tak, by stawiać opór najnowszym modelom. Pytanie przechodziło do puli tylko wtedy, gdy żaden z czołowych modeli nie potrafił na nie poprawnie odpowiedzieć.
Format zadań i punktacja
Pytania mają zamknięte, jednoznacznie weryfikowalne odpowiedzi: część to pytania otwarte z krótką odpowiedzią, część — wielokrotnego wyboru (ok. 24%), a ~14% wymaga analizy obrazu. Odpowiedź jest ekstrahowana automatycznie i oceniana przez exact match; wynik to dokładność na zbiorze publicznym, a obok niej raportowany jest błąd kalibracji (modele systematycznie przeceniają swoje szanse).
Czym się wyróżnia
Publikacja (Nature, 2026) pokazała duży rozziew między pewnością siebie modeli a ich rzeczywistą skutecznością. Obok zbioru publicznego istnieje utajniony zestaw do wykrywania przetrenowania, a od października 2025 rozwijany jest wariant HLE-Rolling.
Główny scorer
Scorery używane w tym benchmarku
Źródła
- ArXiv: Humanity’s Last Exam(stan na 2026-10-10)
- Oficjalna strona Humanity’s Last Exam (lastexam.ai)(stan na 2026-10-10)
- Oficjalny leaderboard HLE (Scale AI)(stan na 2026-10-10)
- Zbiór danych cais/hle (Hugging Face Datasets)(stan na 2026-10-10)
- Repozytorium HLE (GitHub, Center for AI Safety)(stan na 2026-10-10)