Humanity's Last Exam era nato per mettere in difficoltà qualunque modello AI, ma in un anno i punteggi sono cresciuti rapidamente. Il caso apre una domanda più ampia: i benchmark statici riescono ancora a misurare davvero le capacità dell’intelligenza artificiale?

Humanity's Last Exam era nato per mettere in difficoltà qualunque modello AI, ma in un anno i punteggi sono cresciuti rapidamente. Il caso apre una domanda più ampia: i benchmark…

Humanity's Last Exam: cos'è, analisi dei grafici di punteggi, costi, token e ultime notizie sui modelli AI di frontiera