di

Sergio Donato

GPT-6 Astra era quinto nella classifica di Artificial Analysis. Dopo due aggiornamenti dei test e dei pesi degli stessi è salito fino al primo posto, riaprendo il dibattito su come si misurano i modelli IA

Per testare la capacità dei modelli generativi di intelligenza artificiale si usano i benchmark perché questi modelli sono strumenti complessi da valutare. Ognuno di questi test valuta una caratteristica specifica o, in generale, categorie particolari, come il coding, la scienza o la capacità di generalizzare. Quindi l’insieme dei risultati dei singoli test, provati su ogni modello, può generare una classifica che può definirsi equilibrata tra tutti perché tutti svolgono le stesse prove.

Nel corso del tempo, il classificatore di modelli IA più famoso è diventato Artificial Analysis, una società indipendente di benchmarking fondata nel 2023 a San Francisco da Micah Hill-Smith e George Cameron, che provengono dalla consulenza strategica e manageriale con un focus sull’IA e le infrastrutture.