Alibaba ha presentato Qwen3.8 Max, l'ultima versione della sua famiglia di modelli linguistici, accompagnata da un punteggio che lo colloca stabilmente tra i modelli pi� performanti a livello mondiale secondo Artificial Analysis.
Nell'Intelligence Index della piattaforma di benchmark, il modello ottiene un punteggio di 58, posizionandosi al nono posto su 185 modelli valutati: un risultato che lo pone alla pari di Claude Opus 4.8 e davanti a tutti i modelli di Google, Meta e xAI. Restano invece davanti i modelli di punta di Anthropic e OpenAI, oltre a Kimi K3 di Moonshot AI.
Il dato pi� significativo riguarda le capacit� agentiche. Sul benchmark OSWorld-Verified, che misura la capacit� di un agente di operare autonomamente su un computer completando compiti reali all'interno di un sistema operativo, Qwen3.8 Max ottiene un punteggio di 86,1, superando GPT-5.6 Sol Max (83,2), Fable 5 (85,0) e Gemini 3.1 Pro (76,2).
Perch� "miglior modello agentico" � un'etichetta da maneggiare con cura
Alibaba presenta il modello come un "collaboratore autonomo" in grado di portare avanti progetti che si estendono su pi� giorni anzich� minuti, anche se il numero medio di turni necessari per completare un task � salito da 14 a 64 rispetto alla generazione precedente, con un consumo di token in input aumentato di 15 volte.











