Il team Qwen di Alibaba ha pubblicato Qwen3.8-Flash-Next, un modello a pesi aperti che espone l'architettura su cui l'azienda conta di costruire Qwen4. Il modello porta 125 miliardi di parametri complessivi e per ogni token ne attiva 6 miliardi. Il team lo presenta come un'anteprima di architettura, non come il modello di punta della famiglia.

Qwen3.7-Plus, il modello precedente della stessa squadra, tiene 397 miliardi di parametri e ne attiva 17. Il nuovo arrivato gira quindi su circa un terzo del calcolo attivo, e il team dichiara che il bersaglio � il costo, non la capacit�. Le scelte di architettura, sostiene, pesano sui conti dell'inferenza soprattutto ora che il carico di lavoro ordinario sta diventando il lavoro agentico con contesti molto lunghi.

Tre delle quattro novit� sono di "ordinaria amministrazione". Un nuovo schema di attenzione sparsa lavora su micro-blocchi invece di selezionare i singoli token, un meccanismo residuale regola quanta informazione passa da un livello all'altro, e la ricetta di addestramento rinuncia del tutto alla crescita graduale della dimensione del batch. La quarta � quella anomala: invece di aggiungere esperti, il modello si porta dietro 51 miliardi di parametri sotto forma di embedding separato, indicizzato per frammenti di due e tre caratteri, che secondo il team costa meno calcolo ed � pi� facile da spostare su acceleratori a corto di memoria.