DeepSeek ha pubblicato su Hugging Face V4.1-Flash, modello multimodale da 552 miliardi di parametri con i pesi rilasciati sotto licenza MIT, quindi scaricabili, modificabili ed eseguibili da chiunque. Da luned� 14 settembre alle 04:00 UTC ogni richiesta indirizzata a V4-Pro, il modello di punta dell'azienda, verr� servita da V4.1-Flash e fatturata alle tariffe pi� basse della linea Flash. La sostituzione resta in piedi finch� non arriver� un V4.1-Pro, per il quale non esiste ancora una data.

V4.1-Flash accende 8 miliardi di parametri per token mentre legge l'input e 16 miliardi mentre genera la risposta, a fronte dei 13 miliardi attivati da V4-Flash. La separazione nasce dall'architettura, che DeepSeek chiama Causal Encoder-Decoder: quaranta strati Transformer divisi in venti di encoder causale e venti di decoder, con la cache globale del decoder proiettata dagli stati finali dell'encoder invece che ricavata da ogni strato per conto proprio. Il beneficio si concentra sui carichi agentici, dove un modello che chiama strumenti a ripetizione passa gran parte del tempo a leggere input nuovi, e la lettura � la fase che costa meno. L'azienda lo presenta come il pi� piccolo di una nuova famiglia di architetture, pensata per scalare verso modelli pi� grandi.