NVIDIA ha appena reso disponibile Nemotron 3.5 Lightning, un modello open-weight da 30 miliardi di parametri progettato specificamente per gli agenti AI che devono eseguire migliaia di operazioni ripetitive senza ricorrere a ogni passo a un modello frontier costoso.
Il modello attiva solo 3 miliardi di parametri per token grazie a un’architettura Mixture of Experts (MoE), consentendo velocità fino a quattro volte superiori rispetto ad altri modelli della stessa classe e una riduzione del 30% nei tempi di completamento di alcuni task agentici.
Nemotron 3.5 Lightning: architettura e prestazioni
Nemotron 3.5 Lightning è un modello MoE con 30B parametri totali e 3B attivi per token, ottimizzato per task ripetitivi come revisione codice, uso di strumenti, monitoraggio security e gestione di richieste amministrative.
Supporta una finestra di contesto fino a 1 milione di token, include il giapponese ed è disponibile in due varianti: BF16 per personalizzazione e NVFP4 per inferenza veloce, eseguibile su un singolo DGX Spark o GPU H100. Le versioni quantizzate sono già utilizzabili tramite Ollama e LM Studio, mentre i pesi sono pubblicati su Hugging Face, ModelScope, OpenRouter e build.nvidia.com sotto licenza OpenMDW-1.1.










