NVIDIA ha aggiunto alla famiglia Nemotron 3 un modello costruito per la parte pi� ripetitiva del lavoro degli agenti autonomi. Nemotron 3.5 Lightning � un mixture-of-experts aperto da 30 miliardi di parametri complessivi, di cui 3 miliardi attivi per token, e viene proposto per lo strato esecutivo delle applicazioni agentiche: le chiamate a strumenti, la validazione dei risultati, la delega ai subagenti. Insieme al modello l'azienda pubblica NeMo Switchyard, una libreria open source che instrada ogni richiesta verso il modello ritenuto pi� adatto a gestirla.
L'architettura che NVIDIA ha in mente � un sistema di modelli. Un modello di frontiera come Nemotron 3 Ultra o GPT-5.6 pianifica e orchestra il flusso, mentre i modelli pi� piccoli assorbono i passaggi ad alto volume che consumano la maggior parte del budget di token, dal git pull alla formattazione dei risultati. Lightning � addestrato specificamente per gli harness agentici pi� diffusi, fra cui OpenClaw e Hermes Agent, e per lo stack NemoClaw con cui NVIDIA propone gestione e sicurezza degli agenti sempre attivi.
Le misure pubblicate parlano di una velocit� di generazione fino a quattro volte superiore a quella dei modelli di pari taglia. Su PinchBench, il banco di prova citato per il completamento di compiti agentici, il modello segna un'accuratezza dell'86% e chiude diecimila compiti con un anticipo del 30% su Qwen3.6 35B a parit� di accuratezza. NVIDIA lo colloca inoltre sulla frontiera di Pareto fra accuratezza e velocit� dell'Artificial Analysis Intelligence Index, che aggrega nove valutazioni, e su quella della classifica local.ai di EXO Labs. Tutti questi dati provengono da NVIDIA o da chi ha lavorato con NVIDIA, e al momento non risultano verifiche indipendenti nelle fonti disponibili.












