NVIDIA ha avviato la produzione completa di Groq 3 LPX, il sistema di accelerazione dedicato all'inferenza AI a bassissima latenza che estende la piattaforma Vera Rubin. Il nuovo prodotto nasce dall'integrazione della tecnologia Groq nell'offerta dell'azienda e punta in particolare ai carichi di lavoro agentici, nei quali la velocità con cui vengono generati i token può determinare direttamente la reattività dell'applicazione.
Il sistema è pensato per affiancare le GPU e le CPU della piattaforma Vera Rubin, anziché sostituirle. Gli agenti AI, infatti, possono eseguire centinaia o migliaia di passaggi di inferenza per completare un'attività: analizzare file, generare codice, eseguire test, utilizzare strumenti esterni, verificare i risultati e ripetere il processo. In questo scenario la capacità di produrre rapidamente ogni sequenza di token diventa particolarmente importante.
NVIDIA indica Groq 3 LPX come un acceleratore specificamente progettato per la fase di decode, cioè quella in cui il modello genera progressivamente i token in risposta a una richiesta. La GPU rimane invece il componente più flessibile per l'addestramento e per l'inferenza di modelli differenti, mentre un acceleratore come Groq può essere impiegato quando la priorità è ottenere una latenza ridotta nella generazione.










