AMD e Cerebras Systems realizzeranno una nuova infrastruttura dedicata all'inferenza per l'intelligenza artificiale che ruoterà attorno all'unione della piattaforma rack-scale AMD Helios con il Wafer-Scale Engine di Cerebras.
L'obiettivo è rispondere una delle principali sfide dell'AI generativa: conciliare throughput elevato e tempi di risposta ridotti, requisiti che stanno diventando sempre più importanti per applicazioni come agenti autonomi, assistenti in tempo reale, sviluppo software, robotica e ricerca scientifica.
La soluzione, presentata durante l'evento Advancing AI 2026, adotta un approccio di inferenza disaggregata, nel quale le diverse fasi del processo vengono affidate all'hardware più adatto.
AMD Helios svolge il ruolo di motore ad alto throughput, occupandosi dell'elaborazione dei prompt e della gestione di contesti di grandi dimensioni, mentre il Wafer-Scale Engine di Cerebras accelera la fase di decodifica e generazione dei token, particolarmente sensibile alla larghezza di banda della memoria e alla latenza.
Secondo le due aziende, questa ripartizione dei compiti consentirà di ottenere fino a cinque volte più token al secondo per watt rispetto alle soluzioni di riferimento, mantenendo al tempo stesso elevata scalabilità e capacità di elaborare richieste complesse. Cerebras prevede inoltre di installare sistemi AMD Helios all'interno dei propri datacenter e di rendere inizialmente disponibile la piattaforma attraverso Cerebras Cloud nella seconda metà del 2026.












