L'inferenza locale dei modelli di intelligenza artificiale cambia parecchio il modo in cui si guardano le prestazioni di un computer. Non conta soltanto quanta potenza di calcolo abbia il processore, ma soprattutto quanto velocemente il sistema riesca a spostare i dati della rete neurale verso le unit� che devono

poi elaborarli. Nel caso dei Large Language Model, infatti, i pesi del modello devono essere continuamente letti dalla memoria durante l'elaborazione: quando la banda disponibile � insufficiente, anche una GPU molto potente pu� rimanere in parte inutilizzata.

� proprio qui che l'architettura Apple Silicon diventa interessante. Il Mac Studio con M5 Max

(lo chiamiamo cos� per comodit�, ma intendiamo anche l'Ultra di specifiche

superiori) dispone di memoria unificata condivisa da CPU, GPU e Neural Engine: non esiste quindi la tradizionale separazione fra RAM di sistema e VRAM della scheda video. Il modello pu� risiedere direttamente