Uno sviluppatore � riuscito a eseguire un piccolo modello linguistico direttamente su un microcontrollore ESP32-S3 dal costo inferiore ai 10 dollari. Grazie a quantizzazione, offload degli embedding nella memoria Flash e codice C ottimizzato, il sistema raggiunge circa 9 token al secondo, dimostrando nuove possibilit� per l'AI embedded.

Nearly 10 tok/s and it's mostly coherent — What's not to like?

Uno sviluppatore � riuscito a eseguire un piccolo modello linguistico direttamente su un microcontrollore ESP32-S3 dal costo inferiore ai 10 dollari. Grazie a quantizzazione,…