FreeToken, KTransformers e AirLLM puntano a eseguire grandi LLM su workstation con poca VRAM, spostando pesi ed esperti tra RAM, GPU e disco. Le architetture Mixture of Experts riducono i parametri attivi, ma velocità e casi d’uso restano molto diversi