MiniMaxAI ha pubblicato su Hugging Face i pesi open source di MiniMax-H3, un sistema generativo multimodale in grado di creare filmati ad alta definizione con traccia audio stereo nativa a 32 kHz. La piattaforma elabora contesti complessi integrando testo, immagini, video e tracce sonore per produrre sequenze fino a 15 secondi a 24 FPS.

La struttura poggia su H3-Base, un Transformer denso a singolo flusso da 33 miliardi di parametri, affiancato dal modello di codifica testuale e visiva Qwen3-VL-32B (che fornisce gli stati nascosti del 50� layer). Per la compressione visiva, il sistema adotta H3-VisualVAE con un fattore di campionamento spaziale di 32x e temporale di 4x, affiancato da un VAE audio dedicato capace di comprimere il segnale stereo a una frequenza temporale di 40 Hz.

I pesi distribuiti tramite il repository ufficiale di Hugging Face includono i checkpoint FL2VA (per la generazione da testo o da fotogrammi iniziali e finali) e Ref2VA. Quest'ultimo supporta un massimo di nove immagini, tre clip video e tre tracciati audio di riferimento contemporaneamente. L'infrastruttura locale genera nativamente una risoluzione di 768p, mentre l'upscaling a 2K sfrutta un modulo proprietario via API denominato H3-Regenerate-2K.