Black Forest Labs amplia la famiglia FLUX con FLUX 3, un modello multimodale che unifica immagini, video, audio e previsione di azioni in un’unica architettura.

L’obiettivo non è più solo creare contenuti, ma costruire una rappresentazione più coerente del mondo fisico, utile sia per la creatività digitale sia per applicazioni di Intelligenza Artificiale “fisica”, come la robotica industriale.

Il nuovo modello nasce dall’idea che fotografia, sequenze video e tracce audio forniscano informazioni complementari: struttura della scena, evoluzione temporale e dati sugli eventi fisici non deducibili dal solo visivo. Addestrando congiuntamente queste modalità, FLUX 3 apprende relazioni che reti separate faticherebbero a ricostruire, migliorando sia la qualità generativa sia la capacità di interpretare situazioni complesse.

Un’unica architettura per immagini, video e audio

FLUX 3 si basa sulla tecnologia Self-Flow, progettata per unificare comprensione e generazione all’interno della stessa rete neurale. L’addestramento avviene in parallelo su immagini, filmati e audio, permettendo al sistema di sviluppare una rappresentazione interna condivisa invece di concatenare modelli specializzati.