L'essentiel
Black Forest Labs a publié Flux 3, un modèle multimodal qui apprend image, vidéo et audio ensemble et génère des clips avec bande-son native jusqu'à 20 secondes.
Le son n'est plus ajouté après le montage : le même réseau cale les bruits sur les événements visuels, en un seul passage.
Sur des tests internes et préliminaires, Flux 3 devance Runway Gen-4.5 dans 77 % des comparaisons et fait jeu égal (52 %) avec Seedance 2.0 et Gemini Omni Flash.
Jusqu'ici, une vidéo générée par IA naissait muette. Le modèle produisait des images animées, puis venait une seconde étape : coller une bande-son, doubler les voix, plaquer des bruitages calés à la main sur le montage. Deux métiers, deux outils, deux passes.






