Black Forest Labs dévoile Flux 3
Black Forest Labs a publié Flux 3, un modèle de génération vidéo très attendu, teasé pour la première fois lors du lancement de Flux 1 en août 2024. Cette nouvelle itération élargit considérablement les possibilités créatives, doublant la limite habituelle de génération vidéo à 20 secondes. Cette durée étendue répond directement à une demande clé des utilisateurs, dépassant les clips restrictifs de 10 secondes typiques de nombreux outils vidéo IA antérieurs.
Flux 3 fonctionne comme un modèle multimodal robuste, acceptant diverses entrées pour piloter des flux de travail créatifs complexes. Les utilisateurs peuvent intégrer jusqu'à 10 références, combinant des images fixes, des pistes audio ou des segments vidéo existants. Cette capacité puissante permet un montage complexe, un remixage sophistiqué et un contrôle précis sur le contenu généré, rationalisant ainsi les tâches de production avancées.
Actuellement, Flux 3 génère de la vidéo en résolution 720p, Black Forest Labs prévoyant un déploiement en 1080p dans un avenir proche. Le modèle offre une prise en charge complète de tous les formats d'image standard, allant du vertical 9:16 au cinématographique 21:9, garantissant une adaptabilité sur toutes les plateformes. Surtout, Flux 3 inclut également une génération audio intégrée, produisant des paysages sonores synchronisés avec sa sortie visuelle.
Performance : Cohérence plutôt que cinétique
Flux 3 fonctionne comme un modèle vidéo de raisonnement, démontrant une cohérence de prompt avancée. Le modèle exécute avec succès des demandes narratives complexes, générant des sorties qui maintiennent des éléments d'intrigue et des actions de personnages cohérents sur sa limite de génération de 20 secondes. Cette capacité permet une narration plus complexe directement à partir de prompts textuels.
Ses performances contrastent avec les modèles optimisés pour un dynamisme visuel rapide. Flux 3 ne privilégie pas l'« énergie cinétique hyper pop » ou les séquences d'action rapides caractérisées par des mouvements de caméra vifs et des effets spéciaux, courants chez certains concurrents. Au lieu de cela, il excelle dans la génération de scènes dramatiques, en particulier celles comportant des dialogues rapides et étendus, un attribut noté comme dépassant le rythme de « Gilmore Girls ».
Black Forest Labs positionne Flux 3 comme un outil d'augmentation pour les flux de travail professionnels, et non comme un remplacement complet des solutions établies telles que C-dance. L'entreprise a confirmé son intention de publier ultérieurement les poids ouverts du modèle, facilitant ainsi une intégration et une personnalisation plus larges. Les coûts de génération devraient être inférieurs aux alternatives actuelles du marché, améliorant l'accessibilité pour les créateurs.
Le moment historique de l'IA sur grand écran
Zach London, connu sous le nom de Gossip Goblin, a marqué un jalon industriel décisif avec la sortie en salles de son long métrage généré par IA. Cet événement représente la réalisation de distribution la plus significative à ce jour pour le cinéma piloté par l'IA, faisant passer la technologie des vitrines en ligne expérimentales à une exposition grand public. Cela établit London comme une force majeure dans le paysage évolutif de la réalisation numérique.
Le succès de London souligne une tendance croissante où les initiatives menées par les créateurs exploitent des outils d'IA générative pour des productions narratives complètes. Ce développement établit une voie viable pour les cinéastes indépendants afin d'atteindre une distribution traditionnelle, démontrant que le contenu généré par IA peut répondre aux exigences de qualité et de narration de l'industrie cinématographique commerciale. Cela remet en question les hypothèses longtemps admises sur les limites de l'art généré par machine.
La distribution en salle d'un film généré par IA valide la capacité de la technologie à construire des récits complexes. Pour un aperçu de la qualité narrative atteignable, le court-métrage de 30 minutes de London, 'Pomegranate', offre un exemple convaincant. Ce court-métrage démontre une narration et un développement de personnages sophistiqués, indiquant le potentiel d'expériences cinématographiques robustes utilisant les modèles d'IA actuels ; des spécifications techniques supplémentaires sur les modèles avancés de génération vidéo, tels que Flux 3, sont disponibles sur FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence. | Black Forest Labs.
Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.
un e-mail par jour · désinscription en deux clics · aucun traqueur tiers
À l'intérieur du flux de travail de Gossip Goblin
Zach London, connu sous le nom de Gossip Goblin, a mis en œuvre un processus en deux étapes hautement contrôlé pour son long métrage généré par IA, qui a récemment fait ses débuts au cinéma. L'étape fondamentale impliquait la génération initiale d'images, exécutée méticuleusement dans Midjourney. Cette première étape critique a tiré parti de codes de personnalisation et de S-ref spécifiques, établissant les bases visuelles précises pour chaque scène.
Après la création de l'image, London a pris une décision cruciale concernant son flux de travail : l'application exclusive de la conversion first-frame image-to-video. Cette stratégie consistait à n'intégrer qu'une seule image pré-conçue dans le modèle de génération vidéo pour chaque séquence. Notamment, cette approche a délibérément évité le multi-référencement, une pratique courante où plusieurs images ou clips vidéo guident la sortie de l'IA.
La justification de London pour cette méthode rigoureuse était centrée sur le maintien d'un contrôle créatif absolu. En limitant la référence de l'IA à la seule image fixe initiale, il a exercé un commandement précis sur la séquence animée ultérieure. Cela a permis une direction très spécifique des mouvements de caméra, du cadrage et de la composition des plans, garantissant que le récit visuel final respectait strictement sa vision artistique. Cet écart par rapport aux techniques multi-références plus automatisées a souligné un engagement envers la supervision directoriale dans la réalisation de films par IA.
Foire aux questions
Qu'est-ce que Flux 3 de Black Forest Labs ?
Flux 3 est un nouveau modèle de génération vidéo par IA multimodal capable de créer des clips allant jusqu'à 20 secondes. Il accepte des références d'image, audio ou vidéo et génère son propre audio.
Quelle est l'importance du film de Gossip Goblin ?
Le film de Zach London (Gossip Goblin) est significatif car il s'agit d'un long métrage généré par IA bénéficiant d'une sortie en salle, marquant une étape majeure pour le cinéma par IA.
Qu'est-ce qui est unique dans le flux de travail du film par IA de Gossip Goblin ?
Son flux de travail commence par la génération d'images dans Midjourney, puis utilise la génération first-frame image-to-video. Cela évite le multi-référencement pour maintenir un contrôle précis de la caméra.
Flux 3 est-il censé remplacer des modèles comme C-dance ?
Initialement, Flux 3 est positionné comme un outil capable d'augmenter les flux de travail existants plutôt que de les remplacer. Il excelle dans la cohérence des prompts pour les scènes dramatiques, mais peut être moins adapté à l'action hyper-cinétique.

