Black Forest Labs a lancé FLUX 3 jeudi, marquant la première fois que le modèle phare de l’entreprise génère des vidéos plutôt que des images fixes. Le laboratoire allemand d’IA, connu pour sa gamme FLUX de générateurs d’images, a entraîné le nouveau système en utilisant simultanément des images, de la vidéo et de l’audio au sein d’un système unifié. Cette approche multimodale permet à FLUX 3 de produire des clips jusqu’à 20 secondes, avec un audio généré en même temps que l’image et synchronisé avec l’action à l’écran, y compris le dialogue, les effets sonores et le bruit ambiant. Le lancement représente un changement stratégique de la génération pure d’images vers des capacités vidéo, le modèle alimentant aussi FLUX-mimic, une application de robotique déjà testée par Audi sur sa chaîne de production pour des tâches comme la pose de joints de porte flexibles.
FLUX 3 fournit des clips vidéo de 20 secondes avec un audio synchronisé
FLUX 3 produit des clips vidéo jusqu’à 20 secondes avec un audio généré en parallèle de l’image et synchronisé avec ce qui se passe à l’écran. Lors d’évaluations initiales, des évaluateurs humains ont préféré la sortie de FLUX 3 à celle de Runway Gen-4.5 dans 77 % des comparaisons face à face et à celle de Luma Ray 3.2 dans 93 % des comparaisons. Le modèle a également devancé Gemini Omni et Seedance dans 52 % des évaluations. Ces tests de préférence consistent à faire regarder à des évaluateurs deux clips et à sélectionner celui qui paraît le plus convaincant, tant visuellement que soniquement, tandis que Black Forest Labs comptabilise la fréquence à laquelle FLUX 3 l’emporte.
Le modèle fait aussi preuve de compétence dans la génération d’images fixes, dans la continuité de son héritage en génération d’images. Black Forest Labs a partagé des images montrant la polyvalence de FLUX 3, capable de produire une grande variété de styles au-delà du photoréalisme. Le cofondateur et PDG Robin Rombach a déclaré : « Un modèle qui n’apprend que des images ne peut générer que des images ». La position de l’entreprise est qu’apprendre à prédire la vidéo, c’est aussi apprendre la physique qui la sous-tend — le poids, le contact, le timing — c’est-à-dire ce dont une machine a besoin pour évoluer dans le monde physique.
Audi teste le système de robotique FLUX-mimic sur sa chaîne de production
FLUX-mimic, construit avec la robotique mimic basée à Zurich, reprend le moteur de prédiction vidéo de FLUX 3 et ajoute un décodeur léger — un petit composant additionnel qui traduit la compréhension interne de la manière dont les choses bougent en mouvements réels du robot. Audi le teste sur des tâches comme la pose de joints de porte flexibles, un travail que l’automatisation conventionnelle a eu du mal à gérer. Le cofondateur de mimic, Stephan-Daniel Gravert, a déclaré : « Audi représente le type de partenaire industriel pour lequel nous avons construit FLUX-mimic ». Christoph Schneider, chez Audi, a indiqué que les robots « résolvent désormais des tâches complexes de manipulation des corps mous » que des machines plus anciennes ne pouvaient pas aborder. Black Forest Labs rapporte que l’ensemble du système réagit en environ 101 millisecondes, dans un ordre de grandeur proche des réflexes visuels humains.
Black Forest Labs a construit FLUX 3 après les origines de Stable Diffusion
Black Forest Labs a été fondée en août 2024 par des chercheurs vétérans qui avaient contribué à construire les modèles Stable Diffusion originaux chez Stability AI. L’entreprise a lancé des modèles Flux qui ont surpassé MidJourney et éclipsé la Stable Diffusion 3 de Stability. Les modèles open source Flux Dev et Schnell ont obtenu le titre de « meilleur générateur d’images open source », un honneur que les artistes IA s’attendaient à voir Stable Diffusion 3.5 reconquérir. FLUX 1.1 Pro a dominé l’arène d’images d’Artificial Analysis en octobre, bien que cette version ne soit pas open source.
Black Forest Labs a publié FLUX.2 en novembre 2025, mais son adoption a été moins bonne. La couronne open source détenue par le Flux original a duré jusqu’à ce que « l’Alibaba Z-Image Turbo » le détrône fin 2025, en conservant une qualité comparable sur des cartes graphiques grand public d’entrée de gamme. Un utilisateur de CivitAI a écrit à l’époque : « Voilà ce que SD3 était censé être ».
Version Dev programmée pour plus tard en 2026
Vidéo et Action sont maintenant disponibles en accès anticipé via des API et des partenaires sélectionnés, dont fait partie la robotique mimic. La génération d’images suit « dans les prochaines semaines », selon Black Forest Labs. La version Dev en accès ouvert, le seul niveau que Black Forest Labs prévoit de publier pour un usage local, n’est pas prévue avant plus tard en 2026.
FAQ
Quelles capacités vidéo FLUX 3 propose-t-il ?
FLUX 3 produit des clips vidéo jusqu’à 20 secondes avec un audio généré en parallèle de l’image et synchronisé avec l’action à l’écran, y compris le dialogue, les effets sonores et le bruit ambiant. Lors d’évaluations initiales, des évaluateurs humains ont préféré la sortie de FLUX 3 à celle de Runway Gen-4.5 dans 77 % des comparaisons et à celle de Luma Ray 3.2 dans 93 % des comparaisons.
Comment Audi utilise-t-elle FLUX-mimic sur sa chaîne de production ?
Audi teste FLUX-mimic sur des tâches comme la pose de joints de porte flexibles, un travail que l’automatisation conventionnelle a eu du mal à gérer. Le système, construit avec la robotique mimic, traduit le moteur de prédiction vidéo de FLUX 3 en mouvements réels du robot, avec un temps de réaction d’environ 101 millisecondes. Christoph Schneider, chez Audi, a indiqué que les robots « résolvent désormais des tâches complexes de manipulation des corps mous » que des machines plus anciennes ne pouvaient pas aborder.
Quand la version Dev de FLUX 3 en accès ouvert sera-t-elle disponible ?
La version Dev en accès ouvert, le seul niveau que Black Forest Labs prévoit de publier pour un usage local, n’est pas prévue avant plus tard en 2026. Vidéo et Action sont actuellement disponibles en accès anticipé via des API et des partenaires sélectionnés, la génération d’images devant suivre dans les prochaines semaines.