FLUX 3 annoncé en Early Access
25 juillet 2026 · Kris Wilhem
FLUX 3 annoncé : image, vidéo, audio et action dans un même modèle
Black Forest Labs vient d’annoncer FLUX 3, une nouvelle génération de modèle fondamental multimodal.
La vidéo entre déjà en Early Access, l’image suivra dans les prochaines semaines, et une version FLUX 3 Dev en open weights est officiellement prévue.
Un seul modèle pour plusieurs médias
Avec FLUX 3, BFL ne présente plus simplement un générateur d’images.
Le modèle est entraîné conjointement sur :
- l’image
- la vidéo
- l’audio
- le langage
- la prédiction d’actions
L’objectif est de construire une représentation plus cohérente du monde : comprendre les objets, leurs mouvements, les sons qu’ils produisent et la manière dont une scène évolue dans le temps.
Une image apporte la structure visuelle. La vidéo ajoute le mouvement et la continuité. L’audio relie les événements visibles à leur environnement sonore. Le langage permet de diriger l’ensemble.
FLUX 3 Video entre en Early Access
La première version accessible est FLUX 3 Video.
BFL annonce notamment :
- jusqu’à 20 secondes de vidéo
- génération text-to-video
- image-to-video
- transformation video-to-video
- continuation de clips
- utilisation de keyframes
- conservation des personnages entre plusieurs scènes
- génération d’un audio natif synchronisé
- dialogues multilingues
- motion design et typographie animée
L’accès reste pour le moment réservé à une sélection de testeurs.
FLUX 3 Image suivra
FLUX 3 Image doit arriver ensuite avec des fonctions de génération et d’édition.
BFL met en avant une meilleure compréhension des prompts complexes, une génération de texte plus fiable et une gestion améliorée des contenus multilingues.
Pour le moment, aucune information précise n’a encore été donnée sur :
- la taille du modèle
- la consommation de VRAM
- les performances locales
- l’intégration dans ComfyUI
- la compatibilité avec Diffusers
- le fine-tuning
- les LoRA
FLUX 3 Dev est confirmé
C’est probablement l’annonce la plus importante pour les utilisateurs locaux.
Black Forest Labs confirme l’arrivée de FLUX 3 Dev, présenté comme un backbone multimodal open weights.
Il ne s’agirait donc pas seulement d’un nouveau checkpoint text-to-image, mais potentiellement du socle ouvert capable de gérer plusieurs modalités : image, vidéo, audio et action.
La date de sortie, la licence, les besoins matériels et les possibilités de fine-tuning restent encore inconnus.
La lecture d’Axiris
Pour Axiris, le véritable intérêt de FLUX 3 ne réside pas seulement dans une amélioration de la qualité visuelle.
Le changement majeur est la possibilité de relier dans un même système plusieurs étapes aujourd’hui séparées :
concevoir une image, la modifier, préserver une identité visuelle, animer une scène, produire son environnement sonore et maintenir une continuité entre plusieurs plans.
Cette approche rejoint directement la direction prise avec NOVA, le Context Builder et les workflows ComfyUI développés par Axiris.
NOVA pourrait structurer l’intention, les références, la composition et les règles visuelles du projet. Le Context Builder servirait de couche de direction artistique. FLUX 3 pourrait ensuite exécuter cette intention à travers plusieurs médias.
Le rôle du modèle de langage ne serait alors plus seulement d’écrire un prompt, mais de piloter une véritable chaîne de production multimodale.
Une question de matériel
Il est encore trop tôt pour savoir si le backbone complet pourra fonctionner confortablement sur une carte graphique grand public.
Une RTX 5090 32 Go pourrait éventuellement convenir à une version spécialisée, partiellement chargée ou quantifiée.
Pour le modèle complet, une RTX 6000 Pro 96 Go semble aujourd’hui plus réaliste.
Cela reste une estimation technique d’Axiris : BFL n’a encore publié aucune configuration officielle.
Axiris face à l’Early Access
Le positionnement d’Axiris correspond particulièrement bien au type de cas d’usage recherché :
- workflows multimodaux
- intégration locale
- ComfyUI
- direction artistique structurée
- gestion de références
- continuité visuelle
- interaction entre LLM et modèles génératifs
Avec NOVA et le Context Builder, Axiris ne se présente pas simplement comme un utilisateur souhaitant tester un nouveau modèle, mais comme un studio développant déjà une véritable architecture de production autour de ces usages.
À retenir
FLUX 3 Video entre en Early Access. FLUX 3 Image arrivera ensuite. FLUX 3 Dev est officiellement confirmé en open weights.
Pour Axiris, FLUX 3 confirme surtout une évolution déjà engagée : l’avenir ne sera plus une succession de modèles isolés, mais un environnement capable de relier langage, image, vidéo, audio, références et direction artistique dans un même système créatif.