Générer une image à partir d'un texte
Le text-to-image transforme une description textuelle en image.
C'est probablement la forme la plus connue de génération d'images par intelligence artificielle.
L'utilisateur fournit une intention sous forme de prompt et le modèle interprète cette description pour produire une représentation visuelle.
Le prompt ne travaille pas seul
La qualité du résultat ne dépend pas uniquement de la quantité de mots utilisés.
Le modèle doit interpréter :
- le sujet ;
- le style ;
- la composition ;
- les matières ;
- la lumière ;
- l'environnement ;
- le cadrage ;
- l'atmosphère ;
- le rendu.
Chez Axiris, ces éléments peuvent être structurés comme une véritable direction artistique plutôt que comme une accumulation de mots-clés.
Une même instruction, plusieurs interprétations
Chaque famille de modèles possède son propre comportement.
Une description identique peut produire des résultats très différents avec FLUX, Gemini, Qwen, GPT Image ou Stable Diffusion.
Le travail consiste donc aussi à adapter la formulation au moteur.
Le text-to-image est souvent le début du workflow
Une première génération n'est pas nécessairement le résultat final.
Elle peut ensuite être :
sélectionnée → transformée → corrigée → recomposée → agrandie → retouchée
Le text-to-image devient alors une étape de production parmi plusieurs.