Des modèles multimodaux
Google intègre la génération et l'édition d'images dans sa famille Gemini.
L'intérêt d'une approche multimodale est de pouvoir travailler avec du texte et des informations visuelles dans une même interaction.
Le modèle peut ainsi recevoir une instruction, une image ou plusieurs éléments de contexte afin de produire ou transformer un visuel.
Génération
Gemini peut être utilisé pour générer une image à partir d'une description.
Mais son intérêt pour les workflows créatifs apparaît également dans les tâches où le modèle doit comprendre une image existante avant de la modifier.
Édition par langage naturel
Un créatif peut exprimer directement une intention :
modifier un élément
conserver une partie de l'image
changer un environnement
adapter un style
introduire de nouveaux éléments
Ce type d'interaction rapproche le modèle d'une logique de direction artistique conversationnelle.
Les modèles évoluent rapidement
Google fait évoluer régulièrement les modèles disponibles, leurs noms et leurs modes d'accès.
Axiris évite donc de transformer cette page mère en liste figée de versions.
Les nouvelles sorties importantes peuvent être documentées dans des pages spécifiques et dans les news.
Gemini dans les workflows Axiris
Nous nous intéressons particulièrement à la capacité de relier :
intention → contexte visuel → édition → contrôle → finition
La qualité réelle de ces opérations est évaluée dans nos tests lorsqu'un modèle entre dans nos workflows.
Source officielle
Google AI for Developers — Image generation :
https://ai.google.dev/gemini-api/docs/image-generation