Axiris

Gemini Image — Génération et édition d'image avec Google

Des modèles multimodaux

Google intègre la génération et l'édition d'images dans sa famille Gemini.

L'intérêt d'une approche multimodale est de pouvoir travailler avec du texte et des informations visuelles dans une même interaction.

Le modèle peut ainsi recevoir une instruction, une image ou plusieurs éléments de contexte afin de produire ou transformer un visuel.

Génération

Gemini peut être utilisé pour générer une image à partir d'une description.

Mais son intérêt pour les workflows créatifs apparaît également dans les tâches où le modèle doit comprendre une image existante avant de la modifier.

Édition par langage naturel

Un créatif peut exprimer directement une intention :

modifier un élément
conserver une partie de l'image
changer un environnement
adapter un style
introduire de nouveaux éléments

Ce type d'interaction rapproche le modèle d'une logique de direction artistique conversationnelle.

Les modèles évoluent rapidement

Google fait évoluer régulièrement les modèles disponibles, leurs noms et leurs modes d'accès.

Axiris évite donc de transformer cette page mère en liste figée de versions.

Les nouvelles sorties importantes peuvent être documentées dans des pages spécifiques et dans les news.

Gemini dans les workflows Axiris

Nous nous intéressons particulièrement à la capacité de relier :

intention → contexte visuel → édition → contrôle → finition

La qualité réelle de ces opérations est évaluée dans nos tests lorsqu'un modèle entre dans nos workflows.

Source officielle