← All articles

ANALYSE TECHNIQUE APPROFONDIE

Générateur de prompts photo IA Gemini : historique des modèles, multimodalité native et un plan d'évaluation rigoureux

Les modèles d'image de Gemini sont les plus utiles lorsqu'on les considère comme un système d'édition multimodal, et non comme un point d'accès texte-vers-image en une seule passe. Cette distinction change la façon d'écrire les prompts, de choisir les images de référence et d'évaluer les résultats.

Cover image for Générateur de prompts photo IA Gemini : historique des modèles, multimodalité native et un plan d'évaluation rigoureux

Historique des versions : d'un aperçu de génération d'images à la famille Nano Banana

Google a introduit la génération d'images dans l'API Gemini avec Gemini 2.0 Flash Preview Image Generation le 7 mai 2025. L'aperçu de Gemini 2.5 Flash Image a suivi le même jour, avant d'atteindre la disponibilité générale le 2 octobre 2025 sous le nom Nano Banana. Le modèle stable 2.5 est désormais un membre historique d'une famille plus large, avec Gemini 3.1 Flash Lite Image positionné pour le débit, Gemini 3.1 Flash Image pour l'équilibre général entre capacité, coût et latence, et Gemini 3 Pro Image pour les travaux professionnels complexes.

Cet historique compte sur le plan opérationnel. Un prompt ajusté pour le modèle 2.5 n'est pas une référence intemporelle : les alias de modèle, la résolution de sortie, les limites d'images de référence et les dates de retrait évoluent. Notez l'identifiant exact du modèle et la date à chaque comparaison de résultats, et évitez de traiter un nom marketing comme une clé de reproductibilité.

L'idée technique : une boucle native de génération et d'édition multimodale

Google décrit Gemini 2.5 Flash Image comme nativement multimodal : le texte et les images sont traités dans un flux de travail unifié, plutôt que gérés comme une étape de légendage isolée suivie d'un modèle d'image distinct. La conséquence pratique est qu'un même contexte conversationnel peut contenir une instruction, une ou plusieurs références, et une séquence de modifications.

Cela ne signifie pas que le modèle préserve chaque pixel ou chaque identité à la perfection. Cela signifie que les images en entrée sont des signaux de conditionnement à part entière. En pratique, les prompts doivent préciser le rôle de chaque référence : quelle image fournit le sujet, laquelle fournit la matière ou la palette, et quelles propriétés doivent rester inchangées. Des prompts multi-images ambigus demandent au modèle de résoudre un conflit de conception que vous n'avez pas précisé.

Ce que dit réellement la documentation publique

Le guide Gemini sur l'image actuel documente le texte-vers-image, l'édition texte-et-image, la composition multi-images, les ratios d'aspect configurables, et des résolutions de sortie allant jusqu'à 4K sur les modèles Gemini 3 haut de gamme. Il décrit également l'ancrage par recherche (search grounding) et un processus de réflexion pour certains modèles d'image Gemini 3. Ce sont des capacités produit, et non une description publiée de l'architecture du modèle, du corpus d'entraînement, du nombre de paramètres, ou de la conception du diffuseur/décodeur ; Google n'a pas fourni ces détails d'implémentation dans la documentation produit citée.

La même documentation donne des limites strictes qui devraient guider les prompts en production. Gemini 2.5 Flash Image fonctionne mieux avec jusqu'à trois images en entrée. Gemini 3 Pro Image prend en charge jusqu'à cinq images de référence haute fidélité et jusqu'à quatorze entrées au total, tandis que Gemini 3.1 Flash Image documente des limites distinctes pour la ressemblance des personnages et la fidélité des objets. Chaque image générée inclut un filigrane SynthID.

Évaluation : distinguer le respect des instructions de la préférence visuelle

La préférence esthétique ne suffit pas pour évaluer un générateur de prompts. Constituez un ensemble de tests fixe de briefs qui isolent différentes capacités : fidélité à un sujet unique, texte exact, modifications contraintes, précision du comptage d'objets, composition multi-références, cohérence des personnages, et respect du ratio d'aspect. Pour chaque brief, maintenez constants le modèle, la taille, le contrôle de graine (seed) si disponible, et les images de référence ; ne faites varier que la formulation du prompt testée.

Notez chaque résultat selon une grille plutôt qu'un simple verdict du type « le meilleur l'emporte ». Une grille utile comprend la couverture des exigences, la préservation des éléments protégés, la précision du texte, la justesse spatiale, les artefacts indésirables et la qualité visuelle finale. Utilisez une comparaison humaine par paires en aveugle pour les jugements sensibles au goût, puis indiquez le nombre de prompts, le nombre d'images par prompt, le nombre d'évaluateurs et les intervalles de confiance. Sans ces détails, une capture d'écran de classement n'est que la preuve d'un échantillon de préférences, et non une affirmation générale de supériorité.

  • Couverture des instructions : chaque élément explicitement requis est-il présent, et chaque élément explicitement interdit est-il bien absent ?
  • Localité de la modification : le changement demandé s'est-il produit sans dérive non liée dans l'identité, la mise en page ou le style ?
  • Fidélité aux références : le résultat a-t-il préservé le rôle déclaré de chaque image en entrée plutôt que de simplement ressembler à l'une d'elles ?
  • Coût opérationnel : mesurez la latence, le taux d'échec, les tentatives répétées et le coût effectif par actif accepté, et pas seulement le coût par appel d'API.

Comment le prompter dans un flux de travail photo

Commencez par une spécification de scène : sujet, environnement, caméra/cadrage, éclairage, indices de matière, et format de sortie visé. Ajoutez ensuite des contraintes explicites et un contrat d'édition compact. Pour un travail complexe, effectuez une première passe courte pour établir la composition, puis apportez une seule modification ciblée plutôt que d'empiler tous les changements possibles dans la requête initiale.

Pour un générateur de prompts photo, le résultat le plus précieux n'est pas un paragraphe maximal. C'est un prompt qui préserve les décisions testables : quel est le sujet, quels attributs visuels sont non négociables, ce qui doit rester stable au fil d'une modification, et quel format est requis. Le flux de travail multimodal de Gemini est le plus efficace lorsque cette structure rend les rôles des références sans ambiguïté.