ANÁLISIS TÉCNICO EN PROFUNDIDAD
Generador de prompts fotográficos con IA de Gemini: historia del modelo, multimodalidad nativa y un plan de evaluación riguroso
Los modelos de imagen de Gemini son más útiles cuando se tratan como un sistema de edición multimodal, no como un endpoint de texto a imagen de un solo paso. Esa distinción cambia cómo escribes los prompts, eliges las imágenes de referencia y evalúas los resultados.

Historial de lanzamientos: de una vista previa de generación de imágenes a la familia Nano Banana
Google incorporó la generación de imágenes en la API de Gemini a través de Gemini 2.0 Flash Preview Image Generation el 7 de mayo de 2025. La vista previa de Gemini 2.5 Flash Image llegó ese mismo día, y alcanzó la disponibilidad general el 2 de octubre de 2025 bajo el nombre Nano Banana. El modelo estable 2.5 es ahora un miembro heredado (legacy) de una familia más amplia, con Gemini 3.1 Flash Lite Image orientado al rendimiento, Gemini 3.1 Flash Image para el equilibrio general entre capacidad, costo y latencia, y Gemini 3 Pro Image para trabajos profesionales complejos.
Este historial importa a nivel operativo. Un prompt ajustado para el modelo 2.5 no es una referencia atemporal: los alias de los modelos, la resolución de salida, los límites de imágenes de referencia y las fechas de retiro cambian. Registra el identificador exacto del modelo y la fecha cada vez que compares resultados, y evita tratar un nombre comercial como una clave de reproducibilidad.
La idea técnica: un ciclo nativo multimodal de generación y edición
Google describe Gemini 2.5 Flash Image como nativamente multimodal: el texto y las imágenes se procesan en un único flujo de trabajo unificado, en lugar de tratarse como una etapa aislada de generación de descripciones seguida de un modelo de imagen independiente. La consecuencia práctica es que el mismo contexto conversacional puede contener una instrucción, una o más referencias y una secuencia de ediciones.
Esto no significa que el modelo preserve cada píxel o identidad a la perfección. Significa que las imágenes de entrada son señales de condicionamiento de primer nivel. En la práctica, los prompts deben indicar el rol de cada referencia: qué imagen aporta el sujeto, cuál aporta el material o la paleta, y qué propiedades deben permanecer sin cambios. Los prompts multiimagen ambiguos le piden al modelo que resuelva un conflicto de diseño que tú no has especificado.
Lo que realmente dice la documentación pública
La guía actual de imágenes de Gemini documenta texto a imagen, edición de texto e imagen combinados, composición multiimagen, relaciones de aspecto configurables y resoluciones de salida de hasta 4K en los modelos Gemini 3 de gama alta. También describe el anclaje con búsqueda (search grounding) y un proceso de razonamiento (thinking) para determinados modelos de imagen de Gemini 3. Se trata de capacidades del producto, no de una descripción publicada de la arquitectura del modelo, el corpus de entrenamiento, el número de parámetros o el diseño de difusión/decodificador; Google no ha proporcionado esos detalles de implementación en la documentación de producto citada.
La misma documentación establece límites concretos que deberían determinar los prompts en producción. Gemini 2.5 Flash Image funciona mejor con un máximo de tres imágenes de entrada. Gemini 3 Pro Image admite hasta cinco imágenes de referencia de alta fidelidad y hasta catorce entradas en total, mientras que Gemini 3.1 Flash Image documenta límites distintos para la semejanza de personajes y la fidelidad de objetos. Cada imagen generada incluye una marca de agua SynthID.
Evaluación: separar el seguimiento de instrucciones de la preferencia visual
La preferencia estética no basta para evaluar un generador de prompts. Construye un conjunto fijo de briefs de prueba que aíslen distintas capacidades: fidelidad con un solo sujeto, texto exacto, ediciones restringidas, precisión en el conteo de objetos, composición con múltiples referencias, consistencia de personajes y cumplimiento de la relación de aspecto. Para cada brief, mantén constantes el modelo, el tamaño, el control de semilla (seed) si está disponible, y las entradas de referencia; varía únicamente la formulación del prompt que estás probando.
Puntúa cada resultado con una rúbrica en lugar de una única etiqueta de todo-o-nada. Una rúbrica útil incluye cobertura de requisitos, preservación de elementos protegidos, precisión del texto, corrección espacial, artefactos no deseados y calidad visual final. Usa comparaciones pareadas y ciegas realizadas por humanos para los juicios sensibles al gusto, y luego informa el número de prompts, imágenes por prompt, número de evaluadores e intervalos de confianza. Sin esos detalles, la captura de una tabla de clasificación es evidencia de una muestra de preferencia, no una afirmación general de superioridad.
- Cobertura de instrucciones: ¿apareció cada elemento obligatorio explícito, y permaneció ausente cada elemento prohibido?
- Localidad de la edición: ¿ocurrió el cambio solicitado sin desviaciones no relacionadas en la identidad, el diseño o el estilo?
- Fidelidad de referencia: ¿el resultado preservó el rol declarado de cada imagen de entrada, en lugar de simplemente parecerse a una de ellas?
- Costo operativo: mide la latencia, la tasa de fallos, los reintentos y el costo efectivo por recurso aceptado, no solo el costo por llamada a la API.
Cómo redactar prompts en un flujo de trabajo fotográfico
Empieza con una especificación de la escena: sujeto, entorno, cámara/encuadre, iluminación, indicios de material y formato de salida previsto. Luego añade restricciones explícitas y un contrato de edición compacto. Para trabajos complejos, usa una primera pasada breve para establecer la composición, y después realiza una única edición de seguimiento específica en lugar de acumular todos los cambios posibles en la solicitud inicial.
Para un generador de prompts fotográficos, el resultado de mayor valor no es un párrafo extenso. Es un prompt que preserva las decisiones verificables: cuál es el sujeto, qué atributos visuales son innegociables, qué debe permanecer estable a través de una edición y qué formato se requiere. El flujo de trabajo multimodal de Gemini rinde mejor cuando esa estructura deja sin ambigüedad los roles de cada referencia.