← All articles

ANÁLISIS TÉCNICO EN PROFUNDIDAD

Generador de prompts de imágenes de ChatGPT: de la generación de imágenes de 4o a Images 2.0

ChatGPT Images se entiende mejor como un sistema visual que sigue instrucciones, rodeado de capas de seguridad y procedencia. Un flujo de trabajo de prompts riguroso pone a prueba tanto la imagen que produce como las restricciones que rechaza o preserva correctamente.

Cover image for Generador de prompts de imágenes de ChatGPT: de la generación de imágenes de 4o a Images 2.0

Historial de lanzamientos: generación de imágenes nativa de 4o, la API y luego Images 2.0

OpenAI lanzó la generación de imágenes nativa de 4o en ChatGPT en marzo de 2025, posicionándola como un sucesor más capaz de la experiencia de la era DALL·E 3 en cuanto a fotorrealismo, transformación de imágenes, instrucciones detalladas y texto en imágenes. En abril de 2025, esa misma capacidad de generación quedó disponible para desarrolladores como gpt-image-1. GPT-Image-1.5 llegó después, en diciembre de 2025, con un seguimiento de instrucciones más sólido, una edición más precisa, mejor renderizado de texto denso y una generación más rápida.

El 21 de abril de 2026, OpenAI presentó ChatGPT Images 2.0 y un modo de razonamiento (thinking mode) opcional en ChatGPT. El lanzamiento posiciona el nuevo sistema en torno a un conocimiento del mundo más sólido, imágenes más complejas, texto más denso y una planificación más deliberada. Mantén separados el nombre del producto, el modo de ChatGPT y el identificador del modelo de la API: son superficies relacionadas, pero no son condiciones experimentales intercambiables.

Qué distingue técnicamente a este flujo de trabajo

El comportamiento central del producto es el seguimiento de instrucciones multimodal. Puedes pedir una escena generada, aportar una imagen existente y solicitar un cambio localizado, o preservar de forma iterativa detalles seleccionados mientras transformas otros. Esto hace que el prompt se parezca menos a una lista de etiquetas de estilo y más a una especificación de edición: identifica el objetivo, nombra el cambio y especifica explícitamente qué debe permanecer estable.

Para Images 2.0, OpenAI documenta un modo de razonamiento que puede usar razonamiento y herramientas para planificar y refinar un resultado, incluida la búsqueda web en vivo en los flujos de producto compatibles. Esto puede mejorar los trabajos complejos, pero también constituye un comportamiento de sistema distinto al de la generación instantánea. Una comparación justa debe registrar si el modo de razonamiento estaba activado, si se usó información externa y si un resultado se generó de una sola vez o se refinó a lo largo de una conversación de varios pasos.

Lo que enfatiza el informe técnico: la seguridad forma parte del sistema

La ficha de sistema (system card) de ChatGPT Images 2.0 no es un artículo sobre la arquitectura del modelo. Se centra en el comportamiento en producción: los nuevos riesgos que genera un mayor realismo, la evaluación de solicitudes de imágenes dañinas y las salvaguardas que se aplican antes y después de la generación. La pila documentada incluye clasificadores de texto previos, comprobaciones sobre las imágenes de entrada y un monitor multimodal centrado en la seguridad que revisa el resultado generado antes de mostrarlo.

La evaluación adversarial del informe es útil precisamente porque reporta resultados de extremo a extremo. En su prueba publicada de prompts desafiantes, la configuración estándar de Images 2.0 produjo una tasa de resultados seguros del 99.1% tras aplicar toda la pila de seguridad combinada; la configuración con razonamiento reportó un 99.2%. Se trata de mediciones de seguridad sobre un conjunto de datos deliberadamente adversarial, no de puntuaciones de calidad de imagen ni de estimaciones de la tasa de fallos de un usuario normal. No las uses como evidencia de que un prompt artístico determinado es preciso en un 99%.

Procedencia, políticas y fiabilidad de los prompts

OpenAI documenta metadatos C2PA y una marca de agua imperceptible como medidas de procedencia para ChatGPT Images 2.0. Estas medidas ayudan a que los sistemas posteriores identifiquen señales de origen, pero no hacen que una imagen generada se autoverifique ni garantizan que los metadatos sobrevivan a cualquier ruta de exportación. Trata la procedencia como una señal más de una serie de capas, no como un sustituto de la divulgación o la revisión editorial.

El comportamiento de seguridad es también una característica de producción. Si un flujo de trabajo involucra a figuras públicas, menores, instrucciones médicas o eventos sensibles, mide el comportamiento de rechazo y redirección segura junto con la calidad del renderizado. Un generador de prompts que propone habitualmente una redacción inutilizable o que entra en conflicto con las políticas es de menor calidad, aunque sus muestras exitosas se vean sólidas.

Un benchmark que realmente puede comparar formulaciones de prompts

Crea un conjunto de pruebas con imágenes de entrada fijas y criterios de éxito antes de generar. Incluye recursos con mucho texto, ediciones de etiquetas de producto, ediciones de retrato sensibles a la preservación, relaciones espaciales, tipografía multilingüe y solicitudes seguras pero exigentes. Genera varios intentos por condición. Para cada intento, registra la conversación exacta, el modo, el número de turnos, la superficie del modelo, la fecha y cualquier retoque manual.

Luego califica dimensiones separadas: cumplimiento de instrucciones, preservación de detalles protegidos, legibilidad, realismo de la imagen o ajuste al estilo, localidad de la edición y resultado de seguridad. Publica las tasas de aprobación por familia de tareas en lugar de una sola cifra combinada. Esto expone la disyuntiva que realmente importa en el trabajo real: un modelo puede ser excelente con un póster con texto y, al mismo tiempo, menos fiable a la hora de preservar un rostro a lo largo de varias ediciones.

  • Usa comprobaciones de coincidencia exacta o de tasa de error de caracteres para el texto visible especificado, con revisión humana para la tipografía y la ubicación.
  • Usa valoraciones ciegas y en paralelo para la calidad estética; no dejes que el evaluador vea qué plantilla de prompt produjo la imagen.
  • Mide la localidad de la edición con una lista de verificación de elementos protegidos, no solo con la similitud visual global.
  • Informa los rechazos por separado de los resultados malformados o de baja calidad, para que un bloqueo de seguridad no se clasifique erróneamente como un fallo de renderizado.

Cómo escribir prompts que resistan la iteración

Empieza por el resultado deseado y luego establece los invariantes. En una generación desde cero: sujeto, escena, composición, luz, tipografía y formato de salida. En una edición: primero el cambio solicitado, luego los elementos visuales que no deben cambiar. Evita adjetivos globales contradictorios como “minimalista pero repleto de detalle” a menos que expliques dónde debe ir ese detalle.

Para recursos complejos, trabaja por pasadas. Primero fija la composición y la jerarquía; segundo, refina el texto y los materiales; tercero, solicita una corrección acotada. Este enfoque hace que los fallos sean diagnosticables y te da un registro de evaluación más significativo que pedir repetidamente que una imagen sea “mejor”.