← All articles

기술 심층 분석

ChatGPT 이미지 프롬프트 생성기: 4o 이미지 생성에서 Images 2.0까지

ChatGPT Images는 안전장치와 출처 증명 계층으로 둘러싸인 지시 이행형 시각 시스템으로 이해하는 것이 가장 정확합니다. 제대로 된 프롬프트 워크플로라면 만들어지는 이미지 자체뿐 아니라, 모델이 올바르게 거부하거나 보존하는 제약 조건까지 함께 검증해야 합니다.

Cover image for ChatGPT 이미지 프롬프트 생성기: 4o 이미지 생성에서 Images 2.0까지

출시 이력: 네이티브 4o 이미지 생성, API, 그리고 Images 2.0

OpenAI는 2025년 3월 ChatGPT에 네이티브 4o 이미지 생성 기능을 출시하며, 포토리얼리즘, 이미지 변환, 세부적인 지시 이행, 이미지 내 텍스트 표현 측면에서 DALL·E 3 시대의 경험보다 더 뛰어난 후속작으로 자리매김시켰습니다. 2025년 4월에는 같은 생성 기능이 gpt-image-1이라는 이름으로 개발자에게 공개되었습니다. GPT-Image-1.5는 2025년 12월에 뒤이어 출시되어 더 강력한 지시 이행, 더 정밀한 편집, 더 나은 고밀도 텍스트 렌더링, 더 빠른 생성 속도를 제공했습니다.

2026년 4월 21일, OpenAI는 ChatGPT Images 2.0과 ChatGPT 내 선택적 사고 모드(thinking mode)를 공개했습니다. 이번 출시는 더 강력한 세계 지식, 더 복잡한 이미지, 더 밀도 높은 텍스트, 더 신중한 계획 수립을 중심으로 새로운 시스템을 자리매김시킵니다. 제품명, ChatGPT 모드, API 모델 식별자는 서로 관련되어 있지만 상호 교환 가능한 실험 조건이 아니므로 구분해서 다루어야 합니다.

이 워크플로에서 기술적으로 특별한 점

이 제품의 핵심 동작은 멀티모달 지시 이행입니다. 새로운 장면을 생성해달라고 요청할 수도 있고, 기존 이미지를 제공하며 국소적인 변경을 요청할 수도 있으며, 특정 세부 사항은 보존한 채 나머지를 반복적으로 변형해달라고 요청할 수도 있습니다. 이 때문에 프롬프트는 스타일 태그 목록보다는 편집 명세서에 가까워집니다. 대상이 무엇인지 특정하고, 변경할 내용을 명시하고, 그대로 유지되어야 할 부분을 명확히 밝히는 방식입니다.

Images 2.0에 대해 OpenAI는 추론과 도구를 사용해 결과물을 계획하고 다듬을 수 있는 사고 모드를 문서화하고 있으며, 지원되는 제품 플로우에서는 실시간 웹 검색까지 포함됩니다. 이는 복잡한 작업의 품질을 높일 수 있지만, 즉시 생성과는 다른 시스템 동작이기도 합니다. 공정한 비교를 위해서는 사고 모드가 활성화되었는지, 외부 정보가 사용되었는지, 결과물이 한 번에 생성되었는지 아니면 여러 차례의 대화를 거쳐 다듬어졌는지를 반드시 기록해야 합니다.

기술 보고서가 강조하는 것: 안전은 시스템의 일부다

ChatGPT Images 2.0 시스템 카드는 모델 아키텍처 논문이 아닙니다. 이 문서는 배포 시의 동작에 초점을 맞춥니다. 사실성이 높아지면서 생기는 새로운 위험, 유해한 이미지 요청에 대한 평가, 그리고 생성 전후에 마련된 안전장치입니다. 문서화된 스택에는 업스트림 텍스트 분류기, 이미지 입력에 대한 검사, 그리고 생성된 결과물이 표시되기 전에 이를 검토하는 안전 중심 멀티모달 모니터가 포함됩니다.

이 보고서의 적대적 평가(adversarial evaluation)가 유용한 이유는 정확히 엔드투엔드 결과를 보고하기 때문입니다. 공개된 까다로운 프롬프트 테스트에서, 표준 Images 2.0 구성은 전체 안전 스택을 거친 뒤 99.1%의 안전 출력률을 기록했고, 사고 모드 구성은 99.2%를 기록했습니다. 이는 의도적으로 적대적인 데이터셋에 대한 안전성 측정치일 뿐, 이미지 품질 점수도 아니고 일반 사용자의 실패율 추정치도 아닙니다. 이를 특정 예술적 프롬프트가 99% 정확하다는 근거로 사용해서는 안 됩니다.

출처 증명, 정책, 그리고 프롬프트 신뢰성

OpenAI는 ChatGPT Images 2.0의 출처 증명 수단으로 C2PA 메타데이터와 감지되지 않는 워터마크를 문서화하고 있습니다. 이러한 수단은 다운스트림 시스템이 출처 신호를 식별하는 데 도움을 주지만, 생성된 이미지 자체가 스스로를 증명하게 만들거나 모든 내보내기 경로에서 메타데이터가 살아남는다는 것을 보장하지는 않습니다. 출처 증명은 공개나 편집 검토를 대체하는 것이 아니라 여러 겹의 신호 중 하나로 취급해야 합니다.

안전 관련 동작 역시 실무적인 특성입니다. 워크플로가 공인, 미성년자, 의료 지침, 민감한 사건을 다룬다면, 렌더링 품질과 함께 거부 및 안전한 방향 전환(safe-redirection) 동작도 함께 측정하세요. 성공한 샘플이 아무리 훌륭해 보여도, 사용할 수 없거나 정책에 위배되는 표현을 습관적으로 제안하는 프롬프트 생성기는 품질이 낮은 것입니다.

프롬프트 구성 방식을 실제로 비교할 수 있는 벤치마크

생성을 시작하기 전에 고정된 입력 이미지와 성공 기준을 갖춘 테스트 스위트를 만드세요. 텍스트가 많은 소재, 제품 라벨 편집, 보존이 중요한 인물 편집, 공간적 관계, 다국어 타이포그래피, 안전하지만 까다로운 요청을 포함하세요. 각 조건마다 여러 번 시행하고, 매 시행마다 정확한 대화 내용, 모드, 턴 수, 모델 표면(model surface), 날짜, 수동 보정 여부를 기록하세요.

그런 다음 각 항목을 개별적으로 채점하세요. 지시 준수, 보호해야 할 세부 사항의 보존, 가독성, 이미지의 사실성 또는 스타일 적합도, 편집의 국소성, 안전성 결과입니다. 하나로 뭉뚱그린 점수 대신 작업 유형별 통과율을 공개하세요. 이렇게 하면 실제 작업에서 중요한 트레이드오프가 드러납니다. 예를 들어 어떤 모델은 텍스트가 들어간 포스터에는 뛰어나지만, 여러 번의 편집을 거치며 얼굴을 보존하는 데는 덜 안정적일 수 있습니다.

  • 지정된 화면 텍스트에는 정확 일치(exact-match) 또는 문자 오류율(character-error-rate) 검사를 사용하고, 타이포그래피와 배치는 사람이 직접 검토하라.
  • 미적 품질은 나란히 놓고 블라인드로 평가하라. 평가자가 어떤 프롬프트 템플릿으로 만든 이미지인지 알지 못하게 하라.
  • 편집의 국소성은 전체적인 시각적 유사도만이 아니라 보호 요소 체크리스트로도 측정하라.
  • 거부(refusal)는 형식이 잘못되었거나 품질이 낮은 결과물과 별도로 보고하여, 안전 차단이 렌더링 실패로 잘못 분류되지 않도록 하라.

반복 편집을 버텨내는 프롬프트 작성법

결과부터 제시한 다음 불변 조건을 정하세요. 새로운 생성의 경우: 피사체, 장면, 구도, 빛, 타이포그래피, 출력 형식 순입니다. 편집의 경우: 요청하는 변경 사항을 먼저 제시하고, 그다음 변하지 말아야 할 시각적 요소를 제시합니다. '미니멀하지만 디테일로 가득한'처럼 서로 모순되는 전역적 형용사는, 그 디테일이 정확히 어디에 속하는지 설명하지 않는 한 피하세요.

복잡한 결과물은 단계적으로 작업하세요. 먼저 구도와 위계를 고정하고, 두 번째로 카피와 재질을 다듬고, 세 번째로 범위가 한정된 수정을 요청합니다. 이 방식은 실패 원인을 진단하기 쉽게 만들어주며, 단순히 이미지를 '더 좋게' 해달라고 반복해서 요청하는 것보다 훨씬 의미 있는 평가 기록을 남길 수 있습니다.