← All articles

技術深度剖析

ChatGPT 影像提示詞產生器:從 4o 影像生成到 Images 2.0

理解 ChatGPT Images 最好的方式,是把它視為一套「遵循指令的視覺系統」,外層包覆著安全機制與來源證明層。一套嚴謹的提示詞工作流程,應同時測試它所生成的畫面,以及它正確拒絕或保留的限制條件。

Cover image for ChatGPT 影像提示詞產生器:從 4o 影像生成到 Images 2.0

發布歷程:原生 4o 影像生成、API,再到 Images 2.0

OpenAI 於 2025 年 3 月在 ChatGPT 中推出原生 4o 影像生成功能,將其定位為 DALL·E 3 時代體驗的能力升級版,在寫實度、影像轉換、細節指令遵循,以及影像中的文字呈現上都更為出色。2025 年 4 月,同樣的生成能力以 gpt-image-1 之名開放給開發者使用。GPT-Image-1.5 於 2025 年 12 月推出,具備更強的指令遵循能力、更精確的編輯功能、更佳的密集文字渲染,以及更快的生成速度。

2026 年 4 月 21 日,OpenAI 在 ChatGPT 中推出了 ChatGPT Images 2.0,以及一個可選用的思考模式(thinking mode)。這次發布將新系統定位為具備更強的世界知識、能處理更複雜的影像、更密集的文字呈現,以及更審慎周密的規劃能力。請務必區分產品名稱、ChatGPT 模式,以及 API 模型識別碼:它們是彼此相關的介面,但不能當作可以互換的實驗條件。

此工作流程在技術上的獨特之處

這項產品的核心行為是多模態指令遵循。你可以要求生成一個場景、提供一張現有圖片並要求局部修改,或是以反覆迭代的方式在轉換其他細節的同時保留特定細節。這使得提示詞比較不像一份風格標籤清單,而更像一份編輯規格書:指出目標、說明要做的變更,並明確指出哪些部分必須維持穩定。

針對 Images 2.0,OpenAI 記載了一種思考模式,能運用推理與工具來規劃並精煉輸出結果,在支援的產品流程中甚至包含即時網路搜尋。這或許能提升複雜任務的表現,但這也是一種與即時生成截然不同的系統行為。一次公平的比較,必須記錄是否啟用了思考模式、是否使用了外部資訊,以及輸出結果是一次生成完成,還是經過多輪對話反覆精煉而來。

技術報告強調的重點:安全機制是系統的一部分

ChatGPT Images 2.0 的系統卡並不是一篇模型架構論文,它聚焦於部署行為:更高的寫實度所帶來的新風險、對有害影像請求的評估,以及在生成前後所設置的防護措施。文件記載的技術堆疊包括上游的文字分類器、對影像輸入的檢查,以及一套專門負責安全的多模態監控機制,會在輸出顯示給使用者之前先行審查。

這份報告的對抗性評估之所以有用,正是因為它回報的是端到端的結果。在其公開的高難度提示詞測試中,標準版 Images 2.0 在整套安全機制作用後,產出安全結果的比例為 99.1%;啟用思考模式的版本則為 99.2%。這些是針對刻意設計的對抗性資料集所做的安全性測量,並不是影像品質分數,也不是一般使用者失敗率的估計值。請勿把這些數字當作「某個藝術性提示詞有 99% 準確度」的證據。

來源證明、政策,與提示詞可靠性

OpenAI 記載了 ChatGPT Images 2.0 所採用的來源證明措施,包括 C2PA 元資料與一種不可察覺的浮水印。這些措施有助於下游系統辨識來源訊號,但並不能使生成的影像自我驗證,也不保證元資料能在每一種匯出途徑中都被保留下來。應將來源證明視為一層輔助訊號,而不是揭露或編輯審查的替代品。

安全行為本身也是一種產品特性。如果工作流程涉及公眾人物、未成年人、醫療指示或敏感事件,就應該同時衡量拒絕與安全轉向行為,以及渲染品質。一套經常提出無法使用或違反政策措辭的提示詞產生器,即使成功的樣本看起來很出色,整體品質仍然較低。

一套能真正比較不同提示詞寫法的評測基準

在開始生成之前,先建立一套測試組合,固定輸入圖片與成功標準。內容應包含文字密集的素材、產品標籤編輯、對保留程度敏感的人像編輯、空間關係、多語言排版,以及安全但具挑戰性的請求。每個條件都要進行多次試驗。每次試驗都要記錄完整的對話內容、模式、對話輪數、模型介面、日期,以及任何人工修飾。

接著分別對各個維度評分:指令遵循度、受保護細節的保留程度、可讀性、影像寫實度或風格契合度、編輯局部性,以及安全結果。依任務類別分別公布通過率,而不是給出單一混合數字。這樣才能揭露實務工作中真正重要的取捨:一個模型可能非常擅長製作帶有文字的海報,卻在經過多次編輯後較難可靠地保留人臉。

  • 針對指定的可見文字,使用精確比對或字元錯誤率(CER)檢查,並搭配人工審查排版與位置。
  • 審美品質採用並排盲測評分;不要讓評分者知道是哪個提示詞範本產生了這張影像。
  • 以受保護元素檢核清單來衡量編輯局部性,而不只是整體視覺相似度。
  • 把拒絕生成與格式錯誤或低品質輸出分開回報,避免安全性攔截被誤判為渲染失敗。

如何寫出經得起反覆迭代的提示詞

先說明想要的結果,再確立不可變動的條件。在全新生成時:依序寫出主體、場景、構圖、光線、文字排版與輸出格式。在編輯時:先寫出要求的變更,再寫出不得改變的視覺元素。避免使用互相矛盾的整體性形容詞,例如「極簡卻又充滿細節」,除非你能說明那些細節該放在哪裡。

對於複雜的素材,採取分階段的方式進行。第一階段先固定構圖與層級關係;第二階段精修文案與材質;第三階段提出範圍明確的修正請求。這種做法能讓失敗之處可被診斷,也比一再要求影像「更好一點」提供更有意義的評估軌跡。