技術深度剖析
Gemini AI 照片提示詞產生器:模型發展歷程、原生多模態能力,以及一套嚴謹的評估方案
把 Gemini 的影像模型當作一套多模態編輯系統來使用,而不是單次生成的文字轉圖像端點,才能發揮它最大的價值。這個區別會改變你撰寫提示詞、選擇參考圖片,以及評估結果的方式。

發布歷程:從影像生成預覽版到 Nano Banana 系列
Google 於 2025 年 5 月 7 日透過 Gemini 2.0 Flash Preview Image Generation,在 Gemini API 中開放了影像生成功能。Gemini 2.5 Flash Image 預覽版於同一天推出,並於 2025 年 10 月 2 日以 Nano Banana 之名正式全面上線。如今,這個穩定版的 2.5 模型已成為一個更廣泛系列中的舊版成員:Gemini 3.1 Flash Lite Image 主打高吞吐量、Gemini 3.1 Flash Image 在能力、成本與延遲之間取得一般性平衡,而 Gemini 3 Pro Image 則用於複雜的專業工作。
這段發展歷程在實務上很重要。針對 2.5 模型調校過的提示詞,並不是一個永恆不變的基準:模型別名、輸出解析度、參考圖片數量限制,以及模型退役日期都會改變。每次比較結果時,都應記錄確切的模型識別碼與日期,避免把行銷用的名稱當作可重現性的依據。
技術核心概念:原生多模態的生成與編輯循環
Google 將 Gemini 2.5 Flash Image 描述為「原生多模態」:文字與影像是在同一套統一的工作流程中處理,而不是先經過一個獨立的圖說階段,再交給另一個獨立的影像模型。實務上的結果是,同一個對話脈絡中可以同時包含一項指令、一張或多張參考圖片,以及一連串的編輯動作。
這並不代表模型會完美保留每一個像素或身分特徵,而是代表影像輸入是一等公民等級的條件訊號。實務上,提示詞應該說明每張參考圖片各自扮演的角色:哪張圖片提供主體、哪張圖片提供材質或色調,以及哪些屬性必須維持不變。含糊不清的多圖提示詞,等於是要求模型自行解決一個你根本沒有說清楚的設計衝突。
官方公開文件實際說了什麼
目前的 Gemini 影像指南記載了文字轉影像、文字加影像編輯、多圖合成、可調整的長寬比,以及在高階 Gemini 3 模型上高達 4K 的輸出解析度。文件中也描述了搜尋落地(search grounding)功能,以及部分 Gemini 3 影像模型具備的思考過程。但這些都只是產品功能,並非官方公開的模型架構、訓練語料、參數量,或擴散模型/解碼器設計說明;Google 在所引用的產品文件中並未提供這些實作細節。
同一份文件也列出了應該影響實際製作提示詞方式的硬性限制。Gemini 2.5 Flash Image 最多以三張輸入圖片時效果最佳。Gemini 3 Pro Image 支援最多五張高保真參考圖片,以及最多十四張總輸入圖片;而 Gemini 3.1 Flash Image 則針對人物相似度與物件保真度分別記載了不同的限制。每一張生成的影像都會內嵌 SynthID 浮水印。
評估:把指令遵循度與影像喜好度分開衡量
光憑審美偏好無法評估一套提示詞產生器。應建立一組固定的測試提案(brief),分別獨立檢驗不同能力:單一主體保真度、文字精確度、受限編輯、物件數量準確性、多參考圖合成、角色一致性,以及長寬比的遵循程度。每個提案都應固定模型、尺寸、隨機種子(若可控制)與參考輸入,只變動你正在測試的提示詞寫法。
以評分表(rubric)為每個輸出評分,而不是單純以「贏家全拿」的方式做出單一標籤。一份實用的評分表應包含需求涵蓋率、受保護元素的保留程度、文字準確度、空間正確性、不想要的雜訊瑕疵,以及最終的視覺品質。對於涉及主觀品味判斷的部分,採用盲測的人工兩兩比較法,並回報提示詞數量、每個提示詞生成的圖片數量、評分者人數,以及信賴區間。缺少這些細節,一張排行榜截圖只能證明某次偏好樣本的結果,不能作為整體優越性的普遍論證。
- 指令涵蓋率:每一項明確要求的必要元素是否都有出現?每一項明確禁止的元素是否都確實缺席?
- 編輯局部性:要求的變更是否確實發生,而沒有在身分特徵、版面配置或風格上出現無關的偏移?
- 參考圖保真度:輸出結果是否確實保留了每張輸入圖片所被賦予的角色,而不只是與其中一張看起來相似?
- 營運成本:衡量延遲時間、失敗率、重試次數,以及每個「可接受成果」的實際成本,而不只是每次 API 呼叫的成本。
在照片工作流程中如何撰寫提示詞
先從場景規格開始:主體、環境、鏡頭/取景、光線、材質線索,以及預期的輸出格式。接著加上明確的限制條件,以及一份精簡的編輯約定。對於複雜的工作,先用簡短的第一輪來確立構圖,再進行一次針對性的後續編輯,而不是把所有可能的變動一次全部塞進最初的請求裡。
對於照片提示詞產生器而言,最有價值的輸出並不是一大段極盡詳盡的文字,而是一個能保留「可驗證決策」的提示詞:主體是什麼、哪些視覺屬性不容妥協、在編輯過程中哪些部分應維持穩定,以及需要什麼樣的格式。當這樣的結構讓每張參考圖的角色清楚無疑時,Gemini 的多模態工作流程才能發揮最大效果。