GPT Image 2.5 官方提示詞指南,把改圖寫成可驗收的規格

OpenAI 隨 9 月 8 日的發布在開發者文件收錄 GPT Image 2.5 官方提示詞指南,整理八個寫法要領、精準編輯與多輪修改規則,並載明 gpt-image-1 與 1.5 分別在 10 月 23 日、12 月 1 日退場。

用 AI 摘要這篇文章:

ChatGPT Images 2.5 在 2026 年 9 月 8 日向所有方案推出,OpenAI 的開發者文件裡也收了一份完整的提示詞指南。這份名為 GPT Image 2.5 prompting guide 的文件,除了模型選擇、參數規則與遷移流程,還把「怎麼寫 prompt 才不會改一處毀全圖」攤成八個要領、十七個附完整範例 prompt 的案例,以及一張產出驗收清單。背後的規模數字先記一筆:官方部落格宣稱,ChatGPT Images 與 API 的 GPT-Image 模型每週生成超過 30 億張圖。

整份指南的立場可以用一句話總結:可控的結果靠契約式的寫法,不靠運氣。要改什麼、什麼絕對不能動、文字出現幾次、透明是不是真的透明,全部寫進 prompt 變成可檢查的條款,產出再逐條驗收。模型進步只是讓這套寫法終於可靠起來;官方自己在文件裡也承認,重複編輯仍可能動到你想保留的細節,需要像素級一致時,最終要把修改後的區塊合成回原始圖片,不能只靠 prompt。

這份文件放在 API 文件站裡,但八個要領談的是 prompt 的寫法本身,在 ChatGPT 對話裡生圖同樣用得上;走 API 的開發者則多拿到一份遷移紀律,而且同頁的參照資料把舊模型的死線寫死了:gpt-image-1 將在 2026 年 10 月 23 日關閉,gpt-image-1.5 等三個舊識別碼在 12 月 1 日退場。舊模型的退場時程不是隨 2.5 發布才補上:這些日期早在 4 月與 6 月的退場公告就定案了,可對照發布當天的整理

先記一條公式:一張圖的 prompt 要交代六件事

官方指南沒有發明神秘語法。它的基本要求是把六件事講清楚:成品用途、主體與動作、構圖與比例、看得見的細節、需要出現的文字,以及不可改動或不能出現的內容。格式完全自由,短句、段落、類 JSON 結構或標籤都行,官方唯一的挑選標準是「哪種最好讀、最好改」,因為 prompt 會在多輪修改中反覆被你回來調整。

官方自己的範例就是標準示範。街頭服飾品牌 Thread 的廣告案例裡,prompt 要求把標語 Yours to Create. 放進引號、指定置入版面、只渲染一次、清楚可讀,然後明說不要其他文字、不要浮水印、不要無關標誌。每一句都對應一項可檢查的畫面要求,這就是契約式寫法的樣貌。寫完之後自己讀一遍,抓不到驗收點的句子多半是裝飾。

如果你偏好結構化寫法,社群早已有人把提示詞拆成可填空的變數模板,例如把 GPT-Image 提示詞參數化的開源模板庫,方向與官方「分節加標籤」的建議一致;想看大量成句範例互相印證,Nano Banana 提示詞圖庫這類整理也讀得出同一套邏輯。

八個要領照動筆順序讀:從成品定義到一輪只改一件事

官方把要領列成八條,這裡按你實際寫一張圖的順序重排,每一條都附上它防的那個坑。

OpenAI 開發者文件 Image prompting 指南的 Prompting fundamentals 段落,列出定義成品、選擇好維護格式、描述可見細節等八個提示詞要領Pin
官方指南的八個提示詞要領原文,每一條附帶它防的坑(圖片來源:developers.openai.com)

先定義成品與用途。同一個主體,菜單照片、品牌廣告與教學資訊圖的構圖完全不同,模型需要知道它在做哪一種。複雜的請求可以直接把 prompt 分節:場景、主體、細節、限制,各自貼上標籤。官方的科學圖表案例甚至要求把必要的分子名稱逐項列出,把 prompt 寫成一份教學簡報的規格。

用看得見的細節取代抽象形容詞。「高級」「電影感」這類詞每個人的想像都不同,官方建議換成材質、光線、色彩與媒介的具體描述;想要擬真照片就直接寫 photorealistic,不要讓模型猜。相機規格可以當風格線索,但官方明言那不是實體光學的保證;廣角、低光、雨夜、霓虹這類場景,把規模、氣氛與色彩寫出來,比堆氛圍詞有效。

人物要寫動作、視線與入鏡範圍。只寫「一個人在騎腳踏車」,模型還要自己猜是否全身入鏡、看向哪裡、手怎麼握。官方例句的密度是這樣的:「全身入鏡,包含雙腳」「低頭看向攤開的書」「雙手自然握住車把」。服裝型錄與教學動作示範尤其吃這條。

文字是契約,不是裝飾。需要出現的字放進引號,交代位置與字體感,限定出現次數,然後明說不要其他文字。罕見字或品牌名可以逐字拼出;小字或密集文字的案例,官方建議用 medium 與 high 兩個品質等級各跑一次再比較。

編輯時把「要改什麼」與「不能改什麼」分開列。這是指南裡分量最重的一條。寫法是「只改 X」,然後列出必須保留的細節:身分、輪廓幾何、版面、光線、標籤;再列出排除項:浮水印、標誌、多餘文字。做局部編輯時,官方要求連周圍的飽和度、對比、箭頭、相機角度與旁邊的物件都要點名不能動。

多張參考圖先發角色。把每張輸入圖編號並說明用途:哪張是主體、哪張供風格、哪張只參考服裝、哪張當背景,再交代元素怎麼組合、哪些搬到哪裡。沒有角色的參考圖,很容易被拌成一張無法控制的拼貼。

一輪只改一件事,關鍵限制每輪重述。把上一輪的輸出當成下一輪的輸入,一次只動一個主要條件,你才看得出哪個指令有效、失敗時能退回哪一步。「其他跟剛剛一樣」不夠保險,人物五官、商品形狀、構圖與光線這些底線,官方要求在後續每一輪重新講一次。指南的跨輪修改案例就是活示範:先做一張夕陽高速公路的看板,下一輪只補一句「換成下雪的冬夜」,其餘全部不動。

產出先過官方四題驗收,再談好不好看

指南把「檢查結果」列為完整工作流程的一部分,驗收題固定四問:指定文字是否正確可讀,圖表的標籤與關係是否成立;人物身分、商品形狀、標籤與參考細節是否還在;編輯是否只動了被指定的部分;若需要透明,檔案是否真的含 alpha 色版,而不是畫上去的背景。官方對透明度的要求相當細:檢查解碼後的 alpha,重點看頭髮、玻璃、陰影與物件邊緣,並且直說「畫出來的棋盤格不是透明」。

品質等級也有紀律。xhigh 與 max 兩檔官方只建議在延遲預算內、有明確未滿足的品質需求時使用,更高的設定不保證每張圖都更好。先選模型再調品質,初次比較時把品質、prompt、參考圖與尺寸全部固定,否則你量到的差異不知道來自哪個變數。

四種翻車現場,官方文件都有對應解法

症狀一:只說把白色椅子換成原木椅,結果光線、陰影、旁邊的擺設全重畫了。原因是保留清單沒列全。對策是把「不能動」寫得跟「要改」一樣具體:相機角度、房間光線、地板陰影、桌面物品、背景,逐項點名。官方的換傢俱範例就是這個句型。若某個區域必須與原圖像素完全一致,官方明言把修改後的區塊合成回原始圖片;品牌標誌、法規文字與已定案的人物照,多半就屬於必須像素一致的那一類。

症狀二:標語旁邊多出一行小字,或品牌名拼錯。引號、出現次數與排除清單三件事補齊:原文加引號、指定只出現一次、明說不加其他文字或標誌;罕見字逐字拼出。產出後仍要逐字校對,模型文字能力進步不等於免校對。

症狀三:說好的透明背景,放進簡報還是帶白底。在 prompt 裡描述去背之外,API 端要明確設定背景為 transparent 並輸出 PNG 或 WebP,PNG 不使用壓縮參數;匯入後檢查 alpha 色版是否真的存在。後續編輯也要重述透明需求,否則模型可能把背景補回來。

症狀四:改了好幾輪,人物的臉跟起手那版對不上。這是多輪編輯的漂移,官方的對策就是前一節那條:一輪只改一件事、關鍵限制每輪重述、把上一輪輸出當作下一輪輸入。這條紀律同時是你的還原機制,因為每一次只動一個變數,失敗時你永遠知道退回哪一步。官方給開發者的遷移建議也是同一套思維:新模型逐步上線,舊模型在支援期間保留,當退路。

API 開發者的順序:先過品質,再談延遲

指南對兩個新模型的定位寫得很直白:Flare 是速度取向的小模型,品質與 GPT Image 2 相當;Sunburst 是品質取向的基礎模型,品質高於 GPT Image 2。兩份官方文件的措辭差了一級:發布部落格對 Flare 的寫法是「品質高於 GPT-Image-2,延遲低 50%」,指南頁卻寫「與 GPT Image 2 相當」。兩份都是官方文件,指南的態度明顯保守,也因此給了對應紀律:在自己的工作負載上量測,一個工作負載的改善不能類推到另一個;同名品質標籤跨模型不等值,先選模型再調品質。

遷移流程指南給了六步,濃縮起來是:先存基準,把生產環境的代表 prompt、參考圖與難例(困難編輯、精確文字、臉孔、商品幾何、透明素材)連同結果一起留檔;gpt-image-2 已經達標的工作流先測 Flare 求延遲,複雜案例不夠用的先測 Sunburst 過品質;檢查完整結果,包括重複請求測一致性、編輯流程整串跑而不是只測單步;品質過了再回頭用相同 prompt 測 Flare,兩者都過才換;一次只調一個設定,先比品質等級再改 prompt,量的是典型與緩慢回應、失敗、重試與每張合格成品的成本;最後小流量上線,同時監看同樣的指標。

錢的事反而單純。定價頁上 Flare 與 Sunburst 逐格相同,也都與 gpt-image-2 一致:圖片輸入每百萬 token 8 美元、快取輸入 2 美元、輸出 30 美元,文字輸入 5 美元、快取 1.25 美元。指南仍提醒別假設快的模型一定便宜,計費前自己核對現價。

OpenAI API 定價頁圖片模型標準價表,gpt-image-2.5-sunburst 與 gpt-image-2.5-flare 的 Image 與 Text 價格逐格相同Pin
定價頁標準價:兩個 2.5 模型的輸入輸出價格完全一致(圖片來源:developers.openai.com)
模型圖片輸入(每百萬 token)圖片輸出(每百萬 token)備註
gpt-image-2.5-flare8 美元(快取 2 美元)30 美元速度取向,指南定位品質與 gpt-image-2 相當
gpt-image-2.5-sunburst8 美元(快取 2 美元)30 美元品質取向,生成時間較長
gpt-image-28 美元(快取 2 美元)30 美元現行替代建議指向它
gpt-image-1.58 美元(快取 2 美元)32 美元2026-12-01 退場,輸出反而貴 2 美元

尺寸規則順帶筆記:品質有 auto、low、medium、high、xhigh、max 六檔;客製解析度每邊不超過 3,840 像素、邊長為 16 的倍數、長寬比不超過 3:1,總像素落在 655,360 到 8,294,400 之間,超過 3,686,400 像素的輸出官方標註為實驗性。

舊模型的死線,已經寫進退場公告

提示詞指南同頁的參照段,把舊模型的退場日期與參數差異一併整理,對照官方退場公告頁,兩批時間表都很明確。gpt-image-1 排在 2026 年 10 月 23 日,那是 4 月 22 日針對一批舊模型快照的清理公告,同批還有 gpt-3.5-turbo、gpt-4、o1 等熟悉的名字;gpt-image-1.5、gpt-image-1-mini 與 chatgpt-image-latest 則排在 12 月 1 日,出自 6 月 2 日專門針對 GPT Image 模型的公告。四個識別碼的建議替代都是 gpt-image-2,退場頁目前還沒把指向往上改成 2.5。

OpenAI 退場公告頁 2026 年 6 月 2 日的 GPT Image 模型清理段,gpt-image-1-mini、gpt-image-1.5、chatgpt-image-latest 均於 2026 年 12 月 1 日關閉,建議替代為 gpt-image-2Pin
官方退場公告:三個舊圖片模型的關閉日期與替代建議(圖片來源:developers.openai.com)
模型關閉日期公告日期建議替代
gpt-image-12026-10-232026-04-22gpt-image-2
gpt-image-1.52026-12-012026-06-02gpt-image-2
gpt-image-1-mini2026-12-012026-06-02gpt-image-2
chatgpt-image-latest2026-12-012026-06-02gpt-image-2

還在 gpt-image-1.5 上的工作流,經濟面也站不住:它的圖片輸出每百萬 token 要 32 美元,比 2.5 的兩個模型貴 2 美元,等於多付錢等退場。這類公告頁會滾動更新,10 月中之前值得再回來核對一次日期有沒有變動。

拿一張舊圖,把契約補上再跑一次

在 ChatGPT 生圖的讀者,最划算的練習是挑一張以前改壞過的圖:先寫「只改 X」,再把保留清單一條條列全,文字需求加上引號與出現次數,跑完對照官方四題驗收。走 API 的開發者,遷移就從存基準那一步開始,難例一定要放進去,因為平均表現掩蓋的問題都藏在難例裡。

兩個前提別忘記:延遲比 Images 2.0 最多快 50% 是官方宣稱的相對上限,實際依圖而異;這份指南放在 API 文件站,寫法本身是 prompt 的通則,對話端一樣適用,但留言式修改、@Sketch 與模板這些介面操作是另一套功能,細節可以回看發布當天的整理。把契約寫清楚之後,剩下的變數才真的交給模型。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1258

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...