OpenAI 剛推出了 ChatGPT Images 2.0。 如果你一直在等待 AI 圖像生成能真正發揮作用,而不用與提示詞搏鬥、一遍又一遍地調整設定,或是為了得到正確的結果而重新生成同一張圖片十次,這就是你一直在等待的更新。
因此,我們測試了 Images 2.0,將它與較舊的 GPT Image 版本和 Nano Banana 2 進行比較,並將你需要的所有資訊整合在一起,包括實際改變了什麼、仍有哪些不足之處,以及獲得更好結果的提示詞技巧。

第一部分:什麼是 ChatGPT Image 2.0?
OpenAI 剛剛對其 ChatGPT 內部的圖像生成系統進行了重大升級,現在稱為 ChatGPT Images 2.0。其核心運行在一個名為 gpt-image-2 的新模型上,這也是開發人員透過 API 存取的模型(稍後會詳細說明)。
Images 2.0 是 OpenAI 第一個具有 內建思考能力, 近乎完美的文字呈現,以及 重建架構 的圖像模型。實際上,它旨在減少通常的來回修改。你花費更少時間重寫提示詞或重新生成輸出,而將更多時間用於從最初幾次嘗試中實際獲得可用的視覺效果。
GPT Image 2.0 的新功能
gpt-image-2 的發布日期為 2026 年 4 月 21 日。同日向全球 ChatGPT 和 Codex 用戶推出。它帶來的一些更新包括:
1. 首個具有思考能力的圖像模型
gpt-image-2 是 OpenAI 第一個可以在生成過程中 搜尋網路 並透過「思考」模式 自我驗證輸出 的圖像模型。它還可以從單個提示詞生成多達 8 張圖像,並在所有圖像中保持角色和物件的一致性。

2. 更好的文字呈現
LM Arena 早期測試者 報告稱具有 99% 的字元級準確度。文字融入場景中,而不是浮在上面。即使在密集的構圖中,標籤、選單和介面元素等也能保持更好的效果,而不會破損或變成亂碼。這項改進還涵蓋非拉丁字元,如日文、中文、韓文、印地文和孟加拉文。

3. 精緻風格與逼真寫實
Images 2.0 處理 更廣泛的視覺風格,並具有更好的一致性。逼真的輸出現在更接近真實照片,改進包括:
- 困擾 GPT Image 1.5 的暖色調基本消失了
- 物理、光線和材質屬性的建模更加準確
- 手部看起來自然,手指比例和關節角度更好

4. 更快的處理速度與靈活的比例
新的 gpt-image-2 運行速度比以前的模型更快。長寬比範圍從 3:1 到 1:3,因此輸出適合寬橫幅、簡報投影片、海報、行動裝置螢幕和社群圖形,無需裁剪或調整大小。

5. 真實世界智慧
Images 2.0 為圖像創作帶來了 更即時的世界理解,知識截止日期為 2025 年 12 月。它已經了解最近的事件、產品和文化背景,無需你進行解釋。

第二部分:gpt-image-1 vs gpt-image-1.5 vs gpt-image-2.0
理解升級最簡單的方法是並排比較三代 ChatGPT Images 2.0。為了公平起見,我們將在所有三個模型中使用相同的提示詞,以便你能輕鬆判斷差異。

GPT Image 1.0 vs 1.5 vs 2.0 比較
| GPT Image 1.0 | GPT Image 1.5 | GPT Image 2.0 | |
| 推出時間 | 2025 年 4 月 | 2025 年 12 月 | 2026 年 4 月 |
| 文字呈現 | 通常較弱,尤其是較長的文字 | 更好,但在密集版面中仍不一致 | 重大改進,特別是標誌、海報、標籤和 UI 風格圖像 |
| 提示詞準確度 | 忽略複雜細節 | 遵循約 70% | 近乎完美的遵循 |
| 寫實度 | 穩定,但有時顯得人工 | 更精緻和自然 | 超寫實/電影感 |
| 速度 | 基準 | 比 1.0 快 4 倍(估計) | 比 1.5 快 2 倍(估計) |
| 解析度 | 最高 1536x1024 | 最高 1536x1024 | 最高 2560x1440 (2K) |
API 成本概覽
| 模型 | 品質 | 1024 × 1024 | 1024 x 1536 | 1536 × 1024 |
| GPT Image 2 | 高 | $0.211 | $0.165 | $0.165 |
| GPT Image 1.5 | 高 | $0.133 | $0.2 | $0.2 |
| GPT Image 1 | 中等 | $0.167 | $0.25 | $0.25 |
注意: 實際成本還可能包括編輯或使用參考圖像時的文字輸入 token 和圖像輸入 token。有關所列成本的更多詳細資訊,請查看 OpenAI 的 API 圖像生成指南.
第三部分:如何存取和使用 ChatGPT Image 2.0
當你在 ChatGPT 中生成圖像時,你會自動使用最新的 ChatGPT Images 2.0 模型。它適用於所有方案,包括免費用戶。但是,具有「思考」功能的進階輸出僅適用於 ChatGPT Plus, Pro 和 Business 用戶。
請查看下表以了解每個方案的定價差異。
| Plus | Pro | Business | |
| 定價(每月) | $20 | $100 | $25/使用者 |
逐步教學:如何在 ChatGPT 中使用 GPT Image 2



GPT Image 2 的最佳使用案例
ChatGPT Images 2.0 在圖像需要兼具創意和結構時最為強大。它不僅僅是用來製作漂亮的圖像,而是在您需要透過視覺進行溝通時更加實用。

ChatGPT Images 2.0 的最佳使用案例包括:
- UI/UX 模型: 設計包含可讀按鈕的完整應用程式畫面。
- 行銷視覺素材: 建立可直接印刷的廣告、海報和橫幅。
- 圖表與教育: 產生真正有意義的數學證明或流程圖。
- 產品圖像: 您可以建立產品風格的視覺素材、包裝概念、促銷模型和生活風格照片。
- 插圖: 為遊戲或書籍製作具有一致角色的概念藝術。
開發者與企業:在 API 中使用 gpt-image-2
開發者和企業可以透過 gpt-image-2,也就是 API 文件 中的正式名稱,將這些相同功能整合到他們正在開發的產品中。透過使用 API,您可以獲得我們一直讚不絕口的精確文字準確度和風格深度,同時擁有專業開發環境的靈活性。

gpt-image-2 API 定價
gpt-image-2 的定價並非單純的「每張圖像」固定費用。多個因素決定您需要的代幣數量。但一般來說:
- 較低品質 + 較小尺寸 = 更便宜且更快速。
- 較高品質 + 較大解析度 = 更昂貴但更詳細。
| 比例 | 品質 | 代幣 | 價格 |
| 正方形(1024×1024) | 低 | 272 代幣 | $0.006 |
| 正方形(1024×1024) | 中 | 1,056 代幣 | $0.053 |
| 正方形(1024×1024) | 高 | 4,160 代幣 | $0.211 |
| 直向(1024×1536) | 低 | 408 代幣 | $0.005 |
| 直向(1024×1536) | 中 | 1,584 代幣 | $0.041 |
| 直向(1024×1536) | 高 | 6,240 代幣 | $0.165 |
| 橫向(1536×1024) | 低 | 400 代幣 | $0.005 |
| 橫向(1536×1024) | 中 | 1,568 代幣 | $0.041 |
| 橫向(1536×1024) | 高 | 6,208 代幣 | $0.165 |
第 4 部分:圖像品質測試:gpt-image-2 vs Nano Banana 2
GPT Image 2 目前最接近的競爭對手是 Nano Banana 2,Google 目前的圖像生成旗艦產品。在推出後,GPT Image 2 立即躍升至 LM Arena 排行榜 第一名,領先 Nano Banana 2 達 236 分。
GPT-Image 2.0 vs Nano Banana 2
| GPT Image 2.0 | Nano Banana 2 | |
| LM Arena 分數 | 1,507(初步) | 1,271 |
| 多圖像一致性 | 每個提示詞最多 8 張圖像 | 最多 5 個角色、14 個物件 |
| 免費使用 | 每天 2-3 張圖像 | 每天最多 20 次免費圖像生成 |
| API 輸入價格(每 100 萬代幣) | $8 | $0.50 |
| API 輸出價格(每 100 萬代幣) | $30 | $3(文字和思考)/ $60(圖像) |
為了實際比較它們的表現,我們在相同的提示詞下執行兩個模型。請查看以下結果。
1. 關於瀕危動物的資訊圖表
GPT Images 2.0:

Nano Banana 2:

2. 寫實照片

3. 動畫角色

4. 多語言海報

結論:GPT-Image 2 vs Nano Banana 2
- ChatGPT Image 2.0 處理多語言文字更加可靠,準確度明顯優於 Nano Banana 2。
- ChatGPT Image 2.0 在標籤和資料準確性方面仍可能出錯,特別是資訊圖表和技術圖表,而 Nano Banana 2 在這些情況下能產生更可靠的結果。
- GPT Image 2 預設色彩更加鮮豔和強烈;Nano Banana 2 傾向更柔和、自然的色調。
- 角色生成的臉孔和人物在仔細檢視下仍看起來像 AI 生成的。兩個模型都尚未完全解決這個問題。
快速提示: 如果您想在生成圖像時擁有更完整的工作流程,請嘗試在 Filmora 內使用 GPT Image 2。您可以生成視覺素材,然後立即在時間軸上進行精修、添加動態效果,並在同一平台內將其轉換為影片內容。
第五部分:ChatGPT Images 2.0 的優缺點
從我們介紹的內容來看,GPT Image 2.0 有許多優點,但尚未完美。
- 能很好地遵循複雜的多部分提示,且不會遺漏細節
- 圖像內的文字在拉丁文字和非拉丁文字中都清晰可讀
- 思考模式可從單一提示生成最多 8 張一致的圖像,並保持物件和角色的連續性
- 對於需要完整物理世界模型的任務仍有困難(摺紙指南、拼圖等)
- 技術圖表中的箭頭和零件標籤可能仍需手動檢查準確性
- 思考模式每次生成可能需要最多 2 分鐘
- 對於非常密集或重複的視覺細節(如細沙粒、織物紋理或緊密排列的質地)不夠可靠
- 資訊仍可能有誤;發布前請務必驗證事實、資料和標籤
第六部分:GPT-Image 2.0 圖像生成的提示技巧
雖然 gpt-image-2 並不完美,但有幾種方法可以改善您的結果。最大的訣竅是停止將 gpt-image-2 提示當作隨機想法,而是將它們當作創意簡報。
1. 對文字要具體明確
將任何文字內容放在引號或全大寫中,並描述其位置。
- ✖️加入標題。
- ✅ 標題文字為「LAUNCH DAY」,使用粗體壓縮無襯線字體,位於左上方,深色背景上的白色文字。
對於不常見的單字或品牌名稱,請逐字母拼寫。對於任何帶有小型或密集文字的內容,請使用中等或高品質。
2. 描述拍攝方式,而非僅描述主題
此模型對攝影風格的指示反應良好。包括光線(「柔和的北向窗光」)、表面(「霧面混凝土」)、相機感覺(「35mm 底片顆粒」)和構圖(「主體位於下三分之一處,上方留白」)。場景設定越具體,模型自行填補的部分就越少。
3. 使用限制條件來排除不需要的元素
在提示結尾加上限制條件行:無浮水印、無額外文字、無背景雜物、保留版面配置、中性色彩呈現。使用這類負面提示可以避免重複生成圖像太多次。
額外提示:將 GPT Image 2.0 結果轉換為吸引人的影片內容
使用 GPT Image 2.0 生成圖像後,僅停留在靜態視覺效果實在是浪費價值。將它們匯入 Wondershare Filmora,您可以在幾分鐘內將創作轉換為短影片。
要將您的 ChatGPT Images 2.0 結果轉換為如上例的影片,請使用 Filmora 的 圖像轉影片 功能,位於 素材庫 > AI 媒體 下。選擇您的模型、設定長寬比、時長和解析度,您就能直接在編輯時間軸上讓圖像動起來。

Filmora 的圖像轉影片功能由先進的模型驅動,例如 Veo 3.1, Seedance 2.0、 並透過「思考」模式 ToMoviee,因此輸出品質無需您進行額外的編輯工作即可維持。使用 Filmora,您可以:
- 將靜態圖像轉換為帶有轉場、動態和音樂的短影片
- 新增動畫字幕和文字覆蓋層
- 將多個 GPT Image 2.0 輸出組合成一個連貫的視覺故事
- 以垂直、方形或橫向格式匯出,適用於任何平台
如果您已經使用 GPT Image 2.0 生成行銷視覺素材、產品照片或插圖內容,Filmora 是快速充分利用所製作圖像的方法。
結論
ChatGPT 推出全新的 gpt-images-2 模型作為「視覺思考夥伴」。它修復了大多數讓 AI 圖像生成感覺像是需要太多次重新生成才能得到可用結果的來回過程問題。
最大的升級是 更好的文字呈現與多語言支援、 透過思考模式進行網路搜尋 和 多圖像一致性。但它在技術圖表和資料密集的視覺效果方面仍有困難。如果您想充分利用所生成的內容,將圖像匯入像 Filmora 這樣的影片編輯器是一種低成本的方式,可將輸出轉換為吸引人的影片內容。
常見問題
-
1. ChatGPT Images 2.0 可以用於商業專案嗎?
可以。透過 ChatGPT 生成的圖像可用於商業用途,包括行銷素材、產品視覺效果和品牌內容。但在發布前,請務必查看 OpenAI 的最新使用政策,因為條款可能會變更。 -
2. ChatGPT Images 2.0 可以生成一致的角色或風格嗎?
啟用思考模式後,gpt-image-2 可以從單一提示生成最多 8 張圖像,同時在所有圖像中保持角色和物件的一致性。 -
3. 在 ChatGPT Images 2.0 中生成圖像後可以編輯嗎?
要修改圖像的特定部分,您可以在描述框中輸入後續指示。請注意,這是指基於提示的編輯,而非手動像素級調整。使用 API 的開發人員也可以存取專用的圖像編輯端點。 -
4. ChatGPT Images 2.0 可以免費使用嗎?
免費使用者可以使用基本的圖像生成功能,但次數有限。思考模式可解鎖網路搜尋和多圖像生成功能,僅限 Plus、Pro 和 Business 方案,每月從 $20 起。 -
5. 我可以在 ChatGPT 中恢復使用舊版 Images 模型嗎?
可能無法透過主介面使用。在 ChatGPT 中生成圖像時會自動套用最新的 GPT Image 模型,且 OpenAI 通常會從使用者介面中逐步淘汰舊版本。開發人員可能仍可透過 API 存取先前的模型。


