
ChatGPT、Gemini、Midjourney 生圖模型完整比較
比較 ChatGPT Images 2.5、Gemini Nano Banana 2 與 Midjourney V8.2 三大生圖模型:整理三家模型現況與演進時間軸、文字入圖與精確編輯能力、參考圖數量與輸出解析度、免費額度與 API 計價、電商商品圖五步工作流與商用授權差異,附四軸選擇框架,協助你依工作流程挑對生圖工具。
- AI 生圖比較
- ChatGPT 生圖
- Gemini 生圖
- Nano Banana 2
- Midjourney V8.2
- 生圖模型比較
- AI 生圖模型
- ChatGPT Images 2.5
- Nano Banana Pro
- Midjourney 價格
- AI 商品圖
- 生圖 商用授權
- 圖像生成 API
- GPT-Image-2.5
- AI 繪圖比較
約 30 分鐘閱讀作者:Whoops 編輯團隊
想用 AI 生成圖片,2026 年要面對的名字比往年都多:ChatGPT 的 Images 2.5、Google 的 Nano Banana 2、Midjourney 的 V8.2。三家走的路線明顯不同:ChatGPT 把生圖放進對話助理,主打精確編輯與多輪修改。Gemini 用一整個模型家族分工,免費帳號就能在 App 裡生圖,API 端依速度與品質分級計價。Midjourney 則是純訂閱制的獨立工具,把籌碼押在美學表現與個人化品味上。要比較的不只是誰畫得好看,還有入口形態、免費額度、價格結構與商用授權,這些差異會直接影響日常工作流程。
依三家官方文件與產品公告整理,截至 2026 年 9 月的現況是:OpenAI 的 ChatGPT Images 2.5 在 9 月 8 日上線,官方宣稱生成延遲比 Images 2.0 最多降低 50%,編輯時更擅長只改你要求的部分。Google 的 Nano Banana 2 就是 Gemini 3.1 Flash Image,2 月 26 日發布,把前一代 Pro 級的世界知識與文字渲染帶到 Flash 級速度。Midjourney 的 V8.2 在 7 月 24 日成為預設版本,更新重點擺在美學、畫質與個人化。價格帶差異同樣明顯:兩家助理的免費層都能生圖,Midjourney 沒有免費方案、從每月 10 美元起跳,Gemini 端的官方每張約當價依模型與解析度,落在約 0.0336 美元到 0.24 美元之間,OpenAI 的 2.5 世代則改以 token 計價。
接下來依模型現況、演進時間軸、能力比較、價格方案、商品圖應用與授權須知逐層拆開,收尾給一組四軸判斷框架,讓你可以對著自己的工作流程做選擇。想先擴充背景的讀者,站上先前的AI 網頁設計指南與用 Midjourney 做設計稿的實作案例,分別談過 AI 圖像在網站專案裡的角色,那份脈絡加上各家的生圖工具介紹,正好補齊這次比較的地基。
資料口徑先說清楚:模型名稱、價格、規格與能力描述,都取自三家的官方說明中心、開發者文件與產品公告,抓取時點為 2026 年 9 月 17 日。生圖模型市場的更新速度極快,官方文件也可能隨時改版,任何要付錢或寫進採購單的決定,都值得再花三分鐘回到官方頁核對當日數字,把第三方比較當地圖而非終點。
快速重點整理
- 產品形態:ChatGPT Images 內建在助理(所有方案層級可用),Gemini 以 Nano Banana 家族分工(App 免費可生圖、API 四個模型),Midjourney 是訂閱制獨立工具(四方案、無免費層)。
- 現役模型:OpenAI Images 2.5(API 端 Flare/Sunburst)、Google Nano Banana 2 與 Nano Banana Pro、Midjourney V8.2。
- 價格帶:ChatGPT 免費起(Go 8 美元、Plus 20 美元、Pro 100 美元起),Gemini 免費起(AI Plus 4.99 美元、AI Pro 19.99 美元、Ultra 99.99 美元起),Midjourney 月繳 10 至 120 美元、年繳約 8 折。
- API 每張約當成本:Gemini 端從 Lite 1K 的 0.0336 美元到 Nano Banana Pro 4K 的 0.24 美元(第二代主力 0.045 至 0.151 美元)。OpenAI 端 GPT Image 1.5 中品質 1024x1024 約 0.034 美元,2.5 世代改以 token 計價。
- 商用授權:落地商用前要回頭讀各家條款原文。Midjourney 明文年營收超過 100 萬美元的企業須訂 Pro 或 Mega 才擁有素材;OpenAI 明示不對 API 生成內容主張著作權;Google 的生成圖全部內建 SynthID 浮水印。這些敘述都不等同完整商用授權。
三家現況:2026 年 9 月的第一線模型
ChatGPT Images 2.5:生圖住進對話助理裡
OpenAI 在 2026 年 9 月 8 日的產品公告裡,把 ChatGPT Images 2.5 定位為新的旗艦生圖模型:細節更銳利、編輯更精確、生成更快,光線更自然、材質更豐富,也更擅長保留參考照片裡的主體。官方並宣稱生成延遲比 Images 2.0 最多減少 50%。落地範圍一次給滿:所有方案層級的 ChatGPT、ChatGPT Work 與 Codex 使用者,在桌面、行動與網頁端都能用,等於免費帳號也保有生圖能力,差別在額度與速度。
產品面同步加了幾個降低門檻的功能。Sketch 讓你直接在 ChatGPT 裡畫草圖當視覺引導,手機 App 上打 @Sketch 就能把手繪輪廓變成成品。模板功能把海報、Logo 這類格式做成起點,不必從空白畫布開始。編輯時可以在圖上直接留言指定要改的區域,也能把用過的提示詞連同圖像一起分享出去。生成期間不必乾等,ChatGPT 可以繼續用,複雜請求丟出去後回來收圖即可。依官方說明中心的條列,圖像生成可以在任何長寬比輸出,複雜請求可能需要數分鐘,付費方案的 Images with thinking 則開放給 Plus、Pro 與 Business。
第三方使用者的回饋可以補官方視角的不足。圖像工具 Higgsfield 的產品負責人說,最讓他們印象深刻的是 API 端的 Flare 模型「懂什麼不該改」。AI 工作平台 Manus 的評估團隊實測後的結論是,Flare 以 GPT-Image-2 的二到四倍速度產出高品質圖像,改良的透明背景生成也讓品牌素材到網站素材的應用更順。這類引述自然帶有立場,但方向與官方宣稱一致,可以當交叉驗證。
開發者端則是兩個新模型接棒:GPT-Image-2.5 Flare 與 GPT-Image-2.5 Sunburst,快照日期都是 2026 年 9 月 8 日。官方對 Flare 的描述是「快速、高品質的日常圖像生成」,也是多數應用的預設選擇,品質高於 GPT-Image-2 之餘延遲再低 50%。Sunburst 的定位是「最強的圖像生成與編輯模型」,給編輯精確度優先的工作流使用,官方點名的適用情境包含可上線的廣告創意與精修商品圖。兩個模型都支援 low 到 max 共六段品質設定與透明背景輸出,尺寸規則是 16 的倍數、長寬比介於 1:3 至 3:1、單邊最長 3840 像素。
Gemini 與 Nano Banana 家族:一個名字、四個模型
Google 這邊的產品名容易讓人混淆,拆開看其實很清楚:Nano Banana 是 Gemini 原生圖像生成能力的品牌名,在 Gemini API 官方文件裡對應四個模型。Nano Banana 2 Lite 追求最快最便宜,給速度與成本優先的場景。Nano Banana 2(Gemini 3.1 Flash Image)是全能主力,平衡速度、4K 生成、世界知識與可靠文字渲染。Nano Banana Pro(Gemini 3 Pro Image)是複雜視覺任務的高階選擇,強調最高世界知識、進階在地化與精準品牌一致性。初代 Nano Banana 屬舊世代,官方建議轉移到 2 Lite。這套分級讓開發者可以依工作量挑模型。
世界知識是 Gemini 這條線的主打能力。官方部落格說明,模型具備世界知識,還能由網路搜尋的即時資訊輔助,把資訊圖表、筆記轉圖解與資料視覺化這類「內容要正確」的圖像做好。App 端的支援頁另提供個人化頭像功能,錄下你的臉與聲音建立虛擬分身(官方載明僅限美國境內年滿 18 歲的使用者),之後生成自己的各種場景圖不必每次上傳照片。這兩個能力把生圖從視覺想像擴到知識表達,是其餘兩家比較少著墨的方向。
消費端的入口在 Gemini App。依Google 支援頁,用 Nano Banana 2 生圖不需要付費方案,功能表對「無 AI 方案」欄位是打勾的,差別在下載解析度:有 AI 方案可到 2K,沒有則是 1K。2026 年 2 月 26 日的官方部落格公告說明,Nano Banana 2 在 App 內取代了 Nano Banana Pro 的位置,AI Pro 與 Ultra 訂閱者仍可從三點選單用 Pro 模型重新生成圖像,做需要更高細節的工作。Nano Banana 2 的另一個差異化能力是接地:生成時可以動用 Google 搜尋查證事實,用即時資料與網路圖像更準確地渲染特定主體,3.1 Flash Image 這代還把圖片搜尋接地加了進來。入口佈署也鋪得廣:除了 Gemini App,搜尋的 AI Mode 與 Lens、影片工具 Flow、Google Ads 的廣告建議都用上同一個模型,Flow 端更開放所有使用者免點數使用。同一套能力橫跨這麼多入口,對素材工作流的意義是「學一次到處用」。

App 端 Nano Banana 2 的能力清單,官方支援頁列了六項:改進的世界知識、跨生成圖維持人物或角色外觀的角色一致性、針對局部下手的快速編輯、所有支援語言都更準確的文字拼寫、更強的指令遵循,以及高解析度預覽。這份清單跟 API 端的模型敘述互相印證,也點出 Lite 版的取捨:它追求最快最便宜,官方明說沒有針對多參考輸入與多輪連續編輯優化,要批次做變體或深度改圖,就往上選 Flash 或 Pro 級模型。
模型的背景脈絡與 Gemini 3 世代的整體定位,可以對照站上的Gemini 3 完整指南,那篇把文字模型的演進與方案結構講得更完整,生圖端的模型分級正是同一套節奏的延伸,讀完再回頭看 Nano Banana 家族會更順。
Midjourney V8.2:訂閱制美學工具的當家版本
Midjourney 的節奏不同於兩家助理:官方版本說明載明,目前預設版本是 V8.2,2026 年 7 月 24 日上線,更新聚焦美學、畫質與個人化。同年 4 月 14 日發布的 V8.1 曾是 6 月到 7 月的預設版,官方稱它是迄今最快的模型,標準工作渲染約快 4 到 5 倍,並首次加入免放大的 2K HD 輸出。V8.2 同場帶來新的 Edit Model,取代過去的 Omni Reference、Character Reference 與 Retexture 工具,把「用文字描述來改圖」與「用參考圖生成」收進同一套機制。
入口形態上,Midjourney 同時保有網頁版與 Discord 兩條路:網頁端的 Imagine Bar 可以上傳最多四張圖當參考,Editor 支援局部重繪與擴展畫布,Discord 端則用 --edit 參數達到相同效果。風格控制是它的傳統強項,Edit Model 可搭配風格參考、心情板與個人化設定使用。官方公告對 V8.2 的形容是更有創意、更大膽、更精緻也更新鮮,並宣稱低品質輸出的隨機情況大幅減少,喜歡先看再買的人,可以從官方更新公告的範例圖初步判斷這個版本合不合口味。

演進時間軸:三條路線怎麼走到今天
把三家近一年的節奏排在一起,可以看出各自的重心。OpenAI 這條線走的是「模型代際推進」:2025 年 12 月 16 日推出 ChatGPT Images 的新版本,API 名為 GPT Image 1.5,當時的賣點是精確編輯、保留細節,生成速度最快提升 4 倍,且在 ChatGPT 對所有使用者推出。2026 年 4 月 21 日發布 Images 2.0。9 月 8 日再推 Images 2.5,把延遲再壓低最多 50%。不到一年三次換代,選擇 API 串接的團隊要有跟著遷移的心理準備。
Google 的時間軸則是「品牌迭起」:2025 年 8 月初代 Nano Banana 上線,11 月推出 Nano Banana Pro,把工作室等級的創意控制帶進來。2026 年 2 月 26 日的 Nano Banana 2 結合兩代所長,用 Flash 級速度提供 Pro 級的世界知識與推理,並同步進駐 Gemini App、搜尋的 AI Mode 與 Lens、Flow、Google Ads 等多個入口,其中搜尋端的圖像能力一口氣擴及 141 個新國家地區與 8 種新語言。
三條時間軸背後是三種產品哲學。OpenAI 用代際命名(1.5 到 2.5)對齊它的模型文化,每代都把「更快、更聽話」往前推,代價是使用者要持續適應行為差異。Google 用品牌暱稱快速建立記憶點,模型代號(3.1 Flash Image)與行銷名(Nano Banana 2)並行,同一套能力鋪進多個產品線。Midjourney 用傳統的版本號慢慢養,預設版更換的間隔以月計,換版日期與預設期程都載明在官方版本頁。對採購的啟示很簡單:依賴 API 的系統要留遷移緩衝,依賴視覺一致性的團隊要盯版本切換的公告。
Midjourney 的 2026 相對穩定:V8.0 在 3 月 17 日以早期存取 alpha 之姿上線、開放到 7 月 24 日,4 月 14 日 V8.1 發布並在 6 月 10 日成為預設,7 月 24 日 V8.2 接棒至今。這條節奏線的好處是每一步的日期都寫在官方版本頁,網頁版的個人化設定檔會隨你的評分累積而更懂你的品味,V8.2 又擴大了建立個人化設定檔的圖池。對長期依賴固定視覺風格的團隊來說,版本切換時把個人化輸出重新檢查一遍更穩當。
一張表看懂規格與價格對照
| 項目 | ChatGPT Images 2.5 | Gemini(Nano Banana 家族) | Midjourney V8.2 |
|---|---|---|---|
| 產品形態 | 助理內建生圖 | 助理內建+API 模型家族 | 獨立訂閱工具(網頁+Discord) |
| 免費可用 | 是(所有方案層級,額度受限) | 是(App 免 AI 方案可生圖,下載 1K) | 否(四方案皆訂閱制) |
| 消費端月費 | Go 8/Plus 20/Pro 100 美元起 | AI Plus 4.99/AI Pro 19.99/Ultra 99.99 美元起 | Basic 10/Standard 30/Pro 60/Mega 120 美元 |
| API 計價 | token 制(圖像輸出每百萬 30 美元) | token 制+每張約當價(0.0336 至 0.24 美元) | 未納入 API 計價比較(Fast/Relax GPU 時數制) |
| 參考圖數量 | 參考照片主體保留有改進,可用張數請查當日 API 文件 | 最多 14 張(物件槽 Lite 14/Flash 10/Pro 6,另計角色與風格槽) | Edit Model 最多 4 張 |
| 輸出解析度 | 常規至 3840 像素邊長(超過 2560x1440 屬實驗性) | 1K/2K/4K(Flash 加 512px、Lite 僅 1K) | SD 標準與 2K HD(HD 每張 1.3 分鐘 GPU) |
| 文字入圖 | 可遵循指令加文字(官方提醒精確擺放仍會掙扎) | 主打可讀文字與圖內翻譯在地化 | 以提示詞描述為主(V8.1 起細節遵循提升) |
| 浮水印/來源標記 | C2PA 中繼資料+隱形浮水印 | SynthID 浮水印(全部生成圖像) | 未納入比較 |
表列的規格細節會隨版本更新變動,決策前建議以各官方頁當日標示為準。表格之外,還有幾個「規格面看不到但會影響體感」的差異,接下來三節逐一展開。
能力比較一:文字入圖與版面控制
要在圖片裡放字,三家的可靠度差異很實際。OpenAI 在開發者文件裡誠實列出限制:文字渲染雖然明顯進步,精確的擺放與清晰度仍可能掙扎,結構化版面裡精確安排元素也偶有困難,複雜提示詞的生成時間最多可能到 2 分鐘。對應的做法是把要求寫明:官方提示詞指南建議把必要文案用引號標出、說明它該出現幾次,輸出後再檢查拼字與可讀性。
Google 把文字渲染當成 Nano Banana 2 的主打能力之一:官方公告直說它可以為行銷樣稿或賀卡生成準確可讀的文字,甚至能翻譯並在地化圖像內的文字。文件進一步說明它擅長資訊圖表、菜單、圖解與行銷素材的可讀風格化文字,App 端支援語言的拼字準確度也同步提升。對需要產出中文字卡、雙語海報或菜單的團隊,這是目前官方宣稱最直接的能力。
與文字相鄰的兩個設計場景也值得排進流程。Logo 製作上,官方指南有「設計可重用 Logo」的完整範例,重點是要求乾淨的向量感輪廓、在不同尺寸下都清楚的構圖,並以透明背景加 PNG 格式輸出,用 n 參數一次要多個變體。草圖轉擬真則是 Sketch 功能的延伸,把手繪輪廓拍照上傳或直接在 App 裡畫,再描述材質與風格,模型會把草圖升級成擬真成品,提案階段特別好用。

把文字能力放進真實工作流,差別會更清楚。做促銷圖時,Gemini 可以直接把文案與雙語標示生成在畫面上,翻譯在地化也包在同一個動作裡。ChatGPT 適合「圖先字後」的節奏,視覺定案後再要求把指定文案放進版面,並依官方指南用引號標出必要文案及指定出現次數。涉及法律或價格資訊的字(有效期限、售價、優惠條件),不論用哪一家,輸出後都要人工複核,文字渲染的進步不等於免查證。

Midjourney 對文字的立場相對保守,官方文件沒有把文字渲染列為賣點,描述重心放在提示詞遵循與細節保留:V8.1 起更會讀提示詞並守住小細節,開 Raw 模式可以移除預設風格化,拿到更貼近描述的結果。實務上要做海報文案或包裝文字,比較穩的做法是先用 Midjourney 產視覺底圖,再進設計軟體疊字,把字型與字級的控制權留在自己手上。
能力比較二:編輯精確度與多輪一致性
「只改我說的部分、其他不要動」是 2026 年生圖工具的分水嶺。ChatGPT Images 2.5 在這點上的官方描述相當具體:編輯時更擅長只改被要求修改的地方,其餘細節保持原樣,多輪對話裡先前的修改更容易保持一致,新一輪編輯建立在已完成的工作上,畫質不隨輪數劣化。官方還點出一個開發者場景:可以只更新單一元素,例如商品、背景或一段文案,同時保留周圍的主體、構圖與品牌處理,這正是電商反覆改圖最需要的性質。
操作面的細節也值得知道。ChatGPT 的編輯器提供選取工具,圈出想改的區域再下指令,也能不選取、直接用對話描述修改,官方同時提醒選取範圍不一定精確、編輯可能溢出到所選區外,對邊界要求高的修改要多檢查幾眼。所有生成過的圖會自動存進 Images 媒體庫,回頭找素材比翻對話紀錄省事。往上一代的賣點也能說明這條路線的累積:2025 年底的模型就把光線、構圖與人物外觀的一致性寫進編輯承諾,服裝與髮型試穿這類需要「像本人」的場景,正是它的設計目標之一。

Google 端的證據同樣明確。Nano Banana 2 的一項官方範例提示詞就是「把這張資訊圖翻成西班牙文,其他元素都不准變」,這種指定式修改是它的設計目標。App 端的功能列表也把局部編輯列為核心能力,強調快速修改圖像的特定部分。Nano Banana Pro 再往上加一層推理:官方模型頁說它是以推理驅動的專業級編輯引擎,適合需要精確控制的複雜修改。
Midjourney 的 V8.2 Edit Model 走結構化路線:上傳圖片後用文字描述修改,或用 Editor 做局部重繪與擴展畫布,兩者共用同一套編輯模型。要注意的是它與 Remix 功能目前不相容,適用版本限於 8.1 與 8.2。三家比較下來,精確編輯的官方承諾以 ChatGPT 與 Gemini 的敘述最直接,Midjourney 勝在編輯與風格系統的整合度,適合「以圖養圖」的迭代方式。
能力比較三:參考圖、主體一致性與輸出規格
參考圖數量是挑模型時容易被忽略的規格。Gemini 官方明列 Gemini 3 系圖像模型可混合最多 14 張參考圖,槽位分配則不同:Lite 全部給物件(14 張)、Flash 是物件 10 張+角色 4 張、Pro 是物件 6 張+角色 5 張+風格 3 張。官方部落格另說明 Nano Banana 2 能在單一工作流中維持最多五個角色的相似度與 14 個物件的保真度。這對品牌視覺的意義很直接:logo、包裝、代言人照片可以同時進場,讓模型在合成時守住各元素的原貌。

ChatGPT 的優勢在參考照片的主體保留:Images 2.5 更擅長從參考照片出發,把熟悉的主體轉換到新場景、風格與構圖,主體看起來更可辨識,光線材質更自然,特徵更容易延續。開發者文件對 2.5 兩個模型的總結是「在精確編輯與主題保留上都有改進」。Midjourney 的 Edit Model 上限是四張參考圖,但它的風格參考與心情板系統可以跨專案復用視覺語言,個人化設定檔再隨評分累積對齊你的品味,這是把一致性建立在「工具記得你」而非「每次重新描述」的路數。
輸出規格三家口徑不同,比較時要看清楚單位。OpenAI 用像素與長寬比約束:建議尺寸是 1024x1024 方形、1536x1024 橫向與 1024x1536 直向,自訂尺寸須為 16 的倍數、總像素 655,360 到 8,294,400 之間(約 65.5 萬至 829 萬),換算上限是 4K,超過 2560x1440 的解析度屬實驗性。Google 用解析度分級講話:Gemini 3 系內建 1K、2K 與 4K,3.1 Flash Image 多了 512px 的輕量檔,Flash Lite 只支援 1K。Midjourney 用 GPU 時間計價的 SD 與 HD:V8.1 起的 HD 模式可免放大直接生成 2K,每張消耗 1.3 分鐘 GPU 時間,SD 則是 0.8 分鐘。做輸出前先確認目的地的規格需求,能省下不少重做的次數。

價格與方案:免費額度、訂閱與 API 計價
消費端:三家方案怎麼排
ChatGPT 這邊,依官方方案頁:免費方案的定位是「受限且較慢的圖像生成」,Go 月費 8 美元換更多圖像創作額度,Plus 月費 20 美元給更複雜更精確的圖像創作與 Thinking 圖像能力,Pro 從 100 美元起則是「無上限且更快的圖像創作」。免費層的圖像生成與檔案上傳、語音、資料分析一樣是獨立計量的工具限額,到頂時 ChatGPT 會通知,升級 Plus、Pro 或 Business 方案後限額會跟著重置。生成圖像會自動存進 Images 媒體庫,免費層的 Library 有 500MB 儲存空間,對小量使用夠用,長期累積素材的團隊要留意容量。
Gemini 的消費端掛在 Google AI 方案底下,依Google One 方案頁:AI Plus 月費 4.99 美元、用量是標準限額的 2 倍。AI Pro 月費 19.99 美元、4 倍。Ultra 分兩階:Ultra 5x(99.99 美元,Pro 方案用量的 5 倍)與 Ultra 20x(199.99 美元,Pro 方案用量的 20 倍),倍率基準與前兩階不同。生圖本身免費方案就能用,官方限制頁說明 Gemini App 設有五小時或每週用量限制,限額隨時可能調整,台灣也在 Google AI Pro 與 Ultra 的可用國家清單上。
Midjourney 的計價最單純也最傳統,依官方方案比較表:Basic、Standard、Pro、Mega 月費分別是 10、30、60、120 美元,年繳一次付清享 8 折,折算每月 8、24、48、96 美元。額度用 Fast GPU 時數表達:Basic 每月 3.3 小時、Standard 15 小時、Pro 30 小時、Mega 60 小時,不夠可以每小時 4 美元加購。Standard 以上用 Relax 模式可無限量生圖,評分別人的作品也能賺免費 GPU 時間。隱私的 Stealth Mode 只在 Pro 與 Mega 開放,商業使用另有收入門檻,後面授權節展開。
API 端:token 制與每張約當價
API 串接的成本結構,Google 端走自己的路:依Gemini API 定價頁,Nano Banana 2 的圖像輸出每百萬 token 60 美元,換算每張約當價是 512px 的 0.045 美元、1K 的 0.067 美元、2K 的 0.101 美元、4K 的 0.151 美元。Nano Banana 2 Lite 的 1K 每張約 0.0336 美元。Nano Banana Pro 的圖像輸出單價高一倍以上,1K 與 2K 每張約 0.134 美元、4K 約 0.24 美元,換到的是搜尋接地與更強的推理。
OpenAI 的 2.5 世代改用 token 費率表達:依API 定價頁,Flare 與 Sunburst 同率,圖像輸入每百萬 token 8 美元、快取 2 美元、圖像輸出 30 美元,文字輸入 5 美元,正式採用前仍應用自己的工作量實測速度與品質。要抓每張概略價,舊世代 GPT Image 1.5 在官方模型頁列有每張價,可以當量尺:1024x1024 在 low 約 0.009 美元、medium 約 0.034 美元、high 約 0.133 美元,直向 1024x1536 的 high 約 0.2 美元。串流部分影像時,每張局部圖另計 100 個圖像輸出 token。需要 Midjourney 介接時,應先向官方確認當日可用方式。它的方案表則把用量管理做成了可讀的工程指標:Basic 與 Standard 最多三個並行提示,Pro 與 Mega 到十二個,重複與排列任務的單次上限從四個工作到四十個,排隊上限十個工作。把這些數字對照自己批次的節奏,就能預估該買哪一級,比憑感覺猜務實。

輸出格式與速度的小知識也順手記下:OpenAI 端預設輸出 PNG,可以要求 JPEG 或 WebP,官方明說 JPEG 比 PNG 快,對延遲敏感的批次值得切換。方形圖像通常生成最快,同一輪測試先出方形再改比例,是壓時間的土方法。Google 端的 JSON 參數裡可以直接指定長寬比與影像尺寸,1K 到 4K 一行設定,對多版位輸出很省事。
價格之外,方案切換的彈性差異也值得放進試算表。ChatGPT 升級方案後,免費層碰到的限額會重置,短期衝量的專案吃得到這個緩衝。Google 的 AI 方案附帶 Google One 儲存空間(方案頁從 400 GB 起列),附帶效益要一併算。Midjourney 的年繳折扣甜,但一次付清全年,適合已經驗證過工作流的人,初次導入先月繳一個月做驗證更穩。
商品圖實戰:電商與品牌的五步工作流
把鏡頭轉到最需要生圖的場景:商品圖。電商與品牌端的需求其實很固定,可以整理成五步:取得主體素材、去背與乾淨化、換場景與風格、疊上文字與標籤、按通路輸出尺寸。三家的能力剛好覆蓋不同段落,用對工具可以少繞很多路。

去背這步,ChatGPT 的官方提示詞指南有現成範例:要求把商品從輸入圖抽出、置於全透明背景,明講保留商品幾何與標籤可讀性、不加實體背景或棋盤格、不改商品風格,搭配 API 的透明背景參數與 PNG 格式輸出,並在後續編輯時重複宣告透明需求以免破功。官方還提醒一個常見陷阱:模型畫出來的棋盤格不代表透明度,真正的透明要看 alpha 色版。對沒有 API 的使用者,站上的AI 去背工具比較列了幾個專職選項,可以當替代路線。

場景與風格置換是第二個關卡。ChatGPT Images 2.5 的強項是「只換背景、主體不動」,官方對開發者的說明是可更新單一元素並保留主體、構圖與品牌處理。Gemini 的官方模型頁直接把高保真商品樣稿列為 Nano Banana Pro 的最佳場景之一,但物件參考在 Pro 端上限是 6 張(角色與風格槽另計),商品、包裝與配件要同時進場時,Flash 的 10 張物件槽相對寬鬆。Midjourney 的 Edit Model 用四張參考圖組合主體與場景,再靠風格參考統一整批圖的視覺語言。三種路數沒有高下,差別在你的素材形態:有實拍商品照就走前兩者,要憑空塑造情境圖就靠 Midjourney 的美學。
文字與標籤的疊加,前文能力比較已經給過結論:Gemini 把圖內文字與在地化列為主打能力,行銷樣稿、雙語標示都涵蓋。ChatGPT 可以做但要把文案用引號標明、指定出現次數。Midjourney 建議產圖後進設計軟體疊字。至於尺寸輸出,把生成圖放回商品頁與社群前,記得依各通路需求出對應比例,之後的流量與能見度,可以對照站上的WooCommerce 商品頁 SEO與圖片 SEO 優化把基礎功做完,生成素材才不會在後段掉分。
商品圖的驗收可以列一張五項清單:商品形狀與比例有沒有被改動、標籤文字是否清晰可讀、顏色與實品偏差多大、輸出解析度符不符合版位需求、有沒有混入不存在的元素。前兩項正是官方範例提示詞裡明列的要求(保留商品幾何與標籤可讀性),後三項是電商實務的常見地雷,把五項當成上架前的人工檢核,別讓未察覺的形變、錯字或多餘元素直接進入商品頁。

第一次導入時,先用一個小專案把流程跑通再放量。挑一張已經上架的商品實拍照,走完去背、換場景、疊文字、出尺寸的完整一圈,記下每一步的時間與重做次數,這份小樣本會告訴你哪一步該換工具、哪一步該留給人工。模型的選擇也可以分工:草稿與變體交給速度導向的 Flare 或 Nano Banana 2,定案圖與印刷級輸出再交給 Sunburst 或 Nano Banana Pro,官方對 2.5 兩模型的選型建議正是「速度優先選 Flare、品質要求高選 Sunburst」,同樣的邏輯套到 Gemini 的 Lite 與 Pro 分級上也成立。

成本控制上,商品圖的量級適合走 API。以 Gemini 的每張約當價估算,一張 1K 圖約 0.067 美元、2K 約 0.101 美元,批量產出情境圖與變體的單位成本可以壓得很低。要更高檔的精修品質再上 Nano Banana Pro,用 0.134 到 0.24 美元買搜尋接地與細節。OpenAI 端用 token 計價,正式放量前先用小批量實測用量,官方也建議用自己的工作量測速度與品質,別人的 benchmark 不一定準。
授權、浮水印與商業使用須知
商業使用的遊戲規則,Midjourney 寫得最細:依服務條款,你在服務中創作的素材歸你所有(在適用法律允許的範圍內),但有兩個例外值得記住:公司或其員工在公司年營收超過 100 萬美元時,必須訂閱 Pro 或 Mega 方案才擁有素材。放大他人的圖像,所有權仍屬原創作者。條款同時保證已創作素材的所有權在降級或取消會員後仍然保留。中小企業與個人賣家在 Basic 方案就能商用,過線的企業則要把方案費算進合規成本。
OpenAI 端,官方說明中心明文表示不會對 API 生成內容主張著作權,來源標記採 C2PA 中繼資料與隱形浮水印,消費端商用前仍須核對現行使用條款。Google 端做得更積極:所有生成圖像都內建 SynthID 浮水印,官方持續把 SynthID 與 C2PA 內容憑證搭配,還把驗證功能做進 Gemini App,自 2025 年 11 月上線以來已被使用超過 2,000 萬次,用來辨識 Google AI 生成的圖片、影片與聲音。若素材要進入對來源敏感的通路(新聞、出版、廣告審查較嚴的平台),先確認對方的 AI 內容政策再投放。
把三家的授權差異壓縮成三個判斷句:看收入,Midjourney 的百萬美元門檻是硬規定,過線就換 Pro 或 Mega。看用途,商用條款各家表述不同,人像、商標與他人素材的侵權責任,Midjourney 條款與 Google 支援頁都明文要求使用者自負。看來源,Google 全程蓋 SynthID、OpenAI 有 C2PA 加隱形浮水印,要進入對 AI 生成內容敏感的通路時,先確認對方的 AI 內容政策。把三句話記住當初步篩選,商用前仍須逐家核對現行條款。

年齡與責任邊界順道整理:Gemini App 生成圖像須年滿 13 歲、編輯圖像須年滿 18 歲。Google 支援頁明確提醒,生成圖像時別侵害他人的著作權或隱私權,發布或使用生成內容前先自行斟酌。商品圖還有一條法律紅線要自查:生成的包裝、標籤或場景若出現他人商標、知名角色或未授權的臉孔,責任在使用者身上,Google 的政策頁明文禁止生成侵害他人權利的內容,Midjourney 的條款也把第三方權利列為所有權的但書。上架圖保留生成紀錄與提示詞,發生爭議時才有跡可循。多一道人工檢查,能降低未察覺的問題直接上架的風險。
怎麼選:四個判斷軸對照你的工作流
價格表之外,選擇可以落在四個軸上。速度軸:要在對話裡快速迭代,ChatGPT Images 2.5 的延遲降幅與 Gemini 的 Flash 級速度都是為此設計,Midjourney 把渲染速度的重點放在 V8.1,V8.2 轉向聚焦美學、畫質與個人化,且它的單位是 GPU 時間而非秒數。品質軸:追求最高細節與風格完成度,可以把 Midjourney 的美學定位與 Nano Banana Pro 的推理式專業素材製作能力放在一起比較,前者靠品味累積、後者靠知識接地。編輯軸:反覆改圖、局部替換、多輪保持一致,ChatGPT 與 Gemini 的官方承諾最直接。成本軸:免費起步選兩家助理,預算明確的團隊可以 Midjourney 年繳攤提,API 大量產圖則看每張約當價挑 Gemini 的階梯。
對照幾種常見身分:個人創作者與小賣家,從 ChatGPT 或 Gemini 的免費層開始就夠用,哪個順手用哪個,碰到額度或品質天花板再付費。行銷團隊做素材矩陣,Gemini 的 2K 下載、文字在地化與 API 分級,適合放進評估。設計工作室講究視覺一致性,Midjourney 的個人化與風格參考值得長期投資。開發者做產品內生圖,OpenAI 與 Google 的 API 各有明確價目表與模型分級,按工作量擇優。免費層的取捨也要算清楚:ChatGPT 免費版的圖像生成被定位成受限且較慢,Gemini 免費下載只有 1K,但兩者都足以驗證工作流可行性,先用免費層跑通流程、確認產出符合需求,再把預算押在正確的方案上,比一開始就年繳高階方案穩妥。想再往外看一步的讀者,站上的AI 工具總整理把生圖以外的選項也排好了。
工程面還有一個少被提及的穩定性工具:模型快照。OpenAI 的 API 允許鎖定特定版本的快照,讓效能與行為保持一致,串接生圖的系統在正式環境鎖版本、測試環境跑最新版,可以避免模型默默更新導致輸出整批走鐘的事故。沒有版本鎖定能力的服務,就要靠輸出的自動化品質檢查當煞車。這類工程習慣平常看不出價值,出事的時候就是救命的。

混用也是可行的配置方式。一套可採用的分工是:ChatGPT 當日常的快速編輯台,處理照片修改與去背。Gemini 負責資訊型素材與多語文字,以及需要查證真實資料的圖。Midjourney 顧品牌視覺的情境圖與風格資產。三家的輸入都是文字加圖片,真正的成本在於維持一致的提示詞習慣與素材命名,把每個工具的強項固定在流程裡特定位置,比把所有需求塞進單一工具更能兼顧品質與速度。
收尾提醒一件容易被忽略的事:這個領域的版本與價格變動很快,OpenAI 不到一年換了三個代際、Google 一年換了三個品牌名、Midjourney 半年內換了兩次預設版本,動手採購或串接前,把各官方頁當天的數字再讀一次,比任何比較文都可靠。比較框架會過期,核對官方源的習慣不會。





