AI 生圖怎麼選:品質需求、工作流程、成本
以真實任務檢查品質、流程與成本,比單看模型名稱或排行更能判斷是否適用。

ChatGPT、Gemini、Midjourney 生圖模型完整比較

比較 ChatGPT Images 2.5、Gemini Nano Banana 2 與 Midjourney V8.2 三大生圖模型:整理三家模型現況與演進時間軸、文字入圖與精確編輯能力、參考圖數量與輸出解析度、免費額度與 API 計價、電商商品圖五步工作流與商用授權差異,附四軸選擇框架,協助你依工作流程挑對生圖工具。

  • AI 生圖比較
  • ChatGPT 生圖
  • Gemini 生圖
  • Nano Banana 2
  • Midjourney V8.2
  • 生圖模型比較
  • AI 生圖模型
  • ChatGPT Images 2.5
  • Nano Banana Pro
  • Midjourney 價格
  • AI 商品圖
  • 生圖 商用授權
  • 圖像生成 API
  • GPT-Image-2.5
  • AI 繪圖比較

約 30 分鐘閱讀作者:Whoops 編輯團隊

本頁目錄

想用 AI 生成圖片,2026 年要面對的名字比往年都多:ChatGPT 的 Images 2.5、Google 的 Nano Banana 2、Midjourney 的 V8.2。三家走的路線明顯不同:ChatGPT 把生圖放進對話助理,主打精確編輯與多輪修改。Gemini 用一整個模型家族分工,免費帳號就能在 App 裡生圖,API 端依速度與品質分級計價。Midjourney 則是純訂閱制的獨立工具,把籌碼押在美學表現與個人化品味上。要比較的不只是誰畫得好看,還有入口形態、免費額度、價格結構與商用授權,這些差異會直接影響日常工作流程。

依三家官方文件與產品公告整理,截至 2026 年 9 月的現況是:OpenAI 的 ChatGPT Images 2.5 在 9 月 8 日上線,官方宣稱生成延遲比 Images 2.0 最多降低 50%,編輯時更擅長只改你要求的部分。Google 的 Nano Banana 2 就是 Gemini 3.1 Flash Image,2 月 26 日發布,把前一代 Pro 級的世界知識與文字渲染帶到 Flash 級速度。Midjourney 的 V8.2 在 7 月 24 日成為預設版本,更新重點擺在美學、畫質與個人化。價格帶差異同樣明顯:兩家助理的免費層都能生圖,Midjourney 沒有免費方案、從每月 10 美元起跳,Gemini 端的官方每張約當價依模型與解析度,落在約 0.0336 美元到 0.24 美元之間,OpenAI 的 2.5 世代則改以 token 計價。

接下來依模型現況、演進時間軸、能力比較、價格方案、商品圖應用與授權須知逐層拆開,收尾給一組四軸判斷框架,讓你可以對著自己的工作流程做選擇。想先擴充背景的讀者,站上先前的AI 網頁設計指南與用 Midjourney 做設計稿的實作案例,分別談過 AI 圖像在網站專案裡的角色,那份脈絡加上各家的生圖工具介紹,正好補齊這次比較的地基。

資料口徑先說清楚:模型名稱、價格、規格與能力描述,都取自三家的官方說明中心、開發者文件與產品公告,抓取時點為 2026 年 9 月 17 日。生圖模型市場的更新速度極快,官方文件也可能隨時改版,任何要付錢或寫進採購單的決定,都值得再花三分鐘回到官方頁核對當日數字,把第三方比較當地圖而非終點。

快速重點整理

  • 產品形態:ChatGPT Images 內建在助理(所有方案層級可用),Gemini 以 Nano Banana 家族分工(App 免費可生圖、API 四個模型),Midjourney 是訂閱制獨立工具(四方案、無免費層)。
  • 現役模型:OpenAI Images 2.5(API 端 Flare/Sunburst)、Google Nano Banana 2 與 Nano Banana Pro、Midjourney V8.2。
  • 價格帶:ChatGPT 免費起(Go 8 美元、Plus 20 美元、Pro 100 美元起),Gemini 免費起(AI Plus 4.99 美元、AI Pro 19.99 美元、Ultra 99.99 美元起),Midjourney 月繳 10 至 120 美元、年繳約 8 折。
  • API 每張約當成本:Gemini 端從 Lite 1K 的 0.0336 美元到 Nano Banana Pro 4K 的 0.24 美元(第二代主力 0.045 至 0.151 美元)。OpenAI 端 GPT Image 1.5 中品質 1024x1024 約 0.034 美元,2.5 世代改以 token 計價。
  • 商用授權:落地商用前要回頭讀各家條款原文。Midjourney 明文年營收超過 100 萬美元的企業須訂 Pro 或 Mega 才擁有素材;OpenAI 明示不對 API 生成內容主張著作權;Google 的生成圖全部內建 SynthID 浮水印。這些敘述都不等同完整商用授權。

三家現況:2026 年 9 月的第一線模型

ChatGPT Images 2.5:生圖住進對話助理裡

OpenAI 在 2026 年 9 月 8 日的產品公告裡,把 ChatGPT Images 2.5 定位為新的旗艦生圖模型:細節更銳利、編輯更精確、生成更快,光線更自然、材質更豐富,也更擅長保留參考照片裡的主體。官方並宣稱生成延遲比 Images 2.0 最多減少 50%。落地範圍一次給滿:所有方案層級的 ChatGPT、ChatGPT Work 與 Codex 使用者,在桌面、行動與網頁端都能用,等於免費帳號也保有生圖能力,差別在額度與速度。

產品面同步加了幾個降低門檻的功能。Sketch 讓你直接在 ChatGPT 裡畫草圖當視覺引導,手機 App 上打 @Sketch 就能把手繪輪廓變成成品。模板功能把海報、Logo 這類格式做成起點,不必從空白畫布開始。編輯時可以在圖上直接留言指定要改的區域,也能把用過的提示詞連同圖像一起分享出去。生成期間不必乾等,ChatGPT 可以繼續用,複雜請求丟出去後回來收圖即可。依官方說明中心的條列,圖像生成可以在任何長寬比輸出,複雜請求可能需要數分鐘,付費方案的 Images with thinking 則開放給 Plus、Pro 與 Business。

第三方使用者的回饋可以補官方視角的不足。圖像工具 Higgsfield 的產品負責人說,最讓他們印象深刻的是 API 端的 Flare 模型「懂什麼不該改」。AI 工作平台 Manus 的評估團隊實測後的結論是,Flare 以 GPT-Image-2 的二到四倍速度產出高品質圖像,改良的透明背景生成也讓品牌素材到網站素材的應用更順。這類引述自然帶有立場,但方向與官方宣稱一致,可以當交叉驗證。

開發者端則是兩個新模型接棒:GPT-Image-2.5 Flare 與 GPT-Image-2.5 Sunburst,快照日期都是 2026 年 9 月 8 日。官方對 Flare 的描述是「快速、高品質的日常圖像生成」,也是多數應用的預設選擇,品質高於 GPT-Image-2 之餘延遲再低 50%。Sunburst 的定位是「最強的圖像生成與編輯模型」,給編輯精確度優先的工作流使用,官方點名的適用情境包含可上線的廣告創意與精修商品圖。兩個模型都支援 low 到 max 共六段品質設定與透明背景輸出,尺寸規則是 16 的倍數、長寬比介於 1:3 至 3:1、單邊最長 3840 像素。

Gemini 與 Nano Banana 家族:一個名字、四個模型

Google 這邊的產品名容易讓人混淆,拆開看其實很清楚:Nano Banana 是 Gemini 原生圖像生成能力的品牌名,在 Gemini API 官方文件裡對應四個模型。Nano Banana 2 Lite 追求最快最便宜,給速度與成本優先的場景。Nano Banana 2(Gemini 3.1 Flash Image)是全能主力,平衡速度、4K 生成、世界知識與可靠文字渲染。Nano Banana Pro(Gemini 3 Pro Image)是複雜視覺任務的高階選擇,強調最高世界知識、進階在地化與精準品牌一致性。初代 Nano Banana 屬舊世代,官方建議轉移到 2 Lite。這套分級讓開發者可以依工作量挑模型。

世界知識是 Gemini 這條線的主打能力。官方部落格說明,模型具備世界知識,還能由網路搜尋的即時資訊輔助,把資訊圖表、筆記轉圖解與資料視覺化這類「內容要正確」的圖像做好。App 端的支援頁另提供個人化頭像功能,錄下你的臉與聲音建立虛擬分身(官方載明僅限美國境內年滿 18 歲的使用者),之後生成自己的各種場景圖不必每次上傳照片。這兩個能力把生圖從視覺想像擴到知識表達,是其餘兩家比較少著墨的方向。

消費端的入口在 Gemini App。依Google 支援頁,用 Nano Banana 2 生圖不需要付費方案,功能表對「無 AI 方案」欄位是打勾的,差別在下載解析度:有 AI 方案可到 2K,沒有則是 1K。2026 年 2 月 26 日的官方部落格公告說明,Nano Banana 2 在 App 內取代了 Nano Banana Pro 的位置,AI Pro 與 Ultra 訂閱者仍可從三點選單用 Pro 模型重新生成圖像,做需要更高細節的工作。Nano Banana 2 的另一個差異化能力是接地:生成時可以動用 Google 搜尋查證事實,用即時資料與網路圖像更準確地渲染特定主體,3.1 Flash Image 這代還把圖片搜尋接地加了進來。入口佈署也鋪得廣:除了 Gemini App,搜尋的 AI Mode 與 Lens、影片工具 Flow、Google Ads 的廣告建議都用上同一個模型,Flow 端更開放所有使用者免點數使用。同一套能力橫跨這麼多入口,對素材工作流的意義是「學一次到處用」。

搜尋接地,把外部資訊帶進生圖:網頁資訊、圖片參考、生成圖像、核對內容
支援接地的模型可把搜尋資訊或網路圖片作為生成上下文。輸出仍應核對內容;不同模型支援的搜尋方式不同。

App 端 Nano Banana 2 的能力清單,官方支援頁列了六項:改進的世界知識、跨生成圖維持人物或角色外觀的角色一致性、針對局部下手的快速編輯、所有支援語言都更準確的文字拼寫、更強的指令遵循,以及高解析度預覽。這份清單跟 API 端的模型敘述互相印證,也點出 Lite 版的取捨:它追求最快最便宜,官方明說沒有針對多參考輸入與多輪連續編輯優化,要批次做變體或深度改圖,就往上選 Flash 或 Pro 級模型。

模型的背景脈絡與 Gemini 3 世代的整體定位,可以對照站上的Gemini 3 完整指南,那篇把文字模型的演進與方案結構講得更完整,生圖端的模型分級正是同一套節奏的延伸,讀完再回頭看 Nano Banana 家族會更順。

Midjourney V8.2:訂閱制美學工具的當家版本

Midjourney 的節奏不同於兩家助理:官方版本說明載明,目前預設版本是 V8.2,2026 年 7 月 24 日上線,更新聚焦美學、畫質與個人化。同年 4 月 14 日發布的 V8.1 曾是 6 月到 7 月的預設版,官方稱它是迄今最快的模型,標準工作渲染約快 4 到 5 倍,並首次加入免放大的 2K HD 輸出。V8.2 同場帶來新的 Edit Model,取代過去的 Omni Reference、Character Reference 與 Retexture 工具,把「用文字描述來改圖」與「用參考圖生成」收進同一套機制。

入口形態上,Midjourney 同時保有網頁版與 Discord 兩條路:網頁端的 Imagine Bar 可以上傳最多四張圖當參考,Editor 支援局部重繪與擴展畫布,Discord 端則用 --edit 參數達到相同效果。風格控制是它的傳統強項,Edit Model 可搭配風格參考、心情板與個人化設定使用。官方公告對 V8.2 的形容是更有創意、更大膽、更精緻也更新鮮,並宣稱低品質輸出的隨機情況大幅減少,喜歡先看再買的人,可以從官方更新公告的範例圖初步判斷這個版本合不合口味。

風格參考,延續整批視覺語言:風格參考、色彩與材質、不同主體、共同調性
Midjourney 的風格參考傳遞色彩、材質與光線等視覺特徵,不是複製參考圖中的人物或物件。

演進時間軸:三條路線怎麼走到今天

把三家近一年的節奏排在一起,可以看出各自的重心。OpenAI 這條線走的是「模型代際推進」:2025 年 12 月 16 日推出 ChatGPT Images 的新版本,API 名為 GPT Image 1.5,當時的賣點是精確編輯、保留細節,生成速度最快提升 4 倍,且在 ChatGPT 對所有使用者推出。2026 年 4 月 21 日發布 Images 2.0。9 月 8 日再推 Images 2.5,把延遲再壓低最多 50%。不到一年三次換代,選擇 API 串接的團隊要有跟著遷移的心理準備。

Google 的時間軸則是「品牌迭起」:2025 年 8 月初代 Nano Banana 上線,11 月推出 Nano Banana Pro,把工作室等級的創意控制帶進來。2026 年 2 月 26 日的 Nano Banana 2 結合兩代所長,用 Flash 級速度提供 Pro 級的世界知識與推理,並同步進駐 Gemini App、搜尋的 AI Mode 與 Lens、Flow、Google Ads 等多個入口,其中搜尋端的圖像能力一口氣擴及 141 個新國家地區與 8 種新語言。

三條時間軸背後是三種產品哲學。OpenAI 用代際命名(1.5 到 2.5)對齊它的模型文化,每代都把「更快、更聽話」往前推,代價是使用者要持續適應行為差異。Google 用品牌暱稱快速建立記憶點,模型代號(3.1 Flash Image)與行銷名(Nano Banana 2)並行,同一套能力鋪進多個產品線。Midjourney 用傳統的版本號慢慢養,預設版更換的間隔以月計,換版日期與預設期程都載明在官方版本頁。對採購的啟示很簡單:依賴 API 的系統要留遷移緩衝,依賴視覺一致性的團隊要盯版本切換的公告。

Midjourney 的 2026 相對穩定:V8.0 在 3 月 17 日以早期存取 alpha 之姿上線、開放到 7 月 24 日,4 月 14 日 V8.1 發布並在 6 月 10 日成為預設,7 月 24 日 V8.2 接棒至今。這條節奏線的好處是每一步的日期都寫在官方版本頁,網頁版的個人化設定檔會隨你的評分累積而更懂你的品味,V8.2 又擴大了建立個人化設定檔的圖池。對長期依賴固定視覺風格的團隊來說,版本切換時把個人化輸出重新檢查一遍更穩當。

一張表看懂規格與價格對照

項目ChatGPT Images 2.5Gemini(Nano Banana 家族)Midjourney V8.2
產品形態助理內建生圖助理內建+API 模型家族獨立訂閱工具(網頁+Discord)
免費可用是(所有方案層級,額度受限)是(App 免 AI 方案可生圖,下載 1K)否(四方案皆訂閱制)
消費端月費Go 8/Plus 20/Pro 100 美元起AI Plus 4.99/AI Pro 19.99/Ultra 99.99 美元起Basic 10/Standard 30/Pro 60/Mega 120 美元
API 計價token 制(圖像輸出每百萬 30 美元)token 制+每張約當價(0.0336 至 0.24 美元)未納入 API 計價比較(Fast/Relax GPU 時數制)
參考圖數量參考照片主體保留有改進,可用張數請查當日 API 文件最多 14 張(物件槽 Lite 14/Flash 10/Pro 6,另計角色與風格槽)Edit Model 最多 4 張
輸出解析度常規至 3840 像素邊長(超過 2560x1440 屬實驗性)1K/2K/4K(Flash 加 512px、Lite 僅 1K)SD 標準與 2K HD(HD 每張 1.3 分鐘 GPU)
文字入圖可遵循指令加文字(官方提醒精確擺放仍會掙扎)主打可讀文字與圖內翻譯在地化以提示詞描述為主(V8.1 起細節遵循提升)
浮水印/來源標記C2PA 中繼資料+隱形浮水印SynthID 浮水印(全部生成圖像)未納入比較

表列的規格細節會隨版本更新變動,決策前建議以各官方頁當日標示為準。表格之外,還有幾個「規格面看不到但會影響體感」的差異,接下來三節逐一展開。

能力比較一:文字入圖與版面控制

要在圖片裡放字,三家的可靠度差異很實際。OpenAI 在開發者文件裡誠實列出限制:文字渲染雖然明顯進步,精確的擺放與清晰度仍可能掙扎,結構化版面裡精確安排元素也偶有困難,複雜提示詞的生成時間最多可能到 2 分鐘。對應的做法是把要求寫明:官方提示詞指南建議把必要文案用引號標出、說明它該出現幾次,輸出後再檢查拼字與可讀性。

Google 把文字渲染當成 Nano Banana 2 的主打能力之一:官方公告直說它可以為行銷樣稿或賀卡生成準確可讀的文字,甚至能翻譯並在地化圖像內的文字。文件進一步說明它擅長資訊圖表、菜單、圖解與行銷素材的可讀風格化文字,App 端支援語言的拼字準確度也同步提升。對需要產出中文字卡、雙語海報或菜單的團隊,這是目前官方宣稱最直接的能力。

與文字相鄰的兩個設計場景也值得排進流程。Logo 製作上,官方指南有「設計可重用 Logo」的完整範例,重點是要求乾淨的向量感輪廓、在不同尺寸下都清楚的構圖,並以透明背景加 PNG 格式輸出,用 n 參數一次要多個變體。草圖轉擬真則是 Sketch 功能的延伸,把手繪輪廓拍照上傳或直接在 App 裡畫,再描述材質與風格,模型會把草圖升級成擬真成品,提案階段特別好用。

草圖定結構,描述補材質:草圖輪廓、材質與風格、成品示意
把草圖當成結構參考,再用文字描述材質與風格,能更具體地傳達想要的構圖。示意不代表實際模型輸出測試。

把文字能力放進真實工作流,差別會更清楚。做促銷圖時,Gemini 可以直接把文案與雙語標示生成在畫面上,翻譯在地化也包在同一個動作裡。ChatGPT 適合「圖先字後」的節奏,視覺定案後再要求把指定文案放進版面,並依官方指南用引號標出必要文案及指定出現次數。涉及法律或價格資訊的字(有效期限、售價、優惠條件),不論用哪一家,輸出後都要人工複核,文字渲染的進步不等於免查證。

圖中文字分開驗收:定稿文案、放入版面、逐字複核
圖中文字生成後仍要逐字核對,尤其是售價、有效期限與優惠條件。

Midjourney 對文字的立場相對保守,官方文件沒有把文字渲染列為賣點,描述重心放在提示詞遵循與細節保留:V8.1 起更會讀提示詞並守住小細節,開 Raw 模式可以移除預設風格化,拿到更貼近描述的結果。實務上要做海報文案或包裝文字,比較穩的做法是先用 Midjourney 產視覺底圖,再進設計軟體疊字,把字型與字級的控制權留在自己手上。

能力比較二:編輯精確度與多輪一致性

「只改我說的部分、其他不要動」是 2026 年生圖工具的分水嶺。ChatGPT Images 2.5 在這點上的官方描述相當具體:編輯時更擅長只改被要求修改的地方,其餘細節保持原樣,多輪對話裡先前的修改更容易保持一致,新一輪編輯建立在已完成的工作上,畫質不隨輪數劣化。官方還點出一個開發者場景:可以只更新單一元素,例如商品、背景或一段文案,同時保留周圍的主體、構圖與品牌處理,這正是電商反覆改圖最需要的性質。

操作面的細節也值得知道。ChatGPT 的編輯器提供選取工具,圈出想改的區域再下指令,也能不選取、直接用對話描述修改,官方同時提醒選取範圍不一定精確、編輯可能溢出到所選區外,對邊界要求高的修改要多檢查幾眼。所有生成過的圖會自動存進 Images 媒體庫,回頭找素材比翻對話紀錄省事。往上一代的賣點也能說明這條路線的累積:2025 年底的模型就把光線、構圖與人物外觀的一致性寫進編輯承諾,服裝與髮型試穿這類需要「像本人」的場景,正是它的設計目標之一。

局部修改後,仍要檢查整張圖:指定修改、保留區域、全圖複核
圈選區域可協助描述修改目標,但編輯可能延伸到選區外。完成後應同時檢查修改處與原本要保留的細節。

Google 端的證據同樣明確。Nano Banana 2 的一項官方範例提示詞就是「把這張資訊圖翻成西班牙文,其他元素都不准變」,這種指定式修改是它的設計目標。App 端的功能列表也把局部編輯列為核心能力,強調快速修改圖像的特定部分。Nano Banana Pro 再往上加一層推理:官方模型頁說它是以推理驅動的專業級編輯引擎,適合需要精確控制的複雜修改。

Midjourney 的 V8.2 Edit Model 走結構化路線:上傳圖片後用文字描述修改,或用 Editor 做局部重繪與擴展畫布,兩者共用同一套編輯模型。要注意的是它與 Remix 功能目前不相容,適用版本限於 8.1 與 8.2。三家比較下來,精確編輯的官方承諾以 ChatGPT 與 Gemini 的敘述最直接,Midjourney 勝在編輯與風格系統的整合度,適合「以圖養圖」的迭代方式。

能力比較三:參考圖、主體一致性與輸出規格

參考圖數量是挑模型時容易被忽略的規格。Gemini 官方明列 Gemini 3 系圖像模型可混合最多 14 張參考圖,槽位分配則不同:Lite 全部給物件(14 張)、Flash 是物件 10 張+角色 4 張、Pro 是物件 6 張+角色 5 張+風格 3 張。官方部落格另說明 Nano Banana 2 能在單一工作流中維持最多五個角色的相似度與 14 個物件的保真度。這對品牌視覺的意義很直接:logo、包裝、代言人照片可以同時進場,讓模型在合成時守住各元素的原貌。

參考素材,先分清楚用途:物件、角色、風格、組合畫面
物件、角色與風格參考分別約束不同資訊。先整理素材用途,再依所選模型核對支援類型和張數,不把參考越多當成效果越好。

ChatGPT 的優勢在參考照片的主體保留:Images 2.5 更擅長從參考照片出發,把熟悉的主體轉換到新場景、風格與構圖,主體看起來更可辨識,光線材質更自然,特徵更容易延續。開發者文件對 2.5 兩個模型的總結是「在精確編輯與主題保留上都有改進」。Midjourney 的 Edit Model 上限是四張參考圖,但它的風格參考與心情板系統可以跨專案復用視覺語言,個人化設定檔再隨評分累積對齊你的品味,這是把一致性建立在「工具記得你」而非「每次重新描述」的路數。

輸出規格三家口徑不同,比較時要看清楚單位。OpenAI 用像素與長寬比約束:建議尺寸是 1024x1024 方形、1536x1024 橫向與 1024x1536 直向,自訂尺寸須為 16 的倍數、總像素 655,360 到 8,294,400 之間(約 65.5 萬至 829 萬),換算上限是 4K,超過 2560x1440 的解析度屬實驗性。Google 用解析度分級講話:Gemini 3 系內建 1K、2K 與 4K,3.1 Flash Image 多了 512px 的輕量檔,Flash Lite 只支援 1K。Midjourney 用 GPU 時間計價的 SD 與 HD:V8.1 起的 HD 模式可免放大直接生成 2K,每張消耗 1.3 分鐘 GPU 時間,SD 則是 0.8 分鐘。做輸出前先確認目的地的規格需求,能省下不少重做的次數。

先看版位,再決定輸出規格:目的版位、長寬比、像素尺寸、輸出檢查
先確認商品頁或社群版位,再分別設定長寬比與像素尺寸。比例描述畫布形狀,像素尺寸決定影像的取樣大小。

價格與方案:免費額度、訂閱與 API 計價

消費端:三家方案怎麼排

ChatGPT 這邊,依官方方案頁:免費方案的定位是「受限且較慢的圖像生成」,Go 月費 8 美元換更多圖像創作額度,Plus 月費 20 美元給更複雜更精確的圖像創作與 Thinking 圖像能力,Pro 從 100 美元起則是「無上限且更快的圖像創作」。免費層的圖像生成與檔案上傳、語音、資料分析一樣是獨立計量的工具限額,到頂時 ChatGPT 會通知,升級 Plus、Pro 或 Business 方案後限額會跟著重置。生成圖像會自動存進 Images 媒體庫,免費層的 Library 有 500MB 儲存空間,對小量使用夠用,長期累積素材的團隊要留意容量。

Gemini 的消費端掛在 Google AI 方案底下,依Google One 方案頁:AI Plus 月費 4.99 美元、用量是標準限額的 2 倍。AI Pro 月費 19.99 美元、4 倍。Ultra 分兩階:Ultra 5x(99.99 美元,Pro 方案用量的 5 倍)與 Ultra 20x(199.99 美元,Pro 方案用量的 20 倍),倍率基準與前兩階不同。生圖本身免費方案就能用,官方限制頁說明 Gemini App 設有五小時或每週用量限制,限額隨時可能調整,台灣也在 Google AI Pro 與 Ultra 的可用國家清單上。

Midjourney 的計價最單純也最傳統,依官方方案比較表:Basic、Standard、Pro、Mega 月費分別是 10、30、60、120 美元,年繳一次付清享 8 折,折算每月 8、24、48、96 美元。額度用 Fast GPU 時數表達:Basic 每月 3.3 小時、Standard 15 小時、Pro 30 小時、Mega 60 小時,不夠可以每小時 4 美元加購。Standard 以上用 Relax 模式可無限量生圖,評分別人的作品也能賺免費 GPU 時間。隱私的 Stealth Mode 只在 Pro 與 Mega 開放,商業使用另有收入門檻,後面授權節展開。

API 端:token 制與每張約當價

API 串接的成本結構,Google 端走自己的路:依Gemini API 定價頁,Nano Banana 2 的圖像輸出每百萬 token 60 美元,換算每張約當價是 512px 的 0.045 美元、1K 的 0.067 美元、2K 的 0.101 美元、4K 的 0.151 美元。Nano Banana 2 Lite 的 1K 每張約 0.0336 美元。Nano Banana Pro 的圖像輸出單價高一倍以上,1K 與 2K 每張約 0.134 美元、4K 約 0.24 美元,換到的是搜尋接地與更強的推理。

OpenAI 的 2.5 世代改用 token 費率表達:依API 定價頁,Flare 與 Sunburst 同率,圖像輸入每百萬 token 8 美元、快取 2 美元、圖像輸出 30 美元,文字輸入 5 美元,正式採用前仍應用自己的工作量實測速度與品質。要抓每張概略價,舊世代 GPT Image 1.5 在官方模型頁列有每張價,可以當量尺:1024x1024 在 low 約 0.009 美元、medium 約 0.034 美元、high 約 0.133 美元,直向 1024x1536 的 high 約 0.2 美元。串流部分影像時,每張局部圖另計 100 個圖像輸出 token。需要 Midjourney 介接時,應先向官方確認當日可用方式。它的方案表則把用量管理做成了可讀的工程指標:Basic 與 Standard 最多三個並行提示,Pro 與 Mega 到十二個,重複與排列任務的單次上限從四個工作到四十個,排隊上限十個工作。把這些數字對照自己批次的節奏,就能預估該買哪一級,比憑感覺猜務實。

API 成本,要把輸入也算進去:文字輸入、參考圖輸入、圖像輸出、用量成本
圖像 API 費用不只計算輸出,還可能包含文字與參考圖輸入。按所選模型的現行費率與實際用量估算,不能直接套用舊模型的每張價。

輸出格式與速度的小知識也順手記下:OpenAI 端預設輸出 PNG,可以要求 JPEG 或 WebP,官方明說 JPEG 比 PNG 快,對延遲敏感的批次值得切換。方形圖像通常生成最快,同一輪測試先出方形再改比例,是壓時間的土方法。Google 端的 JSON 參數裡可以直接指定長寬比與影像尺寸,1K 到 4K 一行設定,對多版位輸出很省事。

價格之外,方案切換的彈性差異也值得放進試算表。ChatGPT 升級方案後,免費層碰到的限額會重置,短期衝量的專案吃得到這個緩衝。Google 的 AI 方案附帶 Google One 儲存空間(方案頁從 400 GB 起列),附帶效益要一併算。Midjourney 的年繳折扣甜,但一次付清全年,適合已經驗證過工作流的人,初次導入先月繳一個月做驗證更穩。

商品圖實戰:電商與品牌的五步工作流

把鏡頭轉到最需要生圖的場景:商品圖。電商與品牌端的需求其實很固定,可以整理成五步:取得主體素材、去背與乾淨化、換場景與風格、疊上文字與標籤、按通路輸出尺寸。三家的能力剛好覆蓋不同段落,用對工具可以少繞很多路。

商品圖製作,先走完整個流程:取得素材、去背整理、場景風格、加入文字、通路尺寸
從主體素材開始,依序整理背景、設定場景、加入已確認的文字,最後輸出通路需要的尺寸;每一步都要保留商品特徵。

去背這步,ChatGPT 的官方提示詞指南有現成範例:要求把商品從輸入圖抽出、置於全透明背景,明講保留商品幾何與標籤可讀性、不加實體背景或棋盤格、不改商品風格,搭配 API 的透明背景參數與 PNG 格式輸出,並在後續編輯時重複宣告透明需求以免破功。官方還提醒一個常見陷阱:模型畫出來的棋盤格不代表透明度,真正的透明要看 alpha 色版。對沒有 API 的使用者,站上的AI 去背工具比較列了幾個專職選項,可以當替代路線。

棋盤格不等於透明:畫出的格子、透明色版、疊圖檢查
畫面裡的棋盤格可能只是像素;真正透明需確認 alpha 色版或實際疊圖結果。

場景與風格置換是第二個關卡。ChatGPT Images 2.5 的強項是「只換背景、主體不動」,官方對開發者的說明是可更新單一元素並保留主體、構圖與品牌處理。Gemini 的官方模型頁直接把高保真商品樣稿列為 Nano Banana Pro 的最佳場景之一,但物件參考在 Pro 端上限是 6 張(角色與風格槽另計),商品、包裝與配件要同時進場時,Flash 的 10 張物件槽相對寬鬆。Midjourney 的 Edit Model 用四張參考圖組合主體與場景,再靠風格參考統一整批圖的視覺語言。三種路數沒有高下,差別在你的素材形態:有實拍商品照就走前兩者,要憑空塑造情境圖就靠 Midjourney 的美學。

文字與標籤的疊加,前文能力比較已經給過結論:Gemini 把圖內文字與在地化列為主打能力,行銷樣稿、雙語標示都涵蓋。ChatGPT 可以做但要把文案用引號標明、指定出現次數。Midjourney 建議產圖後進設計軟體疊字。至於尺寸輸出,把生成圖放回商品頁與社群前,記得依各通路需求出對應比例,之後的流量與能見度,可以對照站上的WooCommerce 商品頁 SEO與圖片 SEO 優化把基礎功做完,生成素材才不會在後段掉分。

商品圖的驗收可以列一張五項清單:商品形狀與比例有沒有被改動、標籤文字是否清晰可讀、顏色與實品偏差多大、輸出解析度符不符合版位需求、有沒有混入不存在的元素。前兩項正是官方範例提示詞裡明列的要求(保留商品幾何與標籤可讀性),後三項是電商實務的常見地雷,把五項當成上架前的人工檢核,別讓未察覺的形變、錯字或多餘元素直接進入商品頁。

商品圖保留哪些細節:形狀比例、標籤與顏色、多餘元素
上架前比對形狀、標籤、顏色與多餘元素,並確認輸出尺寸符合版位。

第一次導入時,先用一個小專案把流程跑通再放量。挑一張已經上架的商品實拍照,走完去背、換場景、疊文字、出尺寸的完整一圈,記下每一步的時間與重做次數,這份小樣本會告訴你哪一步該換工具、哪一步該留給人工。模型的選擇也可以分工:草稿與變體交給速度導向的 Flare 或 Nano Banana 2,定案圖與印刷級輸出再交給 Sunburst 或 Nano Banana Pro,官方對 2.5 兩模型的選型建議正是「速度優先選 Flare、品質要求高選 Sunburst」,同樣的邏輯套到 Gemini 的 Lite 與 Pro 分級上也成立。

先選定草稿,再投入精修:草稿與變體、選定方向、細節精修
先以小專案試出草稿與變體,選定方向後再投入細節精修,並記錄各步驟時間與重做次數,據此調整工具分工。

成本控制上,商品圖的量級適合走 API。以 Gemini 的每張約當價估算,一張 1K 圖約 0.067 美元、2K 約 0.101 美元,批量產出情境圖與變體的單位成本可以壓得很低。要更高檔的精修品質再上 Nano Banana Pro,用 0.134 到 0.24 美元買搜尋接地與細節。OpenAI 端用 token 計價,正式放量前先用小批量實測用量,官方也建議用自己的工作量測速度與品質,別人的 benchmark 不一定準。

授權、浮水印與商業使用須知

商業使用的遊戲規則,Midjourney 寫得最細:依服務條款,你在服務中創作的素材歸你所有(在適用法律允許的範圍內),但有兩個例外值得記住:公司或其員工在公司年營收超過 100 萬美元時,必須訂閱 Pro 或 Mega 方案才擁有素材。放大他人的圖像,所有權仍屬原創作者。條款同時保證已創作素材的所有權在降級或取消會員後仍然保留。中小企業與個人賣家在 Basic 方案就能商用,過線的企業則要把方案費算進合規成本。

OpenAI 端,官方說明中心明文表示不會對 API 生成內容主張著作權,來源標記採 C2PA 中繼資料與隱形浮水印,消費端商用前仍須核對現行使用條款。Google 端做得更積極:所有生成圖像都內建 SynthID 浮水印,官方持續把 SynthID 與 C2PA 內容憑證搭配,還把驗證功能做進 Gemini App,自 2025 年 11 月上線以來已被使用超過 2,000 萬次,用來辨識 Google AI 生成的圖片、影片與聲音。若素材要進入對來源敏感的通路(新聞、出版、廣告審查較嚴的平台),先確認對方的 AI 內容政策再投放。

把三家的授權差異壓縮成三個判斷句:看收入,Midjourney 的百萬美元門檻是硬規定,過線就換 Pro 或 Mega。看用途,商用條款各家表述不同,人像、商標與他人素材的侵權責任,Midjourney 條款與 Google 支援頁都明文要求使用者自負。看來源,Google 全程蓋 SynthID、OpenAI 有 C2PA 加隱形浮水印,要進入對 AI 生成內容敏感的通路時,先確認對方的 AI 內容政策。把三句話記住當初步篩選,商用前仍須逐家核對現行條款。

來源標記與使用權,分開核對:來源標記、辨識生成來源、使用條件、核對條款與素材
來源標記有助於辨識生成內容,使用權仍須核對服務條款、素材權利與目的通路規則。兩者處理不同問題,不能互相取代。

年齡與責任邊界順道整理:Gemini App 生成圖像須年滿 13 歲、編輯圖像須年滿 18 歲。Google 支援頁明確提醒,生成圖像時別侵害他人的著作權或隱私權,發布或使用生成內容前先自行斟酌。商品圖還有一條法律紅線要自查:生成的包裝、標籤或場景若出現他人商標、知名角色或未授權的臉孔,責任在使用者身上,Google 的政策頁明文禁止生成侵害他人權利的內容,Midjourney 的條款也把第三方權利列為所有權的但書。上架圖保留生成紀錄與提示詞,發生爭議時才有跡可循。多一道人工檢查,能降低未察覺的問題直接上架的風險。

怎麼選:四個判斷軸對照你的工作流

價格表之外,選擇可以落在四個軸上。速度軸:要在對話裡快速迭代,ChatGPT Images 2.5 的延遲降幅與 Gemini 的 Flash 級速度都是為此設計,Midjourney 把渲染速度的重點放在 V8.1,V8.2 轉向聚焦美學、畫質與個人化,且它的單位是 GPU 時間而非秒數。品質軸:追求最高細節與風格完成度,可以把 Midjourney 的美學定位與 Nano Banana Pro 的推理式專業素材製作能力放在一起比較,前者靠品味累積、後者靠知識接地。編輯軸:反覆改圖、局部替換、多輪保持一致,ChatGPT 與 Gemini 的官方承諾最直接。成本軸:免費起步選兩家助理,預算明確的團隊可以 Midjourney 年繳攤提,API 大量產圖則看每張約當價挑 Gemini 的階梯。

對照幾種常見身分:個人創作者與小賣家,從 ChatGPT 或 Gemini 的免費層開始就夠用,哪個順手用哪個,碰到額度或品質天花板再付費。行銷團隊做素材矩陣,Gemini 的 2K 下載、文字在地化與 API 分級,適合放進評估。設計工作室講究視覺一致性,Midjourney 的個人化與風格參考值得長期投資。開發者做產品內生圖,OpenAI 與 Google 的 API 各有明確價目表與模型分級,按工作量擇優。免費層的取捨也要算清楚:ChatGPT 免費版的圖像生成被定位成受限且較慢,Gemini 免費下載只有 1K,但兩者都足以驗證工作流可行性,先用免費層跑通流程、確認產出符合需求,再把預算押在正確的方案上,比一開始就年繳高階方案穩妥。想再往外看一步的讀者,站上的AI 工具總整理把生圖以外的選項也排好了。

工程面還有一個少被提及的穩定性工具:模型快照。OpenAI 的 API 允許鎖定特定版本的快照,讓效能與行為保持一致,串接生圖的系統在正式環境鎖版本、測試環境跑最新版,可以避免模型默默更新導致輸出整批走鐘的事故。沒有版本鎖定能力的服務,就要靠輸出的自動化品質檢查當煞車。這類工程習慣平常看不出價值,出事的時候就是救命的。

正式鎖定版本,新版先做驗證:正式環境、鎖定版本、新版測試、比較輸出、通過再升級
有快照可用時,正式環境鎖定已驗證版本;新版先在測試環境比較輸出,再決定是否升級。固定版本仍不代表每次圖像完全相同。

混用也是可行的配置方式。一套可採用的分工是:ChatGPT 當日常的快速編輯台,處理照片修改與去背。Gemini 負責資訊型素材與多語文字,以及需要查證真實資料的圖。Midjourney 顧品牌視覺的情境圖與風格資產。三家的輸入都是文字加圖片,真正的成本在於維持一致的提示詞習慣與素材命名,把每個工具的強項固定在流程裡特定位置,比把所有需求塞進單一工具更能兼顧品質與速度。

收尾提醒一件容易被忽略的事:這個領域的版本與價格變動很快,OpenAI 不到一年換了三個代際、Google 一年換了三個品牌名、Midjourney 半年內換了兩次預設版本,動手採購或串接前,把各官方頁當天的數字再讀一次,比任何比較文都可靠。比較框架會過期,核對官方源的習慣不會。

常見問題

常見問題

生圖新手該從哪一家開始?
從免費的對話式入口起步成本最低。ChatGPT 的圖像功能所有方案層級都能用,Gemini App 不訂閱也能生成,兩者都在聊天框裡完成生成與修改。至於 Midjourney,免費體驗不在選項裡,適合已經確定要採用訂閱式獨立工具的人。
Midjourney 有免費方案嗎?
沒有。官方明載四個等級全是訂閱制,最低 Basic 月繳 10 美元,年繳一次付款打 8 折。官方方案表另列有評分圖像賺免費 GPU 時間的項目。
免費帳號一天可以生成幾張圖?
兩家都沒有公佈固定張數。ChatGPT 把生圖、上傳檔案與語音分別計量,碰到上限會通知。Gemini App 則設有五小時與每週兩類用量限制,付費方案提供較高限額,官方也聲明限額可能調整。
做電商商品圖建議選哪一家?
看工作段落分配。實拍商品的乾淨化與單一元素替換,ChatGPT 的官方範例與編輯承諾最對口。要同時餵多張參考圖、在圖內放多語文字,Gemini 官方列出最多 14 張參考圖與可讀文字的圖內在地化。憑空打造情境與整批視覺調性,Midjourney 官方把美學、畫質與個人化列為 V8.2 重點。
三家生成的圖片可以商用嗎?
商用授權要逐家核對現行條款。Midjourney 端,年營收逾 100 萬美元的企業體要訂到 Pro 或 Mega,素材才歸自己所有。OpenAI 聲明不對 API 輸出主張著作權。Google 端的生成圖都帶 SynthID 浮水印。對外投放前仍建議自行檢查人物與商標素材。
想用 API 大量產圖,哪一家最省?
以官方每張約當價比較,Gemini 三款現役模型中,Lite 在 1K 解析度單張約 0.0336 美元最低,第二代主力約 0.067 美元一張,跨家成本仍須用實際工作量測試。OpenAI 的 2.5 模型採 token 計價,兩個模型的圖像 token 費率相同,先小批量實測再放量。Midjourney 未列入 API 計價比較,介接需求要先和官方確認當下的可用方式。
台灣可以使用這三家服務嗎?
Gemini 的 Google AI Pro 和 Ultra 可用國家清單包含台灣,圖像功能則隨 Gemini App 的開放範圍走。ChatGPT 與 Midjourney 的實際功能與付款方式以各服務當下顯示為準,付費前可先完成一次註冊與試生成。

主題聚落|AI 內容與設計工具 看「AI 搜尋、GEO 與 AI 工具」中樞 →

相關文章

Whoops 巫普斯科技有限公司

專注技術 SEO、GEO/AEO 與 AI 搜尋實務。本站文章以可驗證資料、公開來源與實作觀察整理而成。

關於 Whoops編輯守則服務內容

想把這篇的方法用在自己的站上?

SEO 健檢、GEO/AEO 引用優化、網頁設計諮詢——把文章裡的方法落地到你的網站。