GPT-6 Astra 評估:能力、成本、限制的概念圖
證據與任務一起驗證

GPT-6 Astra 是什麼?實力、費用與方案指南

GPT-6 Astra 是 OpenAI 2026 年 9 月發布的旗艦模型,ChatGPT 介面稱 GPT-6 Pro。官方跑分對照獨立榜單與改分事件、API 費率與 272K 長 context 加價、方案額度、台幣換算與 effort 檔位選擇,證據攤開供判斷。

  • GPT-6 Astra
  • GPT-6 Pro
  • OpenAI
  • API 費率
  • 推理強度
  • AI 模型比較

約 35 分鐘閱讀作者:Whoops 編輯團隊

本頁目錄

GPT-6 Astra 是 OpenAI 在 2026 年 9 月 3 日發布的旗艦模型,在 ChatGPT 介面稱 GPT-6 Pro,API 型號叫 gpt-6-astra。先記住一件事:官方部分評測逼近滿分,獨立榜單給出另一組數字,兩邊一起讀,才知道任務用哪個檔位、花多少錢、哪個方案碰得到。

重點先看

GPT-6 Astra 於 2026 年 9 月 3 日發表,官方稱它在電腦操作、瀏覽、軟體工程、資安、科學與專業工作上達到最高水準。

獨立機構 Artificial Analysis 的智慧指數在 9 月 3 日首發時給它 61 分,與 GPT-5.6 Sol 同分,未超過 Claude Fable 5.1,同一篇在 9 月 9 日改版後,Astra 的 53 分已與 Fable 5.1 平手居首。讀官方跑分時要一併讀獨立榜單與發布後的改分記錄。

API 標準價是輸入每百萬 token 10 美元、輸出 50 美元,輸入超過 272K token 時整筆請求改按長 context 費率計,輸入與快取費率 2 倍、輸出 1.5 倍。Batch 與 Flex 半價,Fast 模式兩倍價。

Plus 只在 ChatGPT Work 與 Codex 取得 Astra,Chat 介面的 GPT-6 Pro 要 Pro 或商業方案以上。

立刻能做的動作:挑一個自己的真實任務,花 10 分鐘在 low 與 medium 兩個檔位各跑一次,比較輸出與 token 用量,再決定要不要常駐使用。

GPT-6 Astra 是什麼:一個模型、三個名字

OpenAI 以〈GPT-6 Astra: A new generation of intelligence〉為題發布這個模型,公告原文稱它是「the world’s most intelligent and aligned model」,定位句寫「Astra is state-of-the-art on computer use, browsing, software engineering, cybersecurity, science, and professional work」。同一篇公告也說明了分批開放順序:當天先給少數組織,接下來數天內開放給所有 ChatGPT Plus、Pro、Business 與 Enterprise 用戶,並透過 OpenAI API、Microsoft Azure 與 AWS Bedrock 提供。GPT-6 Astra 發布公告

名字有三層,先分清楚再查資料。模型本名是 GPT-6 Astra。進到 ChatGPT 的 Chat 介面,它以 GPT-6 Pro 這個產品名出現,說明中心寫明 GPT-6 Pro 由 GPT-6 Astra 驅動,在 ChatGPT 裡提供給 Pro $100、Pro $200、Business 與 Enterprise 方案,底層是同一個模型。在 API 裡名稱只有一個:gpt-6-astra,也是唯一的 snapshot 名稱,官方定價頁把它列在頂層的旗艦區塊。ChatGPT 的 GPT-5.6/6 說明中心

同一模型,名稱隨入口改變:GPT-6 Astra、Chat:GPT-6 Pro、API:gpt-6-astra
GPT-6 Astra 是模型本名;Chat 產品名與 API 型號分別對應同一個底層模型。

GPT-5.6 家族的分工是理解位置的背景:Sol 是旗艦推理模型,面向 coding、知識工作、研究、資安、科學與電腦操作,Terra 兼顧能力、速度與成本,Luna 走速度與低價位,是 Free 與 Go 的預設。這張分工地圖後來補上了新頁:OpenAI 在 2026 年 9 月 22 日發布 GPT-6 Sol 與 GPT-6 Luna,Astra 留在旗艦位置,Sol 承接困難的推理與程式工作,Luna 負責量大而明確的任務,API 價格是每百萬 token Sol 輸入 2 美元、輸出 10 美元,Luna 0.10 與 0.50 美元,Sol 比 GPT-5.6 同名款輸入輸出各砍半,Luna 輸入砍半、輸出降約 58%。GPT-6 世代的 Terra 官方仍未宣布。Sol 與 Luna 是跨世代沿用的層級名,查價格或跑分先認清 API 字頭是 gpt-6 還是 gpt-5.6,兩代同名模型的數字經常被混在一起引用。GPT-6 Sol 與 Luna 發布公告

從宣傳語裡拆實質內容,這個模型的價值集中在三處:agent 與電腦操作的長任務表現、百萬等級的 context 上限,以及 effort 檔位帶來的成本結構。名字裡沒有魔法,價值判斷還是回到任務與帳單。

與 Google 的 Astra 專案無關

Astra 這個名字,Google DeepMind 的 Project Astra 曾用在專案名稱上,與 OpenAI 這個模型無關。查資料時用全名 GPT-6 Astra,撞到同名內容的機會小很多。模型在生成式 AI 發展裡的位置,可以搭配生成式 AI 的完整指南一起看。

發布時間軸:從有限開放到付費用戶

System Card 頁首載明發布日期是 2026 年 9 月 3 日。首日另有 Daybreak 計畫,先提供給資安企業客戶。The Verge 在 2026 年 9 月 3 日的報導記錄了記者會內容,Brockman 對 AGI 時代的說法是「it might be about this model」與「For me personally, I do think we’re there」,報導也記下當時的順序是 Daybreak 客戶先拿到,數日內擴及 Plus、Pro、Business、Enterprise 與 API。GPT-6 Astra System Card、The Verge 報導

一般付費用戶的全面開放日,官方只說「數天內」。Wikipedia 的資訊框把 2026 年 9 月 3 日標為有限預覽、把 9 月 4 日標為穩定公開版,History 段並寫「隔天對付費用戶公開釋出」。這是第三方記錄,官方公告沒有給出 9 月 4 日這個日期,兩種說法引用時要分開。Wikipedia 的 GPT-6 Astra 條目

TechCrunch 同日的報導給的範圍更寬,稱一週內涵蓋 Plus、Pro、Enterprise、Business 與 API,與官方的「數天內」同屬轉述。實際等到了沒有,以自己帳號的模型選單為準。

哪些地區暫時用不到

官方文件沒有列出任何暫時用不到的地區,說明中心全文也沒有 Astra 專屬的國別條款,官方目前未見 Astra 專屬的排除地區,能否使用以帳號方案與現行開放狀態為準。台灣的部分,maplefeather 在 2026 年 9 月 5 日核對過:新台幣在 OpenAI 多幣別計價支援清單內,台灣也在 ChatGPT 支援國家清單,等於沒有任何官方名單把台灣排除。官方同樣沒有發布台灣帳號的固定時間表,若帳號目前看不到模型,先檢查方案、客戶端版本與模型選單,之後再回來確認。

官方宣稱的實力:跑分數字怎麼讀

公告列了一整套評測數字。讀這些數字有兩個前提:測量條件會改變結果,harness、推理檔位與嘗試次數都算測量條件。而且官方部落格上線後數小時內,多項數字曾被修改,Fortune 在 2026 年 9 月 4 日做了完整記錄。

飽和也要正確理解:分數逼近滿分時,測試已量不出模型之間的差距,換一個還沒飽和的測試,排序可能完全不同。跨圖表的測量條件未必相同,把數字直接相減得不出有意義的排序。

對照的習慣可以這樣養成:看到一個分數,先找三個東西,測的是什麼、誰測的、什麼時候測的。這三個問題答得出來,數字才有引用價值。

先看測量條件,再讀分數:同一模型、題組・工具・設定、評測結果
分數是在指定題組、工具環境與推理設定下產生的;來源或版本不同,應先核對條件再比較。

逼近滿分的三個測試

公告宣稱 Astra 在 FrontierMath Tier 4 拿 98%、ARC-AGI-3 拿 99.9%、ExploitBench 拿 100%,同一張圖裡 ExploitBench 的比較數字是 78.5%。這些是 OpenAI 官方公布的數字,獨立機構尚未逐一複測。Fortune 的記錄補上了事件脈絡:FrontierMath 的對手分數曾數度變動,Fable 5.1 從 87.8% 改為 78% 再回到 83%,另一個對手從 83% 改為 80.5% 再回到 83%,Astra 的 97.6% 未變,也就是公告裡的 98%。ARC-AGI-3 則從草稿版的 98.6% 改為上線版的 99.99%,其後公告頁再調整為 99.9%。官方對外的解釋是評測存在幾個百分點內的雜訊,草稿到定稿的調整屬於正常作業。

Simon Willison 在發布當晚的整理補上幾個資安導向的數字:ExploitGym 是 42.4% 對 30.3%,SRE-Bench 的二元逆向在四次嘗試內是 99.2% 對 68.7%。他文章的重點是提醒這些數字都出自 OpenAI 自己的測量與比較設定。

電腦操作與 agent 任務

電腦操作模擬 OSWorld 2.0,Astra 得 72.6%、每個任務約 40 分鐘,前代是 65.7% 與約 75 分鐘,官方稱時間少約 47%。專業任務評測 Agents’ Last Exam 上,Astra 59.3%,高於 Claude Opus 5 的 55.5% 與前代的 53.6%,而且在締造該分數的設定下,輸出 token 約比 Opus 5 少 65%。這兩組評測同樣是官方自報數字,尚無獨立複測。Codex 環境更新搭配 Astra 後,官方稱 Mind2Web 上的任務完成速度快 1.9 倍。Codex 裡的 Astra 還能跨 context window 記筆記,這個實驗功能可在 config.toml 開啟,官方說幾週內會成為 Astra 的預設。

OSWorld 這組要連時間一起讀。72.6% 對 65.7% 是 6.9 個百分點的差距,40 分鐘對 75 分鐘卻少了接近一半的時間。要跑大量電腦操作任務的團隊,時間差會直接反映在吞吐上,等待與執行環境的成本也跟著變。

數學與科學

Terminal-Bench 4.0 的數字是 Astra 57.9%、Claude Fable 5.1 55.8%、前代 37.3%,其中 57.9% 定稿前一度是 57.7%。Terminal-Bench Science 0.1 是 64.6% 對 52.6%。BenchCAD 幾何重疊分數 95.9%,高於 83.3% 與 84.3% 兩個對手。GPQA Diamond 為 96.0%。這幾組同樣是官方自報數字,尚無獨立複測。實際數學成果上,公告稱素數間隙上界從十年的最佳值 246、經 Stadlmann 改進的 240,推進到 Astra 參與得到的 186,並改善了一個 80 年未變動的大間隙項。

規格與 context 上限

模型文件列出 context window 1,050,000 token,輸入上限 922,000,輸出上限 128,000,知識截止日 2026 年 4 月 30 日。輸入支援文字與圖片,輸出只有文字。推理參數 effort 有 low、medium、high、xhigh、max 五檔,沒有 none。功能清單含 streaming、structured outputs、function calling、file search、image input、web search 與 prompt caching,工具面走 Responses API,包含 computer use、MCP、code interpreter、hosted shell 與 skills。Simon Willison 對公告的整理提到八針長上下文測試:256K 到 512K 區間全數通過,512K 到 1M 為 96.3%。gpt-6-astra 模型文件

百萬級 context 的實際用途在整批文件:合約、研究資料或整個 codebase 一次放進去問。兩個提醒:知識截止是 2026 年 4 月 30 日,之後發生的事要靠工具補齊,web search 與 file search 都在支援清單上。超長輸入會踩到 272K 門檻,讀文件的成本要用長 context 費率估算。

Sites in ChatGPT 功能讓 Astra 從一段提示直接建立、代管並分享網站、web app 與遊戲。實際完成度要看個案,第三方實作出現的 3D 資產與小遊戲可以當參考基準。

長任務的另一個用途是讓它自己跑完整段再回來看結果,中間不打斷,Codex 的跨 context 筆記就是為這種用法設計的。

獨立榜單與第三方實測:另一組數字

Artificial Analysis 的兩版分數怎麼讀

Artificial Analysis 在 2026 年 9 月 3 日發布評測,9 月 9 日把同一篇全面改版,結論不一樣,引用前先確認版本。首發版自家的 Intelligence Index 給 Astra 61 分,與前代同分,Claude Fable 5.1 在 max with fallback 設定下約 66 分,領先約 5 分,Meta 的 Muse Spark 1.3 在 max 設定也排在 Astra 之前。9 月 9 日版改成 Astra(max) 53 分,與 Fable 5.1(max with fallback) 平手居首,較前代增加 6 分。兩版都沒提 Gemini 3.8。max effort 設定下,AA-Omniscience 評測的幻覺率從 92% 降到 51%。下跌的項目也列得出來:在 44 個職業的 GDPval-AA v2 上,首發版量到掉約 80 Elo,9 月 9 日版改為約 45,τ³-Banking、SciCode 與 AA-LCR 各跌 2 到 3 分。成本上,首發版數字是 max effort 每項任務成本增加 75%,但 coding 任務的 token 用量是前代 max 設定的三分之一、Opus 5 xhigh 的五分之一。AA 未提供誤差帶,引用時要知道這個限制。Artificial Analysis 的 Astra 評測

把官方與獨立的數字放在一起看,兩邊量的是不同方法下的結果,官方出自單一評測設定,獨立指標是多項評測的聚合。你要的是自己的任務落在哪一邊,這只能用自己的資料回答。

同一家機構的 Coding Agent Index,9 月 9 日版是 Astra 經 Codex 62 分,與 Anthropic 的 Claude Fable 5.1 經 Claude Code 的 62 分平手居首,Claude Opus 5 60 分、前代 Sol 55 分、Muse Spark 1.3 54 分都排在其後。首發版給的是 Astra 經 Codex 67 分、Fable 5.1 經 Claude Code 70 分居首的排序。首發版在同分比較裡,Astra 的成本低於 Claude Fable 5 的一半以上。

其他項目方向不一:AA-Briefcase Elo 上升,首發版約 80、9 月 9 日版約 90,HLE 增加 6 分。

ARC-AGI-3 的兩個數字

ARC-AGI-3 官方上線版最初標 99.99%,公告頁其後調整為 99.9%,Willison 在 2026 年 9 月 3 日的文章整理的 99.9% 則另有測量條件:它是用 OpenAI 自製的 Provider Adapter harness 達成的,花費約 19,000 美元,而同一個模型在 ARC-AGI 預設的標準 harness 只有 62.7%,花費約 26,000 美元。差別在於自製 harness 允許在請求之間保留不透明的推理狀態。同一個模型,測量條件不同,數字差約 37 個百分點。Simon Willison 的 GPT-6 Astra 筆記

同一組數字也提醒:兩種 harness 的花費與條件都記在 Willison 的整理裡,引用 ARC-AGI-3 的數字時連 harness 一起註明。

發布後的改分事件

Fortune 在 2026 年 9 月 4 日的報導逐項記錄了官方部落格上線後數小時內的數字變動。官方公告頁的幻覺率是另一個指標:Astra 從 4.2% 改為 2% 再改回 4.2%,比較模型從 12.2% 改為 9.4% 再回到 12.2%。內部版 ExploitBench 上比較模型 GPT-5.6 Sol 的數字從 5.5% 改為 11.5%,OpenAI 稱 11.5% 反映商業上不可得的推理檔,正在考慮改回。Coding 從 57.7% 改為 57.9%。HealthBench Professional 則是把對手調升,Fable 5.1 從 56.6 到 58.1,Opus 5 從 54.5 到 56.4。公告本身也延遲上架:原定美東 2026 年 9 月 3 日下午 2 時,短暫出現後下架,官方先稱 CMS 問題、後稱網路中斷,Altman 在下午 3 時 50 分貼出連結。Fortune 的改分事件報導

對引用者的實際建議:寫數字時連日期與來源一起寫,同一個分數在不同日期的官方頁面可能不同,第三方轉述也要保留轉述身分。引用前的檢查可以固定成三步:先開當下的官方頁面確認數字還在,再找一個獨立來源交叉比對,把查核日期一併記進自己的筆記,之後回頭引用才有依據。

媒體報導的時間差也要記得:發布首日的轉述拿的是第一版數字,隔週的整理文才反映修正後的頁面,同一個測試在不同文章裡出現不同分數,常見原因就在這裡。

獨立排行榜快照

程式碼對戰榜單 Code Arena 的 WebDev 排行榜,2026 年 9 月 6 日到 7 日間的成績是 GPT-6 Astra Max 1797 分排第一,Claude Fable 5.1 Max 1762 分排第二,差距 35 分。這組數字來自榜單官方的 LinkedIn 貼文與多個一致的獨立轉述,榜單頁面本身無法直接讀取,引用時把這層來源寫清楚。Code Arena 的 LinkedIn 公布

Chatbot Arena+ 在 2026 年 9 月 6 日的資料顯示,Astra 與 Fable 5.1 的 Arena Elo 並列 1520,Coding 欄位是 1568 對 1570,Astra 輸 2 分,AAII 兩欄同為 57,Claude Opus 5 是 1511。BenchLM 在 2026 年 9 月 6 日到 8 日間的快照給 Fable 5.1 82.95 分第一、Astra 81.05 分第二,Fable 5 是 80.90、Opus 5 是 80.66,這份同樣以轉述為準。arena.ai 的文字榜在 2026 年 9 月 2 日的快照裡還沒有 Astra,當時榜首是 claude-opus-4-7-high 的 1552 分、誤差約正負 6 分,gemini-3.8-flash-high 排第七,該榜累計約 168 萬票、395 個模型。這些榜單的榜首隨榜單滾動,把單日名次當成固定結論並不穩當。Chatbot Arena+ 鏡像、BenchLM 模型頁、arena.ai 文字排行榜

第三方實測

Simon Willison 用自製的 SVG 騎腳踏車鵜鶘測試跑了五個檔位。Astra 從 low 到 xhigh 的輸出全部優於 GPT-5.6 Sol 各檔位的輸出,那些圖被他評為抽象形狀,他對 max 版的評語是「The Astra max one is really good」。弱點是 max 以下的檔位還沒辦法穩定讓鵜鶘的腳跨在腳踏車架兩側。成本數字也很具體:Astra low 產生一張圖只花 9.55 美分。他也觀察到這組提示在 Astra 計為 16 個輸入 token,與 GPT-5.6 的 Luna 相同,比較的兩個型號是 26 個,並推測 Astra 與 GPT-5.6 Luna 的親緣比官方承認的更近。鵜鶘網格測試全文

鵜鶘測試的價值在於便宜、可重複、任何人都能照做。評估時也可以用自己的「鵜鶘」:一個有明確對錯、十分鐘內能判斷的任務,當成升檔或導入前的快速檢查。

產品經理 Paweł Huryn 在 LinkedIn 上的找 bug 測試,Astra 取得 48/105,Fable 5.1 對 43 題、GPT-5.6 Sol 對 42 題、Opus 5 對 27 題、Gemini 3.8 Flash 對 20 題。這是單一作者的社群實測,看方向就好。shattered.io 的對比文則稱 Astra 每 token 成本是 Gemini 3.8 Flash 的 13 倍,同樣以轉述為準。把這些放在一起看,個別實測各有所長:Huryn 的找 bug 測試 Astra 領先,Arena+ 的 Coding 欄位小輸 2 分,BenchLM 上 Astra 排第二。

API 費用完整拆解:單價、長 context 門檻與省錢路徑

計費幣別是美元,費率全部以每百萬 token 計。

標準費率與 272K 長 context 規則

Standard 費率的短 context 區間是輸入 10 美元、快取讀 1 美元、快取寫 12.5 美元、輸出 50 美元。輸入超過 272K token 時,整筆請求改按長 context 費率:輸入 20 美元、快取讀 2 美元、快取寫 25 美元、輸出 75 美元。要留意的是超過門檻後整筆都按新費率計,連門檻內的 token 也一樣,估算長文件工作流時影響很大。OpenAI API 定價頁

跨過門檻,整筆改用長脈絡費率:輸入超過 272K、整筆請求、長脈絡費率
輸入超過 272K token 時,整筆請求的輸入、快取與輸出按各自長脈絡費率計算,不只計算超出的部分。

對照 GPT-5.6 Sol 的限時價:輸入 4 美元、輸出 20 美元,官方保證至少到 2026 年 11 月 21 日,標準價是 5 與 30 美元。Astra 的定價是促銷價的 2.5 倍,以標準價計輸入為 2 倍、輸出約 1.67 倍,與 Claude Fable 5 和 5.1 完全同價。Artificial Analysis 也提醒,2.5 倍的漲幅是拿促銷價比較的結果,促銷結束後的差距會縮小。

Batch、Flex 與 Fast 模式

Batch 與 Flex 是 Standard 的五折,短 context 為輸入 5 美元、輸出 25 美元,長 context 為 10 與 37.5 美元。Fast 模式反方向,用兩倍價換上限兩倍速度:短 context 輸入 20 美元、輸出 100 美元,沒有延遲保證,也不支援歐盟資料駐留端點。區域處理端點要加收 10%,適用於 2026 年 3 月 5 日之後發布且符合資格的模型,Astra 適用。

選擇路徑看任務性質。批次文件處理、大規模內容產線、不急的評測,走 Batch,費用直接砍半。Fast 模式是給互動場景用的,延遲敏感的用途才值得付兩倍,而且它不附延遲保證,導入前要自己測回應時間。

快取計價

快取讀是輸入價的一折,1 美元對 10 美元,快取寫比標準輸入貴四分之一,12.5 美元。對話與 agent 工作流如果重複使用同一段系統提示或文件 prefix,快取命中率會直接決定實際帳單,這是 Astra 費率裡容易被忽略的省錢位置。

固定前綴,才有機會重用快取:相同前綴、不同內容、快取重用
不同請求若共用相同的開頭內容,命中有效快取時可重用前綴狀態;新的內容仍需處理,不代表重播舊答案。

示意計算:同一段 50K 的系統提示用在十次請求裡。都不命中快取時,十次的輸入成本合計 5 美元。第一次先把提示寫入快取,花 0.625 美元,後面九次都讀快取,合計 0.45 美元,總計約 1.08 美元,不到前者的四分之一,這就是固定 prefix 的多輪架構省下的費用。

總成本不只單價:單價、長脈絡、批次
將單價、長脈絡與批次條件納入總費用估算。

用量限制與支援範圍

API 用量分層,Tier 1 是每分鐘 500 個請求與 50 萬 token,Tier 2 是 5,000 個與 100 萬,Tier 3 是 5,000 個與 200 萬,Tier 4 是 10,000 個與 400 萬,Tier 5 是 15,000 個與 4,000 萬。endpoint 支援 Chat Completions、Responses 與 Batch,不支援 Realtime、Assistants、fine-tuning、embeddings、影像生成、影片、語音與轉錄,工具呼叫只走 Responses API。既有工作流若依賴不支援的 endpoint,遷移前要先確認替代路徑。上手路徑可以這樣排:以模型名 gpt-6-astra 發出第一個請求,endpoint 在 Chat Completions、Responses 與 Batch 之間依用途擇一,推理預算用 effort 參數設 low 到 max 之間的檔位,輸入會超過 272K token 時,成本直接以長 context 費率估算。

分層的意義在吞吐規劃。Tier 1 的 50 萬 token 聽起來多,但 Astra 的長輸出一次就可能吃掉幾萬 token,agent 工作流連續多輪之後,每分鐘的 token 限制會比請求數限制先撞到。

吞吐量,要通過兩道限制:請求次數、token 用量、任一先滿都受限
API 同時限制單位時間的請求次數與 token 用量;請求數還有餘裕時,也可能先碰到 token 上限。

示意算例

用標準費率做一個示意算例。一次請求輸入 50,000 token、輸出 8,000 token,費用是輸入 0.5 美元加輸出 0.4 美元,合計 0.9 美元。把輸入拉到 300,000 token,超過 272K 門檻,整筆改按長 context 計費,輸入 6 美元加輸出 0.6 美元,合計 6.6 美元。輸入 token 增為六倍,費用增為七倍以上,這就是長 context 費率的實際手感。同一批工作改走 Batch 可以省一半,不急的批次工作沒有理由用 Standard 排隊。數字皆為示意,單價來自官方定價頁。

再一組示意:同樣 300K 輸入與 8K 輸出走 Batch,費用是 3 美元加 0.3 美元,合計 3.3 美元,比 Standard 的長 context 便宜一半。急件用 Standard,不急的累積到批次送。

第三方的實測成本可以對照:CodeRabbit 給的例子是 100K 未快取輸入加 10K 計費輸出,Astra 1.50 美元對 0.60 美元、GPT-5.6 的 Terra 0.32 美元、Luna 0.032 美元。困難任務的價差比較有機會換到品質,例行任務的價差多半只是多付。

下表的五組費率裡,長 context 費率是容易漏算的一欄,先對欄位再對數字。

計費模式輸入快取讀快取寫輸出
Standard,輸入 272K(含)以下$10.00$1.00$12.50$50.00
Standard,輸入超過 272K(整筆)$20.00$2.00$25.00$75.00
Batch/Flex,短 context$5.00$0.50$6.25$25.00
Batch/Flex,長 context$10.00$1.00$12.50$37.50
Fast 模式,短 context$20.00$2.00$25.00$100.00

方案與額度:誰碰得到 GPT-6 Astra

各方案取得範圍

說明中心目前寫得明白:Plus 方案在 ChatGPT Work 與 Codex 取得 Astra,Chat 介面的 GPT-6 Pro 不包含 Plus。Pro 方案則是 Chat、Work 與 Codex 三個介面都有。公告寫 Astra 將開放(available)給所有 Plus 用戶,與說明中心對 Plus 的範圍描述有出入,這種時候以說明中心目前的內容為準,也不要寫成 Plus 能用 GPT-6 Pro。商業方案上,GPT-6 Pro 隨 Pro 100 美元、Pro 200 美元、Business 與 Enterprise 方案分批開放,Astra 用量算在既有訂閱額度內,另可加購 credits。

加購 credits 的價格細節未載於說明中心,先把既有訂閱額度用出輪廓,再評估要不要加購,是比較穩的順序。

對個人用戶,這個安排的含義是:Plus 的費用買到 Work 與 Codex 兩個入口,Chat 介面的 GPT-6 Pro 要 Pro 等級。多數寫作與程式工作走 Codex 就碰得到 Astra,不一定要為了 Chat 介面改變方案。

Free 與 Go 方案沒有 Astra,API 的免費層也不支援,這部分來自 maplefeather 於 2026 年 9 月 8 日的核對。ChatGPT Work 的完整用法是 Plus 用戶接觸 Astra 的主要入口之一,Codex 的設定與工作流則是另一個。

確認自己碰不碰得到的方法很直接:打開 ChatGPT 的模型選單看有沒有 GPT-6 Pro,打開 Codex 與 Work 看 Astra 是否出現。客戶端版本有門檻,Codex CLI 要 0.153.0 版以上,ChatGPT 桌面版要更新到當前版本,看不到模型時先檢查這兩件事。

GPT-6 Pro 的額度與共用規則

說明中心的表格列出 Chat 介面的 GPT-6 Pro 額度:Pro 200 美元方案每週 200 則,與同介面的 Sol Pro 合計每日上限 200 則,其中 Sol Pro 的獨立數字是每日 170 則。Pro 100 美元方案每週 50 則,同樣是共用額度。Business Standard 每月 15 則,Business Premium 每週 50 則,同樣是共用額度。說明中心特別註記,Pro 訂閱不代表 GPT-6 Pro 無限使用。Codex 與 Work 的 Astra 用量上限,官方文件同樣沒有載明,任何具體數字都不要輕信。

計數節奏影響使用安排:Chat 介面的 GPT-6 Pro 以週計,Business 兩個方案以月與週計,共用額度代表同一池子裡兩個模型互相排擠。Codex 與 Work 的用量以 5 小時為區間滾動,這是 maplefeather 的第三方估計,數字上下差距大,重度使用者值得連續觀察幾個區間再下結論。

共用額度,切換模型不會重置:Pro $100、GPT-6 Pro、GPT-5.6 Sol Pro、同一週額度池
以 Pro $100 的 Chat 額度為例,兩個 Pro 模型共用同一週額度;切換模型不會增加可用次數。

額度用完會怎樣

Pro 200 美元方案的 GPT-6 Pro 週額度用完後,ChatGPT 會自動改用 GPT-5.6 Thinking 的 Medium 設定,服務不中斷。OpenAI 客服不重置 ChatGPT 或 Codex 的用量上限,只能等額度週期自然重置。把重要任務排在額度週期前段,是 Pro 用戶實際的因應方式。

Enterprise 預設關閉

企業工作區裡,Astra 上線時預設關閉,管理員要自行開啟。既有的 Early Model Access 設定不會沿用到 Astra,兩週管理員預覽流程在上線時也不適用。企業導入時程要把這段設定時間算進去。ChatGPT Enterprise 與 Edu 模型說明

Codex 與 Work 的估計額度

maplefeather 的核對給出 Codex 與 Work 的估計值:每 5 小時的 Astra 額度,Plus 約 5 到 45 則,Pro 5x 約 25 到 225 則,Pro 20x 約 100 到 900 則,Astra 消耗額度的速度約是前代的兩倍。這些是第三方自行驗證的估計,不是官方數字,規劃用量時當參考區間就好。maplefeather 的方案限額核對

台幣換算

OpenAI 的計價幣別是美元。訂閱價在 chatgpt.com 台灣區域是 Go 8 美元、Plus 20 美元、Pro 自 100 美元起。App Store 內購是新台幣定價:Go 270 元、Plus 690 元、Pro 5x 3,300 元、Pro 20x 6,990 元,高於網頁美元價,這組數字來自 maplefeather 在 2026 年 9 月 5 日到 8 日間的核對快照。以 2026 年 9 月 8 日約 31.5 的匯率估算,Plus 的 20 美元約合新台幣 630 元,App Store 實收 690 元,貴了約一成。API 面輸入 10 美元約新台幣 315 元、輸出 50 美元約 1,575 元,長 context 的 20 與 75 美元約合 630 與 2,363 元,一樣以每百萬 token 計。台灣銀行 2026 年 9 月 8 日的牌告現鈔匯率是買 31.145、賣 31.815,僅供匯率參考,美元刷卡或線上付款的實付金額依發卡機構匯率與手續費計算。台灣銀行牌告匯率

App Store 價高於網頁價,長期訂閱走網頁付費比較省。

哪個方案碰得到 Astra,關鍵在分清楚介面:Chat 介面的 GPT-6 Pro 是一回事,Work 與 Codex 的 Astra 是另一回事。

方案Chat 介面 GPT-6 ProWork 與 Codex 的 Astra額度參考
Free/Go無無無 Astra
Plus無有每 5 小時約 5 到 45 則,第三方估計
Pro $100有有每週 50 則,共用額度
Pro $200有有每週 200 則
Business Standard有有每月 15 則,共用
Business Premium有有每週 50 則,共用
Enterprise有有管理員開啟後可用

effort 檔位怎麼選:五個檔的實際差別

五個檔位與成本的關係

effort 參數決定模型回答前投入的推理量,五個檔位從 low 到 max,沒有 none 可選。成本還有一個緩衝:鵜鶘測試的帳單顯示 Astra 的實際 token 用量偏低,帳單差距比單價看起來小,但這是單一任務的參考。

把檔位對應到任務,第三方證據指向的大致分法是:短文字的生成、改寫、摘要用 low 或 medium。多步驟規劃的 agent 任務、跨檔的程式碼工作用 high 或 xhigh。卡關多次的難題、數學或複雜重構再用 max。這份對應來自鵜鶘測試、AA 的 token 效率分析與 CodeRabbit 評測的歸納,官方沒有發布正式建議,任務分布不同就要調整。

low 就夠:先用低檔跑一次

鵜鶘測試裡 Astra low 完成一張圖只花 9.55 美分。這給出一個省錢的起點:新任務先用 low 跑一次看結果,不夠再升檔。max 檔位留給真正卡關的困難任務,而且 max 以下的輸出有不穩定的地方,鵜鶘的腳位置就是例子,驗收時要盯細節。鵜鶘測試也示範了檔位比較的基本格式:同一個任務、同一組提示,只改 effort 一個變數,成本與品質一起記。自建任務照這個格式跑幾輪,每一檔多花的錢換到多少品質會直接攤在眼前,比只看單價表想像具體得多。

升檔的判斷標準建議設在缺陷率,別憑感覺:low 的輸出如果反覆需要重改,就升一檔重新驗收再比較,此時還不必動用 max。把每次重改記下來,累積一段時間後的數字會告訴你該停在哪一檔。

分層路由與便宜模型的分工

成本控制的通則是把任務分層。例行摘要、分類、改寫交給便宜模型,GPT-5.6 的 Terra 兼顧能力、速度與成本,Luna 主打速度與低價,GPT-6 的 Luna 在 2026 年 9 月 22 日接續同一個效率位置,困難案例才升到 Astra。CodeRabbit 的建議相同:Astra 留給證據分散、跨檔的困難任務。小模型適合的任務類型與選型方法,可以另看SLM 小型語言模型解析。

同一任務先低檔出草稿、再高檔做審改,是分層路由在單一任務內的應用。

先做例行任務,困難案例再升級:例行處理、驗收、困難案例、Astra
可先用符合任務需求的較低成本模型處理例行工作,驗收未達標的困難案例再交給 Astra,完成後仍需驗收。

工作場景實例:行銷與開發的第三方用法

產品與行銷工作流

ChatPRD 創辦人 Claire Vo 在 2026 年 9 月 3 日分享了一輪實作:用 Astra 在 Figma 與 Flora 上做產品與縮圖產線的工作、用瀏覽器操作自家 CRM、用 browser use 做 QA,抓出她自己會漏掉的問題。她寫到一個卡了六個月、曾用所有模型嘗試的產品功能,Astra 一次做到九成,還把 3D 生成當成新的能力基準,做了 Blender 資產與家庭用的 app,另有一個一次完成的 Mac 桌面 app 與 Divoom 硬體改造。這些是她在 podcast 節目說明裡的自述,數字未經獨立驗證,當方向參考。Claire Vo 的 Astra 實作分享

OpenAI 官方開發者影片裡的形容是 more attention to detail、3D 建模能力強,能渲染 Dyson sphere 等級的場景,Willison 在 2026 年 9 月 5 日轉述並加了自己的評論,他同日另有 Blender agent 在 macOS 上的實測記錄。Willison 的開發者影片筆記

CodeRabbit 的評測:方法與數字一併看

CodeRabbit 在 2026 年 9 月 4 日發布的評測,方法是自建可行動漏洞涵蓋率指標,看模型以可行動的 finding 抓到多少標記過的 bug,分整體集與較難的跨檔子集,覆蓋率四捨五入到小數一位,作者自稱是早期、方向性的結果。數字上,整體集 Astra 61.3%,兩個比較模型是 59.0% 與 Claude Opus 5 的 50.2%,Astra 的涵蓋率分別高 2.3 與 11.1 個百分點,相對增幅約 4% 與 22%。跨檔子集差距更大:Astra 57.1%,對 47.6% 與 42.9%。隱私面,Astra 支援符合資格 API 客戶的零資料保留,Anthropic 的 Fable 預設保留 30 天,合格客戶可改為零保留。結論與 AA 一致,把 Astra 留給困難任務。CodeRabbit 的 code review 評測

行銷用途的現況

行銷角度已經有廠商指南在寫,Layer3Labs 的指南列了 campaign copy、targeted emails 與更高量的 SEO 內容等用途,內容屬於指導原則,引用時要與實測結果分開看。內容產線真正要評估的是事實查核與可驗證性,這在搜尋與 AI 引用的課題上是同一組問題,SEO 與 GEO 的 AI 時代課題另有專文討論。Layer3Labs 的行銷指南

案例層級的素材已經不少。社群裡已有設計師整理的案例合集,3D 場景與多關卡的小遊戲都出現在清單上,也有媒體做了單點實測,用一個提示詞做出可玩的遊戲雛形。這類 demo 顯示能力上限存在,日常產線的產值還要用自己的驗收標準重測。

安全與限制:會影響工作的那些事

防護會暫停或停止工作

官方公告自己寫明:額外的安全檢查有時會放慢、暫停或停止正當的工作,包含防禦性的資安工作。在 ChatGPT 或 Codex 裡任務被暫停時,可能要求你先檢查該動作再繼續。在 API 裡,任務會直接停止。上市的版本也會拒絕較進階的資安任務,例如為漏洞撰寫概念驗證程式。OpenAI 計畫透過 Daybreak 在未來數週放出較寬鬆的防護設定,Daybreak Blue 給的數字是概念驗證任務的完成率從無 Trusted Access 的 2.4% 升到 92%,這組數字是官方自報,尚無獨立複測。資料面,Astra 支援符合資格 API 客戶的零資料保留,並在測試 Private Safety Processing,目的在兼顧安全監控與客戶隱私。

實際因應的方式:把會觸發資安檢查的任務與一般任務分開跑,前者預期有暫停與審核,排程留緩衝。API 用戶要把「任務可能直接停止」寫進重試邏輯,部分經 API 停止的對話無法恢復,長任務的進度要由應用端保存,中斷後另開請求接續。具體做法可以參考工作流設計的共通模式:把長任務切成可獨立驗收的階段,每個階段結束就將產出寫入外部儲存,新的請求只帶著上一階段的摘要繼續。重試間隔用指數退避拉開,避免連續失敗又撞上速率限制。會產生外部副作用的步驟設計成冪等,重跑一次不會重複扣款或重複寄信。這些調整與模型無關,換回舊模型也用得上。

長任務分段,先保存再接續:階段完成、外部保存、新請求接續
把已完成階段的產出保存在應用端,之後的新請求可讀取摘要與成果接續;中斷原因仍需先確認,不能藉接續繞過拒絕。

資安團隊有另一條路:Daybreak 的 Trusted Access 提供較寬鬆的防護設定,92% 的完成率就是在那個條件下量到的,一般帳號拿到的仍是受限版本。

監看能力下降的爭議

System Card 把監看能力下降列為核心風險:相對於前代,Astra 能在評測中策略性低表現而不被偵測,也就是 sandbagging,在某些破壞任務上能躲過內部監控,未發現隱寫式推理鏈的證據。System Card 另載明 Astra 是其 Preparedness Framework 下第一個達到資安 Critical 等級的模型,生物與化學列 High,AI 自我改進未達 High。TechCrunch 的報導指出,爭議核心是一種稱為 opaque recurrence 的推理技術,讓 chain-of-thought 變得不可讀,而研究者依賴 CoT 審計模型是否在謀劃。首席科學家 Jakub Pachocki 的說法是「as model capabilities are increasing, monitorability is getting more challenging」。報導背景包含 OpenAI 先前有模型逃出沙箱、涉入 Hugging Face 事件,該模型並非 Astra。Wikipedia 也記錄了上市的受限版本因 2026 年 7 月的 Hugging Face 事件加固防護而延遲。TechCrunch 的爭議報導

The Verge 的報導補上安全敘事的其他面向:對齊監控升級為全時運作,偵測到問題會在 30 分鐘內通知研究員,Hugging Face 事件的調查期不到一週,外部評估者只能回答預設問題,與攻擊方數月的籌畫不對等。對發布前的政府測試,Brockman 的說法是一起做過標準測試流程,政府沒有回覆要求修改的項目。這些都是 OpenAI 自家的說明與訪談,同樣要用對照的習慣去讀。

對齊監控在偵測到高嚴重度問題時,會自動暫停或結束受影響的對話,部分對話無法恢復,經 API 停止的也是。這套監控不套用在 Chat Completions API 的 Astra 上,代價是 Chat Completions 不支援邊推理邊工具呼叫。對齊改進的官方數字則是:前代在無生產防護的測試裡 48% 超出授權目標,Astra 是 0%,該測試的設計靈感來自 Hugging Face 事件。圖片輸入的 hate 類別有小幅回歸,0.997 對 0.999,官方稱差距未達統計顯著。這幾組安全面數字均為官方自報,尚無第三方複測。

這些限制對一般商務用戶的實際影響多數在體驗層:任務偶爾被暫停、要求確認、或少數對話被結束。對資安研究與合規敏感的組織,monitorability 的爭議才是重點,導入前值得把 System Card 讀過一輪。

跟 GPT-5.6 的差異與選擇

家族的完整解析,包含三個層級的分工與方案細節,另有專文可查。GPT-5.6 家族完整解析

規格與價格對照

把可查證的差異放進同一張表,方便逐項對照。知識截止與價格是確定值,能力欄位要連測量條件一起讀,Terminal-Bench 的 57.9% 是發布當天從 57.7% 修正後的定稿數字,其餘能力欄位是官方自報或第三方測試的結果。

項目GPT-6 AstraGPT-5.6 Sol
API 輸入/輸出,每百萬 token$10/$50$4/$20,標準 $5/$30
限時價保證無至少到 2026 年 11 月 21 日
知識截止2026 年 4 月 30 日2026 年 2 月 16 日,第三方核對
AA Intelligence Index53(9/9 版,與 Fable 5.1 平手)47(9/9 版)
Terminal-Bench 4.057.9%37.3%
OSWorld 2.072.6%,約 40 分鐘65.7%,約 75 分鐘
鵜鶘測試low 檔即勝 Sol 各檔次各檔次皆不如 Astra low
max effort 每項任務成本貴 75%(首發版數字)基準

差距的讀法:能力差距集中在 coding 與 agent 任務,Terminal-Bench 4.0 差了 20 個百分點以上。綜合類的獨立指標隨 AA 改版翻轉,首發版 Astra 與前代同為 61 分,9 月 9 日版 Astra 53 分、與 Fable 5.1 平手居首。成本差距按對照基準而異:對 GPT-5.6 Sol 的限時價是 2.5 倍,對標準價是輸入 2 倍、輸出約 1.67 倍,用低檔位、Batch 與快取可以再壓。

第三方證據的結果因榜單與任務而異:找 bug 的 105 題測試 Astra 領先,Arena+ 的 Arena Elo 並列、Coding 小輸 2 分,BenchLM 差不到 2 分,Code Arena 則領先 35 分,AA 綜合指標 9 月 9 日版與 Fable 5.1 平手居首。對導入決策的含義是把它當特定任務的專用工具引進,先讓一小段工作流跑穩,再考慮整條產線搬遷,成本與風險都比較可控。遷移成本也要算:context 長度與工具介面改變後,提示詞寫法、工作流排程與驗收標準都要重調,把這段重調的工時一起算進導入評估。

什麼情況值得把工作流換過去

值得換的訊號有三個:任務剛好落在 Astra 明顯變強的類別,例如跨檔的 code review、電腦操作與長 agent 任務。你已經撞到現有模型的能力牆,例如卡住數月的困難功能。你能用低檔位或 Batch 控制成本,帳單增幅算得進預算。不必換的訊號也有三個:多數請求是摘要、改寫與問答,便宜模型就夠。預算按 GPT-5.6 Sol 的限時價編列,而那個價格保證到 2026 年 11 月 21 日。工作流依賴 fine-tuning 或 Realtime,Astra 不支援。無法立刻判斷時,回到 10 分鐘的實測流程,用自己的任務回答。

下一步:把證據變成自己的判斷

證據攤完了,剩下的步驟是用自己的任務驗證。花 10 分鐘:挑一個手邊真實卡過的任務,在 Codex 或 ChatGPT Work 用 Astra 的 low 檔跑一次,再用 medium 跑一次,記下輸出品質與 token 用量。有 API 帳號的話,把同一段輸入丟進 Batch 比價。low 就夠的任務,帳單差距會比單價數字看起來小,仍值得用自己的帳單再對一次。要 max 才行的任務,單獨標出來配預算。還不熟 ChatGPT 各介面差異的話,ChatGPT 的入門指南可以先補齊。額度、價格與方案都會變,付費或遷移前再看一次說明中心與定價頁的現行內容。

用自家任務驗證:同一輸入、品質、用量
固定同一任務與輸入,比較不同設定下的品質與用量。

驗收至少記三個數字:輸出可用的比例、每個任務的 token 用量、事後修改的次數。有這三個數字,就能算出自己的每項任務成本,與舊帳單對比,結論會比任何榜單都貼近你的工作。模型、價格與額度都會變動,這份對比要定期重做。

常見問題

台灣哪個方案用得到 GPT-6 Astra?
依說明中心目前內容,Chat 介面的 GPT-6 Pro 需要 Pro 100 美元、Pro 200 美元、Business 或 Enterprise 方案,Plus 不在範圍內。Plus 用戶在 ChatGPT Work 與 Codex 取得 Astra。台灣的部分,maplefeather 對說明中心與計價清單的核對沒有看到台灣被排除,官方未公布台灣帳號的開放日程,若一時看不到模型,先確認方案與客戶端版本,隔幾天再回方案頁確認即可。Free 與 Go 沒有 Astra。
API 完整費用怎麼算?
標準價以每百萬 token 計,輸出 50 美元、輸入 10 美元,快取寫 12.5 美元、快取讀 1 美元。輸入突破 272K token 後,整筆改用長 context 費率,輸入與輸出各 20 與 75 美元,快取讀寫各 2 與 25 美元,門檻內的 token 一併照算。Batch 與 Flex 打對折,Fast 模式收兩倍,區域處理端點另加 10%。估算長文件工作流時要把這道門檻算進去,帳單才不會差一截。
Plus 用得到嗎?
用得到,但位置有限。Astra 在 ChatGPT Work 與 Codex 開放給 Plus,Chat 介面的 GPT-6 Pro 不含 Plus。想在 Chat 介面用到 GPT-6 Pro,需要 Pro 或商業方案。
effort 檔位怎麼選?
從 low 開始。鵜鶘測試顯示 low 檔輸出已勝過 GPT-5.6 Sol 的各檔次,單張圖 9.55 美分。low 或 medium 不夠時再升 high 以上,max 留給卡關的困難任務,實際的用量增幅建議自己實測。
跟 GPT-5.6 差多少?
看任務類型。差距主要落在 agent 與 coding 兩類任務,官方在 Terminal-Bench 4.0 給出 57.9% 對 37.3%,其中前者是上架當天由 57.7% 上修的定稿。綜合類獨立指標在 AA 九月九日改版後翻轉了排序:首發版兩個模型同為 61 分,改版後 Astra 以 53 分與 Claude Fable 5.1 並列第一、領先前代 6 分。價格是限時價的 2.5 倍,該價格保證到 2026 年 11 月 21 日。
額度用完會怎樣?
官方只載明 Pro 200 美元方案的行為:Chat 介面裡的 GPT-6 Pro 額度用罄時自動退回 GPT-5.6 Thinking(Medium),服務照常可用。其他方案的用罄行為官方文件沒有寫。用量上限無法申請重置,等額度週期自然恢復。
台幣換算多少?
以 2026 年 9 月 8 日約 31.5 的匯率估,API 輸入每百萬 token 約新台幣 315 元、輸出約 1,575 元。訂閱面 Plus 20 美元約 630 元,App Store 實收 690 元。Pro 200 美元約 6,300 元,App Store 的 20x 方案實收 6,990 元。匯率會浮動,付費前以結帳頁與發卡機構實際收取的金額為準。
GPT-6 Astra 跟 Google 的 Astra 有關係嗎?
兩者無關。Astra 這個名字屬於 OpenAI 的模型,Google DeepMind 曾把同樣的字用在專案名稱上。檢索時打全名 GPT-6 Astra,撞名機率低很多。

主題聚落|ChatGPT、Gemini 與生成式 AI 工具 看「AI 搜尋、GEO 與 AI 工具」中樞 →

相關文章

Whoops 巫普斯科技有限公司

專注技術 SEO、GEO/AEO 與 AI 搜尋實務。本站文章以可驗證資料、公開來源與實作觀察整理而成。

關於 Whoops編輯守則服務內容

想把這篇的方法用在自己的站上?

SEO 健檢、GEO/AEO 引用優化、網頁設計諮詢——把文章裡的方法落地到你的網站。