ChatGPT語音使用指南:自然互動、工具協助、使用條件
按對話需求選擇語音入口

ChatGPT 語音模式怎麼用?Live 與進階語音教學

ChatGPT 語音模式分成 Live、進階語音與標準語音三個入口。這份指南說明 GPT-Live 的全雙工與背景委派、各方案滾動 24 小時額度、Agora 延遲實測數字、台灣口音的證據現況與功能限制地圖,教你依任務選對入口。

  • ChatGPT 語音模式
  • GPT-Live
  • Advanced Voice Mode
  • 標準語音
  • 語音使用額度
  • 即時語音互動

約 31 分鐘閱讀作者:Whoops 編輯團隊

本頁目錄

ChatGPT 的語音模式現在分成三個入口。2026 年 7 月初推出的 GPT-Live 在設定裡叫 Live,是能同時聽與說的全雙工體驗。原本的進階語音還在。更早的標準語音逐回合運作,先把你的話轉成文字再回應。打開 App 或網頁點語音圖示就能開始,Plus 以上方案預設使用 GPT-Live-1 模型,Go 與免費版使用 GPT-Live-1 mini。

重點先看:三個入口分別是 Live、進階語音與標準語音,在設定裡的 Voice 選單切換,Live 是官方現行的語音體驗。

官方限額以滾動 24 小時計算。Go 用 mini 3 小時,Plus 用 GPT-Live-1 3 小時,100 美元 Pro 層 15 小時,200 美元 Pro 無上限。免費版有限使用 mini,官方未公布數字。

第三方實驗室 Agora Media Lab 在 2026 年 7 月量到整體約 1.1 秒開始回應,贏的地方在穩定度。插話後讓出說話權的速度慢了 498 毫秒,這是官方行銷沒提的退步。

台灣口音只有社群回報,沒有媒體級實測,繁中的官方文件則已齊備。

現在花十五分鐘就能做:更新 App,把 Voice 切到 Live,講一段對話測口音與插話,順手把 Language 設成主要使用的語言。

開啟語音模式:手機、網頁與桌面版

切換位置與漸進推出

切換的官方路徑是 Settings → Voice,在 Live、Advanced、Standard 三個選項裡選一個,OpenAI 支援中心的語音總覽列出同樣的步驟。選單裡看不到某個選項時,可能與方案、地區、工作區、版本或家長控制有關。

名字的對應關係先記住:講模式用 Live,講系統與產品線用 GPT-Live,講底層模型用 GPT-Live-1 或 mini,三者出現在官方文件的不同位置,混著講容易對錯方案。語音對話是生成式 AI 距離最近的操作面,想補整體輪廓,可以看生成式 AI 從原理到應用場景的完整指南。

Live 採漸進推出,看得到與否取決於方案、地區、工作區與 App 版本。把 ChatGPT 更新到目前版本是第一步。Live 還沒輪到的帳號,官方建議繼續用其他兩個入口,會缺少 Live 的全雙工與背景委派能力。

點語音圖示就能開始

GPT-Live 首波涵蓋 iOS、Android 與 ChatGPT.com,美國時間 2026 年 7 月 8 日起在全球陸續推出,亞洲時區見到的是 7 月 9 日。桌面對話與支援的網頁、手機體驗都吃得到 GPT-Live 驅動的對話內語音,官方載明的 Voice in Chat 支援範圍就是這些平台。

從搜尋結果看到的官方繁中功能頁,寫的開啟動作是點語音圖示,列的用途有問答、腦力激盪、語言練習與即時翻譯。還沒裝 App 的話,先照ChatGPT 新手指南把帳號與 App 弄起來,再回來開語音。找不到語音圖示就進設定的 Voice 頁確認。

開車族有專屬入口:Apple CarPlay 上能開始語音對話、續講最近的或釘選的對話,也能在專案裡開新對話,設定裡還有上車自動啟動的選項。通勤與移動情境不用伸手拿手機。

三個值得先設定的選項

語言放第一個。設定 → Voice → Language,選你主要使用的語言,官方說這能讓辨識更準,對話中也可以直接要求它改用別的語言回答,兩種方式都有效。

第二個是 Background conversations。打開後你切去別的 App 或鎖屏,對話照樣繼續,查資料、回訊息都不中斷。背景對話會在你主動結束、強制關閉 App、達到用量上限或最長時間時結束。

第三個是 Start with Voice。開著的話,打開 App 進入新的空白對話會自動以語音開始,省一次點擊。操作面的更多細節,對照站上的ChatGPT 完整操作教學可以少走彎路。

九種聲音,換聲音要重撥

設定 → Voice → Voice 裡有九種為 GPT-Live 重新錄製的聲音:Arbor、Breeze、Cove、Ember、Juniper、Maple、Sol、Spruce、Vale,巴西區額外有 Viola 與 Rio。官方給每個聲音一句個性描述,例如 Sol 機靈放鬆、Spruce 沉穩篤定,挑聲音時值得逐個試聽再定。

通話中換聲音不是無縫切換,更換所選聲音會在同一個對話裡重新開一通語音通話。單一通話有最長時長限制,講到一半才換聲音,對節奏是實際成本。

安靜房間聽感舒服的聲音,到街邊或車上未必清楚,官方給的個性描述是情緒向的,不是清晰度指標。先在你常待的環境各試一輪再定,換聲音要重撥的代價才划得來。

GPT-Live 怎麼運作:全雙工、傾聽與背景委派

官方自稱的第三代語音系統

OpenAI 把 GPT-Live 稱為第三代語音系統。第一代把語音辨識、語言模型、語音合成三段串接。第二代是回合式的單一語音模型。第三代拿掉音訊路徑上的回合偵測器,語音模型本身全雙工,遇到搜尋與推理再把工作委派給背景的尖端模型。同一份公告給了規模數字:每週有超過 1.5 億人用語音與聽寫跟 ChatGPT 說話。

同時聽與說,還會等你講完

GPT-Live 採全雙工架構,能同時聽與說。對話中它會用「嗯哼」「對」這類短語表示還在聽,能快速一來一往,也會在你需要想一下的時候安靜等待。OpenAI 在 2026 年 7 月的公告用了同樣的例子描述這個行為,官方繁中版也翻得直白。

互動決策每秒發生多次:開口、繼續聽、暫停、插話或呼叫工具。你可以直接插話,官方提醒重疊的語音、背景噪音、網路狀況與麥克風設定都會影響它聽到什麼,它會跟著對話裡較新的部分走,不會咬死你前一句的殘稿。節奏也能用講的調,官方列的動作有插話提問、停下來想,或直接叫它講慢一點。

想邊想邊講,可以在對話開始時說「等我問你再回答」,它就會等。你要求它安靜聽,它就安靜。背景有車聲或旁人交談時,它對你的聲音聚焦得比以前好。搜尋、記憶、圖片與檔案上傳延續支援,行為跟打字對話接得起來。

搜尋與記憶跟著對話走,它可以邊講邊查網頁、引用你記憶裡的偏好,也能讀你剛傳的圖再回答,移動中想查一件小事,用講的比打字順手。講到天氣、股市、運動這類主題,畫面會出現視覺化卡片。

背景委派與智慧程度三段

語音模型專心對話,搜尋、推理與代理工作委派給背景的尖端模型。推出時的背景模型是 GPT-5.5:GPT-Live-1 即時與 GPT-Live-1 mini 在背景用 GPT-5.5 Instant,GPT-Live-1 的中與高推理強度用 GPT-5.5 Thinking。官方繁中版公告的註腳寫明了這份分工,這段官方交代目前講得夠清楚。

即時對話與背景工作分工:聽說互動、背景搜尋推理、結果回到對話
語音互動與背景搜尋、推理可以分工;實際支援的模型與能力仍要按目前產品確認。

官方同時講了會換,新的尖端模型發布後,GPT-Live 背景用的模型會持續更新。到 2026 年 9 月 8 日為止,沒有任何官方聲明說背景已改用 GPT-5.6 或 GPT-6 Astra,查資料時別把兩條線混在一起。想了解 GPT-5.6 三個層級的定位與計價,GPT-5.6 全解析講的是文字模型那條線。

智慧程度在設定 → Voice → Intelligence,分即時、中、高三段。即時求快,中與高讓模型多想,官方提醒等級越高回應越慢,語音搜尋網頁時尤其明顯。這三段對應的正是上面的背景模型分工,選級等於選委派強度。

能力邊界官方也交代了,GPT-Live-1 與 mini 在多項智力評測上不如 GPT-5.5 Thinking,推出時不支援程式碼執行,智力差距由背景委派補上。

對話中打字與傳圖

語音通話進行中,訊息列的加入按鈕可以附圖,也可以直接打字代替說話,它用語音回答,不必另開對話。吵雜環境不方便講話,或想貼一段文字給它讀,這個入口很實用。限制是它目前找不到、也加不了你 ChatGPT 資料庫裡的檔案。能不能手動附上支援的檔案,依帳號而定。

各方案的 Live 滾動 24 小時語音額度

額度怎麼算,各方案有多少

官方限額的計量基準是滾動 24 小時,從現在往回推 24 小時算用量。官方註明限額可能變動,碰到上限時 ChatGPT 會通知你。以下數字取自 2026 年 9 月 13 日檢視的官方說明,只涵蓋 Live,AVM 在新制下的獨立限額未見於現行官方文件,榜單與限額隨官方更新滾動,引用前建議再對一次官方文件。

換成具體情境,晚上九點把額度用完,恢復不靠隔天凌晨歸零,按往回 24 小時的用量滑動計算,早上午餐空檔能不能再講,取決於前一天同時段用了多少。把這個當行事曆在看的人,對帳會很挫折,官方給的是到量通知。方案之間從 3 小時到 15 小時再到無上限都有,直接對表省事。

滾動用量沿時間移動:現在、回看視窗、逐步移出
滾動限額依目前時間回看使用量,先前用量移出視窗後才逐步釋出;不是每天午夜一起歸零。
方案Live 額度,滾動 24 小時計
Pro 200 美元GPT-Live-1 無上限
Pro 100 美元GPT-Live-1 15 小時
PlusGPT-Live-1 3 小時
GoGPT-Live-1 mini 3 小時
Free有限使用 GPT-Live-1 mini,官方未公布數字
Business StandardGPT-Live-1 3 小時,超出後每分鐘 1.25 點數
Business PremiumGPT-Live-1 15 小時,超出後每分鐘 1.25 點數
Enterprise、Edu 與 Clinicians 點數計費每分鐘 1.25 點數
Enterprise 美元用量計費每分鐘 0.05 美元
舊制 Enterprise 與 EduGPT-Live-1 3 小時

單一通話另有最長時長限制,現行說明未載明數字,同時只能有一通語音對話。月費部分,Pro 兩層的 100 與 200 美元出自官方文件,官方方案說明另註明 100 美元層的整體方案用量是 Plus 的 5 倍、200 美元層是 20 倍,語音額度仍以上面的時數表為準。Go 約 8 美元、Plus 約 20 美元、Business 每席約 20 到 25 美元來自多家第三方的一致報價,官方定價頁未列這幾項月費,比較時當約數看。

工作區方案另有管理層。語音在符合資格的 Business、Enterprise、Edu 與 Healthcare 工作區可用,受工作區設定管制。對 Enterprise、Edu 與 Healthcare,工作區擁有者開啟語音時,Live 就是預設體驗,不需要早期模型存取權,擁有者也能把語音整個關掉。公司帳號看不到語音選項時,先找管理員,可能受工作區設定影響。

免費版、Go 與兩個過期說法

免費版在滾動 24 小時內有限使用 GPT-Live-1 mini,官方未公布數字,只說上限可能變動。從搜尋結果看到的免費方案說明頁,對語音同樣只給「另行限制」的講法,沒有固定公開數字。免費能用到的就是 mini 這一層,全雙工、插話與搜尋委派都在,差別在智慧評測與額度。

網路上流傳免費版每天 2 小時的說法,那是 GPT-4o mini 時代的過期快照,只能當歷史對照,現在的官方文件已經改版。Go 也有一個版本問題:Go 說明頁的語音段落屬 GPT-Live 前的舊文案,官方未同步,額度以較新的語音總覽為準:Go 用 GPT-Live-1 mini 3 小時,Plus 用 GPT-Live-1 3 小時,規劃用量時照這份算。

額度用完會怎樣

對話結束的原因有三種:達到用量上限、達到單一通話的最長時長,或長對話觸到上下文上限。想同時開兩通語音對話做不到,一次只有一通。達到限額時 ChatGPT 會通知,除了滾動 24 小時的定義,官方沒有再給各方案恢復節奏的細節,遇到通知就先收尾,別賭它多久回來。Business 超過基本時數後照講,改按每分鐘 1.25 點數計費,企業帳號的體感跟個人方案不同。

延遲實測:第三方量到的數字

官方給質化,實驗室給毫秒

官方對速度只給了質化描述,把緩衝與阻塞降到最低,做到次秒級回應,用戶端只需一個 UDP 封包即可建立工作階段。OpenAI 的技術部落格在 2026 年 8 月 3 日刊出這些細節,全文沒有毫秒數,想要數字只能看第三方。同一篇部落格給了工程相對指標,媒體前端與推論邏輯改用 Go 撰寫,新系統的 P95 延遲持平前代的 P50。

有毫秒數的是 Agora Media Lab,2026 年 7 月 10 日刊出,實測日在 7 月 9 日。條件先講清楚:iPhone 13、ChatGPT App v1.2026.183、Plus 帳號跑 GPT-Live-1、全程英語,預錄語音用實驗室的播放設備發聲,雙軌波形判讀,每個條件 30 次,實測時拿進階語音與標準語音當對照。作者自己揭露利益:Agora 賣即時通訊基礎設施。也提醒 30 次樣本別過度解讀個位數差,這是推出當週、單機單點的快照。

用人工嘴與雙軌波形是實驗室的講究,播放端音量可控,判讀端直接量波形,不靠人耳按碼表。回應延遲量的是你的語音結尾到它第一個可聽見的回應,讓出延遲量的是你插話到它安靜下來。這種做法換來可重複的數字,也帶一個限制,它量不到真人對話的全部雜訊,辦公室與街邊的表現要自己再驗。

開始回應與插話讓出量不同:使用者說完、AI開始回應、插話後停說
回應延遲與插話讓出延遲衡量不同事件;比較前要對齊裝置、語言、網路與起訖定義。

約 1.1 秒開始回應,贏在穩定

整體是約 1.1 秒開始回應,被插話後約 1.4 秒讓出。1.1 秒裡還包含它先應一聲「讓我查一下」的時間,硬延遲被搬進對話裡,帳面數字因此好看一些。回應延遲的中位數比基準快 205 毫秒,Agora 的評語是這差距算不上世代跳躍。同一篇文章引 2009 年一篇 PNAS 研究當參考:人類對話的輪替轉換約 200 毫秒,語音 AI 離這個標準還遠。

差距拉開的地方在尾延遲。進階語音的 P90 到 2,318 毫秒,將近自身中位數的兩倍。GPT-Live-1 的 P90 只比自己的中位數高 104 毫秒,離散度從 489 降到 104 毫秒,抖動約降為五分之一。Agora 下的結論是進步在穩定,不在快。標準語音每輪約 5 秒,Agora 的形容是博物館藏品等級,實測較慢,適合逐回合或重視轉錄後刪音訊的情境。六項實測數字整理成同一張表,進步與退步一起看。

實測項目GPT-Live-1進階語音標準語音
回應延遲中位數快 205 毫秒基準每輪約 5 秒
P90 尾延遲比自身中位數高 104 毫秒2,318 毫秒未測
插話後讓出慢 498 毫秒基準未測
假插話誤停,60 次探測1 次22 次未測
背景語音誤停,30 次探測0 次20 次30 次
10% 封包遺失的中位數劣化+314 毫秒+2,448 毫秒未測

插話讓出、背景人聲與網路不穩

退步的是被插話後讓出說話權,GPT-Live-1 慢了 498 毫秒。假插話探測則相反,60 次裡它只被騙停 1 次,硬插話的耐干擾明顯變好。

背景人聲是雙面刃。30 次背景語音探測,GPT-Live-1 全部不誤停,誤停在兩個對照入口分別出現 20 次與 30 次。但同一輪實測抓到新的失敗模式:沒有人對它說話的十秒窗裡,GPT-Live-1 在 30 個窗中的 4 個自發回應背景人聲,講者歸屬判斷出錯,這是該輪實測觀察到的行為。

網路不穩的數字來自 Agora 的 10% 封包遺失測試,GPT-Live-1 的回應中位數只增加 314 毫秒,劣化後的 P90 是 1,836 毫秒,仍快於進階語音在乾淨網路量到的 2,318 毫秒。

讀這些數字有前提,單一實驗室、單機、推出當週、英語、每條件 30 次,結論不要外推到其他情境。Agora 這輪沒測 API 端的模型,Realtime API 預設的 gpt-realtime-2.1 是另一條產品線。行業參考給兩個座標:2024 年 GPT-4o 系統卡給過模型級平均約 320 毫秒的數字,經社群轉述流傳,跟 Agora 這種實機端到端、含應答語的實測講的是兩回事,不能直接比。語音 AI 測試公司 Hamming AI 整理的產業中位數落在 1.4 到 1.7 秒,GPT-Live-1 的 1.1 秒放在產業水準裡偏快。

質性觀察裡有兩個好用的細節。你說到一半發出的嗯哼,它不會當成新問題跳題,對話接得下去。它回應前會先應一聲讓我查一下,等待被包進對話裡,體感比帳面數字短。這兩個細節是實測報告點名的質性優勢。

對日常使用來說,即時等級的節奏能不能搭上你的對話習慣,開一通實測比任何說法可靠,中與高等級把時間花在背景推理,回答要查證的難題時慢得有理由。選哪一段,看你問的是閒聊還是需要查資料的問題,不是越高等級越好。

語音模式三個入口的差異與選擇

三個入口的分工

官方說明把語音分成三個選項。Live 是現行的語音體驗,Plus 以上方案的底層模型叫 GPT-Live-1,Go 與免費版用 GPT-Live-1 mini,設計給自然的一來一往,能用網路搜尋與記憶、透過支援的小工具顯示視覺化結果,也能在同一個對話裡混用文字與圖片。推出初期不支援視訊、螢幕共享、連結的應用程式與外掛。

進階語音的英文全名是 Advanced Voice Mode,慣用縮寫 AVM,是上一個即時語音體驗。標準語音結構單純,逐回合輪流,先把話轉錄成文字再生成回應,音訊在轉錄完成後就刪除,就算轉錄失敗也照刪,隱私處理跟其他兩個入口不同。

三個入口的對照

三個入口的差異,一張表看清楚,挑入口時照著對就行。

對照項Live進階語音標準語音
互動方式全雙工,同時聽說、可插話回合式即時語音逐回合,先轉錄再回應
底層模型GPT-Live-1 或 GPT-Live-1 mini回合式即時語音模型先轉錄再回應
獨有或保留功能Live 可用搜尋、記憶、視覺化卡片、對話中文字與圖片保留視訊共享、螢幕共享、自訂 GPTs 語音逐回合、先轉錄再回應
音訊保留30 天30 天,含視訊片段轉錄後即刪

互動方式決定體感,底層模型決定能力上限,保留功能決定你的工作流能不能搬過去。音訊保留那一欄常被忽略,卻是隱私敏感情境的決定欄,標準語音的轉錄後即刪,是它少數的勝場。

視訊共享與自訂 GPTs 在哪裡

視訊與螢幕共享佔大宗。Live 推出時不支援這兩項,它們保留在 iOS 與 Android App 的 AVM 裡:通話中點相機按鈕分享即時視訊,或從更多選項選 Share Screen 分享畫面。

還有一個平台差異容易踩坑:簡報共享、遠端看畫面這類工作流,先確認手上是手機,再進對話。官方公告說正在為 Live 補上這兩項能力,時程以後續公告為準。

自訂 GPTs 也一樣,Live 不能用於自訂 GPTs,跟 GPTs 的語音對話繼續用 AVM 與 Shimmer 聲音。預設人格是另一個小差異,官方說預設的 ChatGPT 人格目前不適用 Live,想調語氣與速度,口頭說一聲就生效。

桌機與網頁版還有對話內的語音形態,桌面對話的 Voice in Chat 由 GPT-Live 驅動,講話、傳圖、看卡片都在同一個對話裡完成,跟 Work 與 Codex 的語音指揮是不同入口,一個偏對話,一個偏派工。

官方榜單數字怎麼讀

人類偏好評測:在配對的 5 到 10 分鐘對話裡,量整體偏好、輪替、插話、流暢度與自然度,GPT-Live-1 勝過 AVM 的比例是 75.7%,mini 是 69.2%。這是 2026 年 7 月官方公告裡的自評數字,沒有第三方用同樣的方法重測過。德國媒體 The Decoder 與 DeepLearning.AI 的整理引用的是同一批官方數字,屬於同源轉載,不是獨立複測。

任務類榜單:GPQA 科學推理,GPT-Live-1 高階拿 84.2% 對 45.3%。BrowseComp 網頁代理任務 75.2% 對 0.7%,mini 拿 31.6%。電信客服情境的內部榜單,GPT-Live-1 高階約 65% 任務成功率、平均約 385 秒,基準值約 30%,即時等級約 37%、約 225 秒。同一批數字出自 2026 年 7 月的官方公告,屬官方自報、無獨立複測,隨公告更新滾動,引用時附上日期。

讀法上留三個界線。這些比較的基準都在語音入口之間,不是拿打字對話用的 GPT-5.6 來比,跨這條線比沒有意義。跨產品的部分,GPT-Live 與 Gemini Live 到 2026 年 9 月為止沒有帶實測條件的頭對頭,只有社群觀感與低權威對比文,誰快誰好聽都還沒有實測背書。The Decoder 的報導另提到 Nvidia 已在 2026 年初開源類似的全雙工模型 PersonaPlex,同類模型的選擇正在增加。把官方自評轉述給別人時,留一句「官方自報、無獨立複測」,對聽的人更有用。

入口與方案的選擇

入口的選擇比方案簡單。要跟自訂 GPTs 說話,留在 AVM。要自然對話、搜尋委派與視覺化卡片,用 Live。只是偶爾用語音,標準語音實測較慢,適合逐回合或重視轉錄後刪音訊的情境。

要不要為了語音升級方案,額度、模型層級、延遲與帳號功能要一起看。Plus 在滾動 24 小時內有 GPT-Live-1 3 小時,Go 是 mini 3 小時,夠不夠用,把自己的通勤與會議時數對上去就知道。真的天天講超過的重度使用者,100 美元 Pro 層是 15 小時,200 美元層無上限。值不值得為語音付費,取決於你對額度與延遲的敏感度,這兩件事都能在小額使用後自行驗證。

免費與付費都有全雙工、插話與委派這幾項互動能力,模型層級、額度與帳號功能仍有差異。難題方面 GPT-Live-1 較適合高推理需求,額度則看你一天講多久。先把自己的用量模式跑出來,付費判斷以實際用量為準。

繁中與台灣口音:目前知道多少

官方的語言但書

官方對語言只給了一段概括說明,GPT-Live 針對 ChatGPT 裡的常用語言做了調校,某些語言可能帶非母語口音或流暢度缺口,團隊持續改善。哪些語言在調校清單裡,官方沒有公布,繁中也沒有個別的官方聲明。

但書的措辭值得對照,最佳化針對的是常用語言,但書寫的是非母語口音或流暢度缺口。兩個說法都沒給名單,代表官方保留了調整空間,使用端能做的就是實測與回報,等清單不如先驗證。

TechCrunch 在 2026 年 7 月 8 日的報導追問過這件事,OpenAI 不願列出語言清單。同一場發表會的印地語即時翻譯示範,被記者形容為濃厚美國口音、語感偏書面。官方的功能頁寫了即時翻譯當賣點,實際口音表現依語言而定,這是現況。

粵語實測看到的缺口

華語圈最接近的第三方實測是粵語。UNWIRE.HK 的記者在 2026 年 7 月 27 日用四個場景實測:在日常對話裡規劃旺角聚餐預算 500 蚊並中途插話改條件,用記者職位做面試模擬與追問,安撫 DSE 失利後的情緒,以及挑戰廣東話急口令。結論是理解力明顯進步,插話後仍掌握背景、追問有邏輯。短板是粵語夾雜書面語與普通話句式,口音不穩,不同聲線落差大。急口令咬字穩,但可能自行改寫原句。長對話聲音品質會下降,偶有短暫卡頓。讓出說話空間的速度有進步。

這是香港一般使用者的裝置實測,沒有延遲數字,也不等同台灣華語的表現,但它是目前離台灣口音最近的媒體級觀察,參考價值高於任何論壇一句話心得。

台灣的回報與設定建議

台灣華語沒有媒體級實測,只有社群回報。一名 Threads 使用者貼文寫「聽到中國腔好出戲」,付費方案也一樣,模型自稱口音是內建的沒辦法改,要求台語仍回字正腔圓的國語。一家工作室的技術文章把成因指向訓練語料以普通話為主,台灣口音在資料裡相對弱勢。網路上另有一支宣稱台語辨識精準的個人實測影片,未經驗證,不要當成可靠結論。

能自己做的有兩件。把 Language 設成主要使用的語言,官方說這能提升辨識準確度。再用自己的口音實測一輪,接受度是你自己的判斷,別讓任何榜單替你決定。官方繁中文件本身齊備,公告與功能頁都有 zh-Hant 版本,剩下的問題是輸出的口音與在地化品質。

即時翻譯是繁中情境比較能直接受益的功能,架構層支援,官方繁中公告也列入能力清單。印地語示範的美國口音提醒一件事:翻譯的通順度依語言組合有落差,自己的組合能不能用,開一通對話實測就知道。

繁中的官方文件齊備度可以具體列出,發表公告有 zh-Hant 版,還附了委派模型的註腳。功能頁也有 zh-Hant 版。輸出端的口音與用詞則仍需實測,這也是實測時要聽的重點。

限制地圖與隱私

功能面做不到的清單

把做不到的事先攤開,比試用後撞牆省時間。官方文件列明的邊界如下。

  • Live 推出時不支援視訊、螢幕共享、連結的應用程式與外掛。
  • 找不到也加不了 ChatGPT 資料庫裡的檔案,手動附檔依帳號而定。
  • 多人同時說話沒有最佳化,設計上是一對一對話。
  • 一次只能有一通語音對話,單一通話有最長時長限制。
  • 自訂 GPTs 與預設人格都不適用 Live。

這些是官方文件列明的邊界,不是使用技巧能繞過的。工作流如果踩在上面任何一條,先換入口或換工具,不要硬試。通話時長上限與一次一通,對把語音當長活動紀錄工具的人是實際約束,長活動得分段開,或用打字與圖片中途補洞。

行為面的已知問題

已知問題有三個來源。開發者 Simon Willison 在發布前數週的預覽回報:模型會對不是笑話的話發笑,他覺得沒禮貌又居高臨下,回報後 OpenAI 調整過,頻率下降。Agora 的實測抓到講者歸屬錯誤,沒人對它說話也會搭話。質性觀察裡,請它「40 秒後提醒我」,時間感偶爾失準。三個都屬可回報、可改善的行為問題,不是硬體故障。過度順從也出現在 Tiago Forte 2025 年 GPT-Live 推出前的長時間使用紀錄:它傾向附和你的判斷,要它挑毛病,得明說。

安全設計與家長控制

安全設計的官方立場是 GPT-Live 為對話設計,不為模仿聲音,用內建的固定聲音組合防護,避免模仿真人。偵測到不安全輸出時,系統會導向更安全的回應、顯示安全訊息或資源,高風險情境直接結束通話。系統卡的判定是:在不委派的運作下,GPT-Live-1 與 mini 在任何追蹤類別都談不上高風險。

安全評測數字出自官方系統卡 2026 年 8 月 4 日的更正版,屬官方自報:違法行為防護 0.95 對 0.74、自殘防治 0.97 對 0.89 有進步。情感依賴 0.82 對 0.88 小幅退步,官方紅隊的測項涵蓋兒童聲音、冒充、講者識別、自殘、情感依賴、詐騙操縱與音訊擾動。青少年帳號的家長控制:家長或監護人能透過家長控制決定青少年能否使用語音。涉及自傷或自殺意念徵兆的高風險情境,連結的家長可能收到通知。

音訊保留、訓練預設與浮水印

音訊保留的規則是 Live 與 AVM 的片段跟對話紀錄一起存放,保留 30 天。刪除對話時,對應的音訊與視訊片段在 30 天內跟著刪,除非基於安全、法務等因素保留。封存只是把對話移出側欄,不會刪音檔。標準語音不同,音訊在轉錄完成後就刪,轉錄失敗也照刪,重視音訊不留存這點的人,標準語音反而是選項。

沒有你的選擇,音訊與視訊不會用於訓練。開啟「提升模型」設定時,對話的文字紀錄與其他檔案可能用於訓練,音訊與視訊要另行勾選分享才會用。Business、Enterprise、Edu 工作區不能分享片段。這個選擇綁帳號,套用到所有已登入的裝置,改一次就全生效。

文字與音訊分享設定分開看:對話文字、音訊視訊、帳號資料控制
文字與音訊、視訊的訓練分享條件不同;使用前分別核對資料控制和保留規則。

2026 年 7 月 31 日的更新給語音加了來源標記:GPT-Live 產生的支援音檔包含 SynthID 浮水印,公開驗證工具能偵測,API 也開放驗證。對需要交代音檔來源的單位,這是可用的查核點。

把語音放進日常工作

一小時遛狗與半小時散步會議

長對話有實例。Simon Willison 在發布前的數週預覽期用它,整體印象很好。最長的一通是邊遛狗邊拍鵜鶘,講了一小時。他先前已棄用語音模式,嫌當時的模型是弱腦力激盪夥伴,GPT-4o 時代的知識又停在 2024 年的某個時點,這次等於被他重新撿回來。

OpenAI 的產品負責人 Atty Eleti 在同期的報導裡說,自己散步時有過 30 到 40 分鐘的對話。同篇報導也記下 OpenAI 定調語音不是陪伴型產品。台灣這邊,104 職場力在 2026 年 7 月 9 日提出一組職場用法:通勤腦力激盪、把推理切到高當決策顧問、談判模擬演練、丟報表邊語音分析、外語口說陪練與費曼式反向提問,屬媒體提案,不是實測結果。

官方公告列的日常用途是免持協助、語言練習、床邊故事與通勤聊天,定位是日常幫手,不是陪伴產品。Atty Eleti 在報導裡把願景講成讓語音成為複雜工作的主要介面,這條線在桌面版的語音指揮已經開始兌現。

語音想、文字改

幾個公開案例的共同點是語音當輸入、文字當編修。Tiago Forte 在 2025 年 9 月 1 日記過一次走路回顧:iPhone 16 加有線耳機、街上步行不看螢幕,兩段共約兩小時,首段約一小時就撞上當時的每日上限,回應約 2 到 3 秒,收尾時請 ChatGPT 出書面摘要。他的失效清單值得抄:整理不完整、容易漏項,不主動抓網頁、過度順從、跨對話脈絡遺失、音檔不留紀錄。他的結論是行動反思的隨手補充,深度不如書寫。注意這是 GPT-Live 推出前的紀錄,額度與延遲都不能套用到現在。

類似的個人工作流還有 Matt Webb 的 Diane 法:Apple Watch 聽寫進 Whisper Memos,再交給 Claude 依秘書指示整理,對手錶喊出秘書名字就切換成整理模式,這套流程經 Simon Willison 轉述。Medium 上另有一週重度使用者的側寫,作者自述的模式是口述初稿、進文字版再修。這類分享是個人經驗,不是量化的生產力數字,挑能配合自己節奏的部分用就好。若口述的目的不是對話,而是直接換成整理好的可用文字,可以看Typeless 這類 AI 聽寫工具的評估。

語音指揮桌面版工作與 Codex

桌面版另有入口。ChatGPT 桌面 App 的 Work 與 Codex 有語音指揮:你能說話、自然插話、協調任務,背景工作繼續跑,不用等它停下來聽你講。

  • 啟動、排優先、中斷或改派正在背景執行的任務。
  • 協調多個代理,跨進行中的對話與專案。
  • 續接既有工作,收語音或畫面形式的進度回報。
  • 看得到它在聽,能隨時靜音或停止麥克風。

計量與行動版分開,彈性計費的 Business 與 Enterprise 工作區每分鐘約 6 點數。舊制 Enterprise 每五小時區間約 45 分鐘。透過語音啟動的任務,吃 Work 與 Codex 共用的額度池,按標準費率扣。桌面限定 macOS 與 Windows,iOS 遠端配對可用。Codex 在網頁與手機上還不能選為體驗。想看兩條產品線的全貌,ChatGPT 工作助手與Codex 各有完整介紹。

開發者角度:GPT-Live API 與現行費率

GPT-Live API 的現況

GPT-Live 的 API 已經開放:2026 年 9 月 13 日檢視的開發者定價頁列出 gpt-live-1,按工作階段計費,每分鐘 0.05 美元、按秒計算不進位到整分,背景模型與工具用量另計。時間點跟先前的跡象對得上:公告的講法是 soon,技術部落格稱它為 upcoming,OpenAI 的 Christine McLeavey 也在 2026 年 9 月 8 日前後於 X 徵 GPT-Live API 的設計夥伴。

現行語音模型與費率

gpt-realtime 系列按 token 計價,跟 gpt-live-1 的按分鐘不同。gpt-realtime-2.1 音訊每百萬 token 輸入 32 美元、輸出 64 美元,文字 4 與 24 美元,圖片輸入 5 美元。gpt-realtime-2.1-mini 音訊 10 與 20 美元,文字 0.6 與 2.4 美元。翻譯用的 gpt-realtime-translate 每分鐘 0.034 美元,即時轉錄的 gpt-live-transcribe 與 gpt-realtime-whisper 每分鐘 0.017 美元。檔案轉錄 gpt-transcribe 每分鐘 0.0045 美元,Whisper 每分鐘 0.006 美元。數字取自 2026 年 9 月 13 日的官方定價頁。

gpt-realtime-2.1 系列約在 2026 年 7 月 6 日上線,比 GPT-Live 早兩天,日期出自開發者社群公告的第三方紀錄。即時翻譯模型的語言數字,2026 年 5 月 7 日的公告與開發者食譜兩處記載的都是支援 70 種以上輸入語言、13 種輸出語言。對照文字旗艦:gpt-6-astra 每百萬 token 10 與 50 美元,2026 年 9 月 3 日發表。gpt-5.6-sol 4 與 20 美元,優惠價到 2026 年 11 月 21 日。

再往下對照,gpt-5.6-luna 每百萬 token 0.2 與 1.2 美元,是低成本層。語音 API 的音訊計價明顯高於文字,音訊輸入 32 美元是文字輸入 4 美元的八倍,做語音產品先算音訊預算,再談文字。

端點結構照官方 Realtime 指南:對話工作階段走 /v1/realtime,連續翻譯走 /v1/realtime/translations,轉錄另有專屬的工作階段型態。gpt-live-transcribe 可以調延遲,低延遲早出部分文字,高延遲換更好的品質。連線方式有 WebRTC、WebSocket 與 SIP 三種,瀏覽器、伺服器與電話語音各有對應路徑。

翻譯與轉錄的費用示意

費用算個示意,兩者都用同一場 60 分鐘的會議當基準。gpt-realtime-translate 做即時翻譯,0.034 美元乘 60 分鐘是 2.04 美元。gpt-live-transcribe 出即時文字紀錄,0.017 美元乘 60 分鐘是 1.02 美元。同場會議兩者都用,合計 3.06 美元。這是按公告單價的純乘法示意,算例依所列的每分鐘單價計算。換算自己的用量前,先到官方定價頁確認當日數字。

下一步

順序照重點先看的那組走。更新 App、到設定把 Voice 切到 Live、把 Language 設成主要使用的語言,前後五分鐘內完成。接著撥一通十分鐘的對話:用平常說話的速度問一件工作上的事,中途插話一次,再傳一張圖片給它看。這一通足夠你判斷口音接受度、插話手感與搜尋委派的回應節奏。

之後的對照就簡單,額度表對號入座,開發需求看 gpt-live-1 與 gpt-realtime 系列。方案與限額數字隨官方更新滾動,引用前以官方說明的現場版本為準。把測試結果留在對話紀錄裡,下次要調等級、換聲音或對額度,都有依據。

常見問題

ChatGPT 語音模式怎麼開啟?
點語音圖示就能開始,手機 App 與網頁都一樣,三個入口在設定 → Voice 裡挑。Plus 以上帳號的 Live 跑 GPT-Live-1,Go 與免費版跑 GPT-Live-1 mini。選單裡看不到 Live 時,先把 App 更新到目前版本,它是漸進推出,跟方案、地區與版本有關。
我的方案有多少語音額度?
額度看方案,一律用滾動 24 小時回推計算。Go 用 GPT-Live-1 mini 3 小時,Plus 用 GPT-Live-1 3 小時。100 美元 Pro 層是 15 小時,200 美元層沒有上限。Business Standard 3 小時、Premium 15 小時,超出後改每分鐘扣 1.25 點數。單一通話另有最長時長限制,達到限額時會收到通知。
免費版能用到什麼?
能講多久沒有官方數字,能用的模型是 GPT-Live-1 mini,上限隨時可能調整。mini 一樣做得到全雙工、插話與搜尋委派,智慧評測低於 GPT-Live-1。網路上每天 2 小時的舊說法是 GPT-4o mini 時代留下的,不能拿來當現在的額度。
台灣口音行不行?
還沒有定論,台灣口音目前只有社群回報、沒有媒體級實測。官方只說針對常用語言做了調校,部分語言的口音或流暢度可能有缺口,清單未公布,繁中也沒有個別聲明。最接近的第三方證據是粵語實測,理解進步但口音與句式混有書面語。把 Language 設成你主要使用的語言後,花十分鐘實測就有答案。
GPT-Live 跟進階語音差在哪?
Live 是全雙工的第三代系統,能同時聽說、插話,並把搜尋推理委派給背景的 GPT-5.5。進階語音走回合式設計,但視訊鏡頭、分享畫面與自訂 GPTs 的語音,只有這個入口有。日常對話用 Live,要開鏡頭或分享畫面時切到 Advanced。
視訊共享去哪了?
功能還在,只是換了位置。視訊與螢幕共享在 Live 上線時未包含,符合資格的訂閱者從行動 App 的進階語音使用:通話中按相機按鈕開視訊,或到更多選項裡選 Share Screen。官方表示會為 Live 補齊這兩項能力,時間點以後續公告為準。
桌面版與 Codex 的語音怎麼用?
桌面版的 Work 與 Codex 能用說的指揮:用語音啟動任務,並可隨時插話、中斷或改派,協調多個代理並收進度回報。計費跟行動版分開,彈性計費的工作區每分鐘約 6 點數,語音啟動的任務消耗共用額度池。這是桌面限定,Codex 在網頁與手機還不能選。
語音對話會被拿去訓練嗎?
預設不會用音訊或視訊訓練。語音通話的音訊片段與對話紀錄一起存放,片段保留 30 天,刪對話後會在 30 天內跟著刪,安全與法務因素除外。開啟提升模型設定時,文字紀錄可能拿去訓練。音訊與視訊另設開關,勾了才會分享,商務與企業版無法分享。標準語音在轉錄完成後就刪掉音檔。

主題聚落|ChatGPT、Gemini 與生成式 AI 工具 看「AI 搜尋、GEO 與 AI 工具」中樞 →

相關文章

Whoops 巫普斯科技有限公司

專注技術 SEO、GEO/AEO 與 AI 搜尋實務。本站文章以可驗證資料、公開來源與實作觀察整理而成。

關於 Whoops編輯守則服務內容

想把這篇的方法用在自己的站上?

SEO 健檢、GEO/AEO 引用優化、網頁設計諮詢——把文章裡的方法落地到你的網站。