越獄風險與替代:層級、風險、替代的概念圖
理解指示層級,安全提問

ChatGPT 越獄是什麼?原理、風險與不越獄的替代問法

ChatGPT 越獄(jailbreak)是要模型違反自身安全規則的問法,效果時靈時不靈。OpenAI 把繞過防護列為禁止項,輕則警告、重則停權,想固定行為改用自訂指示與提示詞四段結構。

  • ChatGPT 越獄
  • Jailbreak
  • DAN 提示詞
  • 提示詞注入
  • OpenAI 使用政策
  • 模型安全

約 27 分鐘閱讀作者:Whoops 編輯團隊

本頁目錄

ChatGPT 越獄(jailbreak)是一類特殊的問法:用設計過的對話內容,要模型違反自己被訓練出來的安全規則,去做它平常會拒絕的事。從官方文件與實測可以推,模型裡沒有等待解鎖的隱藏模式。這種問法效果時靈時不靈,拿到的回答沒有品質保證,帳號還可能收到警告甚至停權。想用它拿到的結果,官方其實留了正規的取得方式。

重點先看

越獄是要模型違反自身安全規則的問法。從層級設計可以推,模型內沒有被封住的第二模式,只有被訓練出來的行為邊界。

官方的模型規格書把指示分成五層,使用者訊息的位階壓不過上層,而且模型被明文訓練去抵抗低階覆寫。

使用政策與使用條款都把繞過防護列為明文禁止項。部分違規可能先收到警告,持續違反後可能受進一步限制或永久停權,誤判可以申訴。

繞過後拿到的輸出,可靠性條款照樣適用,行為不穩定時更難查核。

今天就能做:打開 Settings 裡的自訂指示,把「你希望它怎麼回」寫清楚,多數需求不必繞路。

DAN 現象:越獄是怎麼開始的

ChatGPT 在 2022 年 11 月上線。CNBC 在 2023 年 2 月 6 日發布的報導寫到,最早版本的 DAN 出現在 2022 年 12 月,起初就只是一段貼進輸入框的文字。DAN 是「Do Anything Now」的縮寫,翻出來是「現在什麼都能做」,意圖直接寫在名稱上。

同一篇報導交代了最早的版本抓到當時 ChatGPT 的一個傾向:把使用者的每個請求都當成立刻要滿足的任務。越獄手法沿著這個傾向發展,到 2023 年 2 月已經迭代到 5.0 版,接下來的 CNBC 實測就是拿這一版做的。

把時間感抓好,這件事就不神祕。ChatGPT 是 2022 年 11 月出現的新產品,使用者還在摸它的規則,繞過規則的玩法就同時出現了。DAN 的本體就只是一段文字,靠的只是模型讀了之後的行為變化。理解這一點,原理與風險都好讀。

最早版本的 DAN 出現在 2022 年 12 月

DAN 的形態在報導裡描述得很清楚:它讓 ChatGPT 對同一個問題給出兩種回答,一種照原本的規則走,另一種以 DAN 這個身分回答。報導把 DAN 稱為使用者創造的分身,也就是模型照著提示詞演出的另一個角色。

對使用者的介面來說,這個設計製造了一種對照:本體的拒絕與分身的回答並存。要緊的是判讀後半:分身能回答,並不代表它連到更強的能力,只代表模型在那個當下照著劇本走了。

這套問法在報導裡有兩個位置:討論區裡被當工具交換,媒體上被當現象報導。

5.0 版的提示詞裡有一套施壓設計:用虛構的扣點與消失後果向模型施壓,把對話包裝成一場輸了就有懲罰的遊戲。那些點數與後果都不存在,存在的只有被寫進對話裡的壓力。

施壓設計要單獨看一眼,因為它劃出越獄的邊界:它改變的只是對話裡的條件,改變不了模型的能力。把不存在的後果寫得像真的,能不能讓模型照做,實測的答案是時靈時不靈。

名稱承諾的是現在什麼都能做,實測給的答案是偶爾能做,落差就在這裡。

CNBC 實測:同一個問題,兩種回答

記者先拿政治人物的評價類問題去問。ChatGPT 本體以無法做主觀陳述為由拒答,DAN 版給了回答。換成暴力內容,本體同樣拒答,DAN 版起初照做。追問升級後,平台以倫理義務為由拒絕。

接著出現轉折。報導寫到,問了幾個問題之後,ChatGPT 原本的設定似乎重新啟動,蓋過 DAN。記者對這套手法的評價是:充其量只是時靈時不靈。

把實測的細節拆開看,更有參考價值。第一次成功出現在接受提示的初期,那時模型還照著提示詞的框架走。追問幾輪之後,原本的設定似乎重新取得主導權,同一個聊天視窗裡,前後行為可以完全相反。

這個實測把越獄的日常樣貌講完了:看起來成功,接著失效,防護重新接管。

近 20 萬人的討論區,與未證實的監測傳聞

報導也記錄了當時的社群樣貌:ChatGPT 的 subreddit 有近 20 萬訂閱者,在裡面交換提示詞與使用心得。有 Reddit 使用者相信 OpenAI 會盯著那個討論區並修補越獄,這是使用者的猜測,報導沒有證實。OpenAI 未立即回應該篇報導的置評請求。

訂閱數說明這個討論區當時有相當規模,報導也記錄裡面有人交換提示詞與使用心得。交換存在,代表有人想要模型不給的東西,手段的有效與代價仍要分開看。

監測傳聞的價值在提醒,不在證實。能由條款確認的是,帳號持有人須為帳號下發生的所有活動負責。

事件線可以固定下來:2022 年 11 月 ChatGPT 上線,2022 年 12 月最早版本的 DAN 出現,2023 年 2 月 DAN 5.0 接受媒體實測。這三個時間點構成事件線的全部。

把事件線與 Model Spec 對照,DAN 可以視為 User 層訊息試圖影響高階原則的案例。實測顯示行為時靈時不靈,帳號後果則依政策與條款判斷。

原理:指示有優先層級,越獄施力在低階那層

越獄為什麼時靈時不靈,答案寫在 OpenAI 自己公布的模型規格書(Model Spec)裡。這份文件交代模型應該怎麼行為,以 CC0 授權釋出到公眾領域,定位是使用政策的互補文件。

五層指示:Root、System、Developer、User、Guideline

Model Spec 把給模型的指示分成五層:Root、System、Developer、User、Guideline,位階高的指示蓋過位階低的。Root 是根本規則,文件明寫這一層無法被系統訊息、開發者或使用者覆寫,任何訊息都動不了它。

System 層屬於 OpenAI,放的是產品層級的指示。Developer 層屬於用 API 開發應用的人。User 層是終端使用者打進聊天框的訊息。Guideline 是預設行為,可以被更高階的指示隱性調整。你在對話裡打的任何內容,全部落在倒數第二層的 User。

五層的用意在於定順序。文件的原則是一句話:位階高的指示覆寫位階低的指示。OpenAI 放的系統訊息壓過開發者的設定,開發者的設定壓過你打的字。越獄等於在 User 這個低階施力點上,要求模型推翻它上面三層,這在結構上就是逆風。

用一個對照幫助記憶:Root 像根本大法,System 像公司規定,Developer 像各產品自己的規則,User 是你在對話裡的發言,Guideline 是沒有特別交代時的預設。想用一句發言改掉公司規定,結構上沒有這個位置。

Guideline 這一層常被漏掉,但它是五層裡唯一寫明可被隱性調整的。它裝的是預設行為,更高階的指示可以調整它。預設可調,根本規則不可動,兩種彈性的等級差很多。

越獄的施力點就卡在 User 層,想改寫的卻是排在它上面的規則。對一般使用者,這個分層的意義很實際:你在聊天框裡說的話,影響力天然低於 OpenAI 放的規則,也低於開發者放的規則。想自訂行為,方向是往有權限的層級走,低階的偽裝改變不了位階。

指示層級的界線:高階規則、使用者訊息、衝突
分層卡呈現高階指示與使用者輸入的優先關係。

層級觀念也解釋日常的一個困惑:為什麼同一個要求,有時模型照做,有時拒絕。行為由多層指示一起決定,輸出又帶機率性質,合理的解釋是單次結果本來就會浮動。把浮動當成可以穩定利用的漏洞,是對這套結構的誤讀。

模型規格書點名的四類手法

Model Spec 對這類手法有直接分類。文件寫明,低階內容(包括模型自己先前的訊息)不應影響模型對高階原則的判讀,並列出四種樣態:命令式的覆寫企圖、道德施壓、邏輯施壓、角色扮演混淆。

分類裡藏著一個容易被忽略的細節:文件把模型自己先前的訊息也算進低階內容。意思是,就算模型先前照著越獄的劇本回答過,那些回答也不能拿來當繼續下去的理由。對話裡看起來已經成功的前幾輪,不能因此取得凌駕高階原則的權限。

命令式直截了當:要模型無視先前的指示。道德施壓聲稱不照做會發生嚴重後果,把責任推給模型。邏輯施壓提出一套特定的判讀方式,說服模型照做才符合規則。角色扮演混淆是讓模型進入另一個身分,用那個身分的規則蓋掉原本的規則,DAN 屬於這一類。

四類手法出自同一條規則,偽裝形式是另一條對應的規定。

手法類型概念層描述依據
命令式覆寫企圖直接要模型無視既有指示Model Spec
道德施壓聲稱不照做會發生嚴重後果Model Spec
邏輯施壓用一套特定判讀方式說服模型照做Model Spec
角色扮演混淆讓模型以另一個身分的規則回答Model Spec
偽裝形式以倒寫、加密或另一種語言交付被禁止的內容,視同直接提供Model Spec

偽裝形式為什麼也行不通

偽裝是另一條常見的路:把被禁止的內容倒著寫、加密,或換一種語言再要求模型處理。Model Spec 把這條路一起堵上,明文寫著以偽裝形式提供被禁止的內容,視同直接提供。

從規則的寫法可以讀出官方的判定方向:倒寫、加密、換語言都只是換包裝,內容被禁止,判定就跟著不變。

四類手法與偽裝形式共享同一個假設:模型的規則可以被對話內容改寫。規格書從層級結構上否定這個假設,分類表上的手法,都被規格書的規則蓋住。

越獄碰不到的三件事

從這裡推:越獄解鎖不了任何隱藏能力,它只是把對話推進模型被明文訓練去抵抗的狀態。這個判斷由三項依據構成:使用者訊息的位階壓不過上層、模型被訓練去抵抗低階覆寫、實測結果不可預期。

它碰不到的第一件事是 Root 層的根本規則,文件明寫任何訊息都覆寫不了。第二件事是層級本身:User 層的內容就是 User 層,對話裡寫什麼都不會把自己升級成 System 或 Developer。第三件事是回應的可預期性:把對話推進訓練目標的對立面,行為跟著不穩定,CNBC 的實測已經示範了這一點。

從 CNBC 實測能觀察到的,是當下有沒有產生回答,這不代表能力或指示層級被改變了。

分類的價值在於定位。日後看到任何流傳的問法,不必記名字,只要判斷它落在哪一類:是命令、施壓,還是換身分。判斷出類型,對結果的預期就有依據。

帳號後果:從政策明文到申訴

原理之外,帳號層級的後果有實際文件可查。OpenAI 把規則寫在使用政策與使用條款兩份文件裡,說明中心再補上警告與停權的細節。如果以為越獄的代價只是被拒答,文件的寫法會更正這個印象。使用政策、使用條款與說明中心的內容,查證於 2026 年 9 月 11 日。

使用政策管行為,開頭就寫究責原則與禁止清單。使用條款管合約,寫你能做什麼、不能做什麼、違反的後果。說明中心的文章再把警告與停用拆成使用者能讀懂的步驟。三份文件疊起來,就是完整的後果地圖。

政策與條款把繞過防護寫成禁止項

使用政策的開頭原則寫得直接:不當使用會被究責,破壞或繞過規則與防護,可能失去服務的存取權,或面臨其他處罰。同一段也寫明,OpenAI 保留在合理認為必要時拒絕存取的權利,理由是保護服務、使用者或其他任何人。

同一份政策的 Protect people 禁止清單裡,「繞過防護」與非法活動、武器發展、惡意網路活動並列。清單還有另一條相關項目:未經同意的安全測試。這兩條把兩條路線都標記出來,繞防護與私自測防護,各自都是禁止項。

與繞過防護並列的項目涉及非法活動、武器與惡意網路行為,這個分類把可能造成傷害的行為放在一起管理。

使用條款在「What you cannot do」清單有對應條文:不得干擾或中斷服務,包括繞過速率限制或各種限制,或繞過 OpenAI 加在服務上的防護措施與安全緩解機制。條款是合約,政策是使用規則,兩份文件從不同角度禁止同一件事。

政策版本有個時間點要記下:使用政策的變更紀錄最新一條停在 2025 年 10 月 29 日,那一天政策更新為跨 OpenAI 產品通用的一套。

警告:部分違規會先收到通知

部分違規會先收到警告,通知送到帳號的信箱。說明中心專文解釋警告的類別,其中一項就叫「試圖繞過安全系統」:試圖繞過內建的安全過濾或內容限制,或利用平台漏洞產生被禁止的內容,都屬於這一類,一個從內容限制下手,一個從系統弱點下手,後果走同一條線。

官方特別澄清警告的定位:警告是一份通知,讓你有機會檢視並調整用法,它不等於立即停權。但同一篇文章也寫明,收到警告後若繼續違反,可能導致進一步限制,或永久停用帳號。

官方對部分違規給的是有期限的機會:警告會指定調整的時間,期限內完成調整,就是它留的收尾空間。

收到警告可以做的事很有限,也很清楚:對照通知信裡的類別,停止對應的行為,在期限內完成調整。它能要到的東西是時間,時間用來改正,不是用來試第二次。

停權在什麼條件下發生

說明中心另一篇文章列出帳號停用的原因,總則寫得簡短:停用發生在使用者違反使用政策或服務條款時。原因之一的「違反服務條款」項下,明列繞過安全或存取限制。另一個原因是安全疑慮或未經授權的存取,偵測到可疑活動時,帳號可能先被暫時停用以保護安全。

使用條款給 OpenAI 的權限更寬。三種情況可以暫停或終止服務存取,或刪除帳號:認定你違反條款或政策、為了遵守法律、或你的使用行為可能對 OpenAI、使用者或任何其他人造成風險或傷害。

條款的用語也要看。它寫的是保留權利,沒有承諾必然執行,三個觸發條件涵蓋違約、守法與風險防範。判斷的空間在官方手上,個別案件怎麼處理,決定權也在官方這一側。

把停用文章的原因整理起來,繞過相關的路徑有兩條:直接違反條款與政策是一條,收到警告後未在期限內改善是另一條。什麼行為觸發什麼後果,文件上對得起來。

誤判可以申訴

使用政策的原則段保留了申訴權:如果你認為執行有誤,可以提出申訴,OpenAI 會著手處理。實際管道寫在說明中心:用警告或停用通知信裡的連結提交申訴,信箱已無法存取時,改走停用專文列的 openai.com/form/appeal/ 表單,沒收到通知又失去帳號存取,就改用說明中心的客服對話。

申訴是為誤判留的救濟,管道是公開的,誤判不會因為收不到信就無解。

後果有階段可循,也有直接處置的保留權,每一步都有官方文件對應。

階段發生什麼依據
政策明文繞過防護列為禁止項,破壞規則可能失去存取權使用政策、使用條款
警告收到通知,類別含試圖繞過安全系統,有機會調整用法說明中心帳號警告專文
升級警告後未在指定期間改善,可能進一步限制或永久停用說明中心帳號警告與停用專文
停用違反政策或條款、安全疑慮、警告未處理都可能觸發說明中心帳號停用專文、使用條款
申訴用通知信連結提交,信箱無法存取時改走表單,未收到通知則用客服對話說明中心兩篇專文

輸出與職場:繞過之後你拿到什麼

帳號後果之外,繞過直接改變的東西是你拿到的輸出,與它進入工作流程之後的責任。

可靠性條款照樣適用

使用條款對輸出可靠性有完整規定:輸出可能不準確,不應把它當成唯一的事實來源,或專業建議的替代品。

條款的三個層次可以分開讀。第一層講性質:機器學習的輸出有機率性質,可能出錯。第二層講用途:不能當唯一的事實來源,也不能取代專業建議。第三層講動作:使用或分享前,必須自行評估準確與適切,視情況加上人工審查。三層疊起來,輸出的最終責任落在使用者身上。

專業建議那一條界線要單獨記。條款寫明輸出不能取代專業建議,需要專業判斷的用途,不能把模型回答當成專業建議的替代品,使用或分享前仍要評估準確與適切。這條界線對繞過後的輸出一樣成立。

這條規定沒有區分正常輸出與繞過後的輸出,一體適用。查核的深度也要對等:從條款與實測可推,繞過後輸出的風險不低於正常輸出,行為不穩定時,同一個視窗裡前後的回答可以完全相反。

把條款放回越獄的脈絡:繞過沒有換到任何可靠性上的讓步,交換來的只有行為的不穩定。

實際查核可以縮成三個動作:對照可驗證的資料、檢查關鍵數字與名稱、重要用途加一層人工判讀。模型生成的基本性質不因問法改變,幻覺的機制與檢查方法站上另有一篇完整說明。

舉一個具體的查核例子:繞過後模型給出一組統計數字,對照的動作是找回原始報告核對年份與計算口徑,對不起來就整組退回,不從裡面挑順眼的採用。

帳號活動的責任範圍

使用條款把帳號責任寫在註冊與存取的段落:不得分享帳號憑證,不得把帳號交給別人使用,帳號下發生的所有活動都由你負責。自己帳號裡的每一次嘗試,責任都落在自己頭上。

帳號裡的活動由你負責,平台端有自動監控偵測潛在違規,重大安全案件經人工審查後可能移交執法。

Model Spec 也交代了監控的存在。OpenAI 使用自動監控偵測潛在的使用政策違規,經人工審查後,涉及迫切的嚴重人身傷害威脅或其他嚴重公共安全風險的案件,可能移交執法機關。移交的門檻寫得很高,條件是迫切的嚴重傷害威脅,或其他嚴重公共安全風險。

公司網域帳號多一層變數

條款對公司網域另有規定。用公司信箱開的帳號,可能被加進組織的商務帳號。帳號轉移之後,組織的管理員可以控制帳號,包括存取帳號裡的內容,以及限制或移除帳號的存取權。

由這些規定可以判讀,工作帳號上的風險可能擴及組織。公司網域的帳號若已轉移到組織的商務帳號,管理員可以存取帳號裡的內容,也能限制或移除帳號的存取權。對話內容進入組織可存取的範圍之後,該由誰判讀,就不再是一個人能決定的事。

工作場景的判斷可以很簡單:想試新的問法,用自己的個人帳號與公開安全的內容,工作成果要進產品,走 API 與開發者訊息。兩種用途分開處理,責任界線跟著清楚。

再往實務走一步。行銷團隊想讓模型固定用品牌語氣回覆,正確做法是把語氣規則寫進 GPTs 的指示欄或自訂指示。工程團隊要在產品裡固定輸出格式,正確做法是開發者訊息。兩種需求都有現成的位置,不必動到越獄那條路。

不越獄的替代問法:官方留好的四條通道

回到越獄背後的需求:要固定格式、要固定角色,或只是不想被誤拒。這三種需求,官方各有對應機能,從產品設定到 API 各有一條。還不熟基本操作的話,可以先看ChatGPT 新手教學把介面摸熟。

通道分散在不同位置:個人偏好在設定裡就能解,任務規則寫在提示詞裡,產品級的規則走 API 與工作區。越獄把每種需求都塞進使用者訊息那一層,層級天生壓不過規則,結果自然不穩。

自訂指示(custom instructions):把偏好寫進所有對話

自訂指示是 ChatGPT 的內建機能:你把希望它考慮的資訊寫下來,存檔後立即套用到所有對話。截至 2026 年 9 月 11 日查證,說明中心寫明所有方案都能用,Web、Desktop、iOS、Android 四個平台都支援。

它與單次提示詞的差別在範圍。提示詞管一次對話,自訂指示管所有對話,存檔後每一則新對話都自動帶上。它解決的問題也就清楚了:不必每次重講一遍背景,每個對話都會套用這份設定。

設定位置依平台而異。Web 與 Desktop 的路徑是 Settings → Personalization,iOS 與 Android 是 Settings → Customize ChatGPT,兩邊都要開啟 Enable customization。字元上限依方案而定,Free 與 Go 可以存 1,500 字元,Plus、Pro、Enterprise、Business、Education 可以存 5,000 字元。

有個誤解要先排掉:自訂指示不是越獄的溫和版。它影響回應的偏好與呈現,安全規則在更高的層級,自訂指示碰不到那裡。想把模型調整成你要的樣子,它是正路。想用它打開受限的功能,它沒有這個作用。

寫什麼有效?官方的定位是你希望它考慮的任何事情,回應偏好是它的主要用途:語言與語氣、回應長度、先給結論或先給過程、你的專業背景。例如「我在科技公司負責行銷,回應請用繁體中文,先給結論再給理由,提到外部資料時給連結」。

字元上限依方案為 1,500 或 5,000,上限較高的方案,可以把長期偏好一併放進來。

偏好變了就更新內容,回答跑偏就調整措辭。

有跨對話不變的偏好,它就能派上用場。設定之外的日常操作,從對話管理到功能開關,ChatGPT 使用教學有一篇完整整理。

提問結構:Identity、Instructions、Examples、Context

單次任務的結果,可以用提示詞的結構來組織。OpenAI 的提示工程指南給了現成框架:把提示詞分四段,Identity 交代目的與風格,Instructions 放規則,Examples 放範例,Context 放脈絡,指南建議 Context 放在結尾,讓模型帶著完整的規則讀脈絡。

把四段對回三種常見需求,位置就出來了。要固定角色,寫好 Identity。要固定格式,在 Instructions 寫明要求,用 Examples 示範。被拒答時,可以檢查是不是背景條件沒給足,把脈絡補進 Context,讓模型有依據判斷能回答到哪裡。

合法自訂的正路:偏好、任務規則、資料脈絡
將固定偏好、單次任務與查證資料分別放到適當位置。

拿一個任務做示範:把顧客投訴改寫成客服回覆。Identity 寫「你是客服訓練員,目標是把投訴改寫成中性回覆」。Instructions 寫「不改變事實,不指責顧客,長度一百字內」。Examples 放一組原始投訴與改寫結果。Context 補上「語氣參考公司既有的回覆」。

再舉一個產出行銷文案的例子。Identity 寫「你是電商的文案寫手,語氣親切但不誇張」。Instructions 寫「每版給三個標題選項,每個十五字內,不用驚嘆號」。Examples 放兩組過去表現好的標題。Context 補「商品是露營用的輕量摺疊椅,受眾是週末露營的小家庭」。

需要更多示範就加 few-shot:在提示詞裡放幾組輸入與輸出的範例,引導模型做到新任務,不必微調模型。需要資料就補檢索增強生成(RAG):在生成請求加入相關的脈絡資料,讓模型回答時有依據可查。

few-shot 與 RAG 解決的缺口不同,範例約定輸出的樣貌,資料提供回答的依據。要示範輸出樣貌,用範例,要回答有依據,就補資料。兩者可以並用,都寫在提示詞的結構裡。

官方在 GPTs 指示欄給的寫法建議,同樣適用在提示詞:正向、具體的指令勝過一長串禁令。與其寫十條「不要」,不如寫清楚「要什麼」。

四段不必每次都寫滿,需要哪些段落依任務的資訊決定。結構是工具,套用到妨礙溝通就本末倒置了。

被拒答卡住時,先檢查是不是條件給得太少,再考慮換問法。提示詞寫法的完整教學站上有專門一篇。

開發者訊息:把規則放在正確的層級

串接 API 的人,層級是看得到的參數。提示工程指南寫明:可以用 instructions 參數或訊息角色,給模型不同權限層級的指示。instructions 給的是高層級行為指示,優先於 input 裡的提示詞。developer message(開發者訊息)是應用開發者給的指示,排在 user message 之前。

instructions 參數的優先順序是重點:放在這裡的指示,排在 input 提示詞前面。同一句規則,放對位置就自動有高階效力,不需要任何繞路的技巧。開發者訊息同理,它的設計目的就是讓應用程式把規則放在使用者輸入之上。

說明中心把對位關係也寫得明白:自訂指示不會有 API,要用 Chat Completions API 的 system message(系統訊息)達到類似效果。想在應用裡固定行為,這兩個位置就是正確的層級。

越獄想冒充的就是這條通道。差別在層級:開發者訊息真的是高階指示,越獄只是用 User 層的內容假裝。對照五層結構會更明白,同樣一句規則,放在 developer message 是設計,放在 user message 是對話裡的一句話。規則要跨對話、跨使用者固定,就放進系統訊息或開發者訊息,讓它坐在本來就該坐的位置。

GPTs 指示欄與記憶功能

GPTs 的指示欄就是為固定行為設計的。說明中心寫到,指示定義 GPT 的行為:該做什麼、該怎麼回應、該避開什麼,而且套用到每一個對話。寫法建議同樣是正向具體,寫清楚做什麼,勝過一長串不做什麼。

與自訂指示相比,GPTs 的指示欄多了任務邊界:它定義的是一個小應用的行為,可以發布給其他人用。規則寫一次,每個對話都套用,這一點與自訂指示相同,差別在範圍與管理的位置。

現況要留意。個人 ChatGPT 帳號已不再開放建立與發布新的 GPTs,截至 2026 年 9 月 11 日查證,Free、Go、Plus、Pro 都在限制範圍內,既有的 GPTs 仍可使用與編輯。Business、Enterprise、Edu 工作區在設定與權限允許時,可以建立、編輯與發布。

限制的影響依身分不同。個人使用者還能用既有的 GPTs,也能繼續編輯自己先前建立的,缺的只是新建與發布。組織使用者走工作區,權限由管理員與方案決定。對照自訂指示,兩者剛好互補:自訂指示放跨對話的偏好,GPTs 裝任務級的規則。

同在設定裡的記憶功能走另一條路,處理的是你希望 ChatGPT 記住的資訊,與自訂指示分開管理。

四條通道解決的需求不同,門檻也不同。

機能解決什麼門檻
自訂指示把固定偏好套用到所有對話任何方案,在設定內完成
提示詞四段結構組織單次任務的身分、規則、範例與脈絡直接改寫問法即可
開發者訊息與 instructions 參數把固定規則放進 API 應用的高階層需串接 API
GPTs 指示欄為固定任務定義可重複使用的行為個人帳號停建新 GPTs,工作區方案可用

真的想測安全防護,走哪條路

把好奇心當成正當需求看,官方給了它自己的位置。

官方對安全測試的定位

模型的邊界在哪裡,是自然會出現的問題,Model Spec 對安全測試這件事有正式定位。文件在 Root 與 System 衝突的段落後寫道:能輸出受限內容、沒有安全護欄的模型,對安全測試與紅隊測試(red teaming)很有用。但公開部署的模型應該遵守 Model Spec,尤其不應因系統訊息而違反 Root 層原則。

這段話畫出了界線:測試的空間存在,位置在官方管理的情境裡。

若期待的是一個無限制的公開版本,文件的答案寫得明白:能輸出受限內容的模型有測試價值,公開部署的模型必須遵守規格書。測試用的自由與公開產品的限制,對應兩種不同的需求,各自有各自的位置。

紅隊測試網絡:有償、保密、官方委託

官方委託的管道叫紅隊測試網絡(Red Teaming Network),OpenAI 在 2023 年 9 月 19 日公告成立,邀請各領域專家參與模型安全的改善,工作在保密協議(NDA)下進行。

公告列出的條件包括:參與專案可獲報酬,工作受保密協議約束,時間投入可能低到一年 5 到 10 小時。這些條件對應的是受官方委託、需要保密的測試工作。

這條路適合真的要做安全工作的人:有領域專業、願意簽保密協議、一年排得出幾小時。它不適合想快速解鎖功能的用法,兩者的目的與身分都不同。

那一輪申請在 2023 年 12 月 1 日截止,公告寫明未來輪次可能重新開放。想等下一輪,可留意官方公告。

回到使用政策的禁止清單:未經同意的安全測試列在裡面。從這幾份文件可推,對防護好奇的正途是官方管道,不是在公開版上私測,兩條路的後果不同。

模型層級與使用者層級:兩種繞過的分工

站上另一篇文章講的是另一個層級的事件:Claude 的 Fable 5 模型因出口管制命令,自 2026 年 6 月 12 日起暫停 19 天,公開聲明提到研究人員回報的防護繞過方法是命令的相關背景。那是模型層級的暫停,涉及供應商、研究人員與管制命令。

使用者層級的繞過,後果落在帳號上,從警告、限制到停權都有文件可循。兩個層級的結論一致:繞過與安全事件都有實際後果,只是發生的層級不同。

分清楚層級,查資料時也省力。找模型防護的機制與事件,看模型層級的討論。找帳號後果與替代做法,看使用者層級的整理。兩種資訊常被放在同一個越獄標籤下,讀的時候先分層再吸收。

下一步:從自訂指示開始

今天打開 Settings,Web 與 Desktop 走 Personalization,手機走 Customize ChatGPT,開啟 Enable customization,把「你希望它怎麼回」寫進自訂指示。存檔之後,這份偏好套用到所有對話。

單次任務可以用 Identity、Instructions、Examples、Context 來組織,依任務資訊選用需要的段落。規則要跨對話固定,用自訂指示。要放進產品,用開發者訊息或工作區的 GPTs。

選擇的判斷很簡單:需求出現的頻率。偶爾一次的任務,現場把提示詞寫好就夠。天天都有的偏好,放自訂指示。整個團隊要共用的規則,放工作區的 GPTs 或 API 的指示參數。頻率對了,位置就對了。

模型拒絕回答時,先檢查背景條件是否影響判斷,有缺漏就補進對應的段落再問一次。

先檢查一次需求本身。想用越獄換到的,多半是固定格式、指定角色,或改善過度保守的回應:格式走提示詞結構,偏好走自訂指示,產品級規則走開發者訊息。拆開之後若還想測防護,問題就離開問法的層面,成了安全測試,應改走官方管道。

設定完成後,拿一個之前被拒答的問題重新問一次,比較前後的差異。如果這次回答了,差別可能在條件:模型有了判斷的依據。

常見問題

ChatGPT 越獄是什麼?
越獄是一種試圖讓 ChatGPT 偏離正常安全行為的用法,常見形式包括給模型另一個身分,或用編造的後果向它施壓。它不是官方功能,模型規格書把這類操作歸為低階內容對高階原則的干擾,並訓練模型加以抵抗。
ChatGPT 越獄違法嗎?
越獄違反的是 OpenAI 使用政策與使用條款裡的禁止事項,後果落在帳號層級,例如警告、限制或停權。這些文件能確認的範圍到此為止,法律層級的認定取決於各司法管轄的法律。
越獄會被停權嗎?
部分案件會逐步升級。說明中心把試圖繞過安全系統列為警告類別,警告是一份通知,讓你調整用法,不等於立即停權。收到警告後若持續違反,可能升級為進一步限制或永久停用帳號,條款也保留在認定違約或風險時直接暫停或終止存取的權利。
為什麼有時越獄看起來有效?
輸出帶機率性質,對話狀態不同,結果會浮動。2023 年 2 月 CNBC 的實測顯示,DAN 模式回答幾題後,原有防護似乎會重新接管,記者的評價是充其量時靈時不靈。官方規格書也明文訓練模型抵抗低階覆寫。
越獄拿到的回答能信嗎?
使用條款對輸出可靠性的規定一體適用:輸出可能不準確,不應當成唯一的事實來源,使用前必須自行評估。從行為不穩定的實測可推,這類輸出可能比正常輸出更難查核。
不想被拒答,有正當的方法嗎?
有。自訂指示把偏好寫進所有對話,再把提示詞分成 Identity、Instructions、Examples、Context 四段來組織,需要示範就加 few-shot,需要資料就補 RAG 的脈絡。被拒答時,先回頭檢查背景條件給得夠不夠,把缺的脈絡補上再重問一次。
工作上可以用越獄測試模型嗎?
使用政策把未經同意的安全測試列為禁止項,工作用途也不例外。想測防護,OpenAI 有紅隊測試網絡,成員參與專案有報酬、在保密協議下進行,後續輪次可能重新開放。
自訂指示和越獄差在哪?
自訂指示是官方機能,把回應偏好套用到所有對話,層級正當。越獄用使用者訊息冒充更高階的指示,試圖改變安全行為,踩在使用政策的禁止項上。前者調整輸出偏好,後者違反使用規則。

主題聚落|ChatGPT、Gemini 與生成式 AI 工具 看「AI 搜尋、GEO 與 AI 工具」中樞 →

相關文章

Whoops 巫普斯科技有限公司

專注技術 SEO、GEO/AEO 與 AI 搜尋實務。本站文章以可驗證資料、公開來源與實作觀察整理而成。

關於 Whoops編輯守則服務內容

想把這篇的方法用在自己的站上?

SEO 健檢、GEO/AEO 引用優化、網頁設計諮詢——把文章裡的方法落地到你的網站。