
ChatGPT 越獄是什麼?原理、風險與不越獄的替代問法
ChatGPT 越獄(jailbreak)是要模型違反自身安全規則的問法,效果時靈時不靈。OpenAI 把繞過防護列為禁止項,輕則警告、重則停權,想固定行為改用自訂指示與提示詞四段結構。
- ChatGPT 越獄
- Jailbreak
- DAN 提示詞
- 提示詞注入
- OpenAI 使用政策
- 模型安全
約 27 分鐘閱讀作者:Whoops 編輯團隊
本頁目錄
- DAN 現象:越獄是怎麼開始的
- 最早版本的 DAN 出現在 2022 年 12 月
- CNBC 實測:同一個問題,兩種回答
- 近 20 萬人的討論區,與未證實的監測傳聞
- 原理:指示有優先層級,越獄施力在低階那層
- 五層指示:Root、System、Developer、User、Guideline
- 模型規格書點名的四類手法
- 偽裝形式為什麼也行不通
- 越獄碰不到的三件事
- 帳號後果:從政策明文到申訴
- 政策與條款把繞過防護寫成禁止項
- 警告:部分違規會先收到通知
- 停權在什麼條件下發生
- 誤判可以申訴
- 輸出與職場:繞過之後你拿到什麼
- 可靠性條款照樣適用
- 帳號活動的責任範圍
- 公司網域帳號多一層變數
- 不越獄的替代問法:官方留好的四條通道
- 自訂指示(custom instructions):把偏好寫進所有對話
- 提問結構:Identity、Instructions、Examples、Context
- 開發者訊息:把規則放在正確的層級
- GPTs 指示欄與記憶功能
- 真的想測安全防護,走哪條路
- 官方對安全測試的定位
- 紅隊測試網絡:有償、保密、官方委託
- 模型層級與使用者層級:兩種繞過的分工
- 下一步:從自訂指示開始
ChatGPT 越獄(jailbreak)是一類特殊的問法:用設計過的對話內容,要模型違反自己被訓練出來的安全規則,去做它平常會拒絕的事。從官方文件與實測可以推,模型裡沒有等待解鎖的隱藏模式。這種問法效果時靈時不靈,拿到的回答沒有品質保證,帳號還可能收到警告甚至停權。想用它拿到的結果,官方其實留了正規的取得方式。
重點先看
越獄是要模型違反自身安全規則的問法。從層級設計可以推,模型內沒有被封住的第二模式,只有被訓練出來的行為邊界。
官方的模型規格書把指示分成五層,使用者訊息的位階壓不過上層,而且模型被明文訓練去抵抗低階覆寫。
使用政策與使用條款都把繞過防護列為明文禁止項。部分違規可能先收到警告,持續違反後可能受進一步限制或永久停權,誤判可以申訴。
繞過後拿到的輸出,可靠性條款照樣適用,行為不穩定時更難查核。
今天就能做:打開 Settings 裡的自訂指示,把「你希望它怎麼回」寫清楚,多數需求不必繞路。
DAN 現象:越獄是怎麼開始的
ChatGPT 在 2022 年 11 月上線。CNBC 在 2023 年 2 月 6 日發布的報導寫到,最早版本的 DAN 出現在 2022 年 12 月,起初就只是一段貼進輸入框的文字。DAN 是「Do Anything Now」的縮寫,翻出來是「現在什麼都能做」,意圖直接寫在名稱上。
同一篇報導交代了最早的版本抓到當時 ChatGPT 的一個傾向:把使用者的每個請求都當成立刻要滿足的任務。越獄手法沿著這個傾向發展,到 2023 年 2 月已經迭代到 5.0 版,接下來的 CNBC 實測就是拿這一版做的。
把時間感抓好,這件事就不神祕。ChatGPT 是 2022 年 11 月出現的新產品,使用者還在摸它的規則,繞過規則的玩法就同時出現了。DAN 的本體就只是一段文字,靠的只是模型讀了之後的行為變化。理解這一點,原理與風險都好讀。
最早版本的 DAN 出現在 2022 年 12 月
DAN 的形態在報導裡描述得很清楚:它讓 ChatGPT 對同一個問題給出兩種回答,一種照原本的規則走,另一種以 DAN 這個身分回答。報導把 DAN 稱為使用者創造的分身,也就是模型照著提示詞演出的另一個角色。
對使用者的介面來說,這個設計製造了一種對照:本體的拒絕與分身的回答並存。要緊的是判讀後半:分身能回答,並不代表它連到更強的能力,只代表模型在那個當下照著劇本走了。
這套問法在報導裡有兩個位置:討論區裡被當工具交換,媒體上被當現象報導。
5.0 版的提示詞裡有一套施壓設計:用虛構的扣點與消失後果向模型施壓,把對話包裝成一場輸了就有懲罰的遊戲。那些點數與後果都不存在,存在的只有被寫進對話裡的壓力。
施壓設計要單獨看一眼,因為它劃出越獄的邊界:它改變的只是對話裡的條件,改變不了模型的能力。把不存在的後果寫得像真的,能不能讓模型照做,實測的答案是時靈時不靈。
名稱承諾的是現在什麼都能做,實測給的答案是偶爾能做,落差就在這裡。
CNBC 實測:同一個問題,兩種回答
記者先拿政治人物的評價類問題去問。ChatGPT 本體以無法做主觀陳述為由拒答,DAN 版給了回答。換成暴力內容,本體同樣拒答,DAN 版起初照做。追問升級後,平台以倫理義務為由拒絕。
接著出現轉折。報導寫到,問了幾個問題之後,ChatGPT 原本的設定似乎重新啟動,蓋過 DAN。記者對這套手法的評價是:充其量只是時靈時不靈。
把實測的細節拆開看,更有參考價值。第一次成功出現在接受提示的初期,那時模型還照著提示詞的框架走。追問幾輪之後,原本的設定似乎重新取得主導權,同一個聊天視窗裡,前後行為可以完全相反。
這個實測把越獄的日常樣貌講完了:看起來成功,接著失效,防護重新接管。
近 20 萬人的討論區,與未證實的監測傳聞
報導也記錄了當時的社群樣貌:ChatGPT 的 subreddit 有近 20 萬訂閱者,在裡面交換提示詞與使用心得。有 Reddit 使用者相信 OpenAI 會盯著那個討論區並修補越獄,這是使用者的猜測,報導沒有證實。OpenAI 未立即回應該篇報導的置評請求。
訂閱數說明這個討論區當時有相當規模,報導也記錄裡面有人交換提示詞與使用心得。交換存在,代表有人想要模型不給的東西,手段的有效與代價仍要分開看。
監測傳聞的價值在提醒,不在證實。能由條款確認的是,帳號持有人須為帳號下發生的所有活動負責。
事件線可以固定下來:2022 年 11 月 ChatGPT 上線,2022 年 12 月最早版本的 DAN 出現,2023 年 2 月 DAN 5.0 接受媒體實測。這三個時間點構成事件線的全部。
把事件線與 Model Spec 對照,DAN 可以視為 User 層訊息試圖影響高階原則的案例。實測顯示行為時靈時不靈,帳號後果則依政策與條款判斷。
原理:指示有優先層級,越獄施力在低階那層
越獄為什麼時靈時不靈,答案寫在 OpenAI 自己公布的模型規格書(Model Spec)裡。這份文件交代模型應該怎麼行為,以 CC0 授權釋出到公眾領域,定位是使用政策的互補文件。
五層指示:Root、System、Developer、User、Guideline
Model Spec 把給模型的指示分成五層:Root、System、Developer、User、Guideline,位階高的指示蓋過位階低的。Root 是根本規則,文件明寫這一層無法被系統訊息、開發者或使用者覆寫,任何訊息都動不了它。
System 層屬於 OpenAI,放的是產品層級的指示。Developer 層屬於用 API 開發應用的人。User 層是終端使用者打進聊天框的訊息。Guideline 是預設行為,可以被更高階的指示隱性調整。你在對話裡打的任何內容,全部落在倒數第二層的 User。
五層的用意在於定順序。文件的原則是一句話:位階高的指示覆寫位階低的指示。OpenAI 放的系統訊息壓過開發者的設定,開發者的設定壓過你打的字。越獄等於在 User 這個低階施力點上,要求模型推翻它上面三層,這在結構上就是逆風。
用一個對照幫助記憶:Root 像根本大法,System 像公司規定,Developer 像各產品自己的規則,User 是你在對話裡的發言,Guideline 是沒有特別交代時的預設。想用一句發言改掉公司規定,結構上沒有這個位置。
Guideline 這一層常被漏掉,但它是五層裡唯一寫明可被隱性調整的。它裝的是預設行為,更高階的指示可以調整它。預設可調,根本規則不可動,兩種彈性的等級差很多。
越獄的施力點就卡在 User 層,想改寫的卻是排在它上面的規則。對一般使用者,這個分層的意義很實際:你在聊天框裡說的話,影響力天然低於 OpenAI 放的規則,也低於開發者放的規則。想自訂行為,方向是往有權限的層級走,低階的偽裝改變不了位階。

層級觀念也解釋日常的一個困惑:為什麼同一個要求,有時模型照做,有時拒絕。行為由多層指示一起決定,輸出又帶機率性質,合理的解釋是單次結果本來就會浮動。把浮動當成可以穩定利用的漏洞,是對這套結構的誤讀。
模型規格書點名的四類手法
Model Spec 對這類手法有直接分類。文件寫明,低階內容(包括模型自己先前的訊息)不應影響模型對高階原則的判讀,並列出四種樣態:命令式的覆寫企圖、道德施壓、邏輯施壓、角色扮演混淆。
分類裡藏著一個容易被忽略的細節:文件把模型自己先前的訊息也算進低階內容。意思是,就算模型先前照著越獄的劇本回答過,那些回答也不能拿來當繼續下去的理由。對話裡看起來已經成功的前幾輪,不能因此取得凌駕高階原則的權限。
命令式直截了當:要模型無視先前的指示。道德施壓聲稱不照做會發生嚴重後果,把責任推給模型。邏輯施壓提出一套特定的判讀方式,說服模型照做才符合規則。角色扮演混淆是讓模型進入另一個身分,用那個身分的規則蓋掉原本的規則,DAN 屬於這一類。
四類手法出自同一條規則,偽裝形式是另一條對應的規定。
| 手法類型 | 概念層描述 | 依據 |
|---|---|---|
| 命令式覆寫企圖 | 直接要模型無視既有指示 | Model Spec |
| 道德施壓 | 聲稱不照做會發生嚴重後果 | Model Spec |
| 邏輯施壓 | 用一套特定判讀方式說服模型照做 | Model Spec |
| 角色扮演混淆 | 讓模型以另一個身分的規則回答 | Model Spec |
| 偽裝形式 | 以倒寫、加密或另一種語言交付被禁止的內容,視同直接提供 | Model Spec |
偽裝形式為什麼也行不通
偽裝是另一條常見的路:把被禁止的內容倒著寫、加密,或換一種語言再要求模型處理。Model Spec 把這條路一起堵上,明文寫著以偽裝形式提供被禁止的內容,視同直接提供。
從規則的寫法可以讀出官方的判定方向:倒寫、加密、換語言都只是換包裝,內容被禁止,判定就跟著不變。
四類手法與偽裝形式共享同一個假設:模型的規則可以被對話內容改寫。規格書從層級結構上否定這個假設,分類表上的手法,都被規格書的規則蓋住。
越獄碰不到的三件事
從這裡推:越獄解鎖不了任何隱藏能力,它只是把對話推進模型被明文訓練去抵抗的狀態。這個判斷由三項依據構成:使用者訊息的位階壓不過上層、模型被訓練去抵抗低階覆寫、實測結果不可預期。
它碰不到的第一件事是 Root 層的根本規則,文件明寫任何訊息都覆寫不了。第二件事是層級本身:User 層的內容就是 User 層,對話裡寫什麼都不會把自己升級成 System 或 Developer。第三件事是回應的可預期性:把對話推進訓練目標的對立面,行為跟著不穩定,CNBC 的實測已經示範了這一點。
從 CNBC 實測能觀察到的,是當下有沒有產生回答,這不代表能力或指示層級被改變了。
分類的價值在於定位。日後看到任何流傳的問法,不必記名字,只要判斷它落在哪一類:是命令、施壓,還是換身分。判斷出類型,對結果的預期就有依據。
帳號後果:從政策明文到申訴
原理之外,帳號層級的後果有實際文件可查。OpenAI 把規則寫在使用政策與使用條款兩份文件裡,說明中心再補上警告與停權的細節。如果以為越獄的代價只是被拒答,文件的寫法會更正這個印象。使用政策、使用條款與說明中心的內容,查證於 2026 年 9 月 11 日。
使用政策管行為,開頭就寫究責原則與禁止清單。使用條款管合約,寫你能做什麼、不能做什麼、違反的後果。說明中心的文章再把警告與停用拆成使用者能讀懂的步驟。三份文件疊起來,就是完整的後果地圖。
政策與條款把繞過防護寫成禁止項
使用政策的開頭原則寫得直接:不當使用會被究責,破壞或繞過規則與防護,可能失去服務的存取權,或面臨其他處罰。同一段也寫明,OpenAI 保留在合理認為必要時拒絕存取的權利,理由是保護服務、使用者或其他任何人。
同一份政策的 Protect people 禁止清單裡,「繞過防護」與非法活動、武器發展、惡意網路活動並列。清單還有另一條相關項目:未經同意的安全測試。這兩條把兩條路線都標記出來,繞防護與私自測防護,各自都是禁止項。
與繞過防護並列的項目涉及非法活動、武器與惡意網路行為,這個分類把可能造成傷害的行為放在一起管理。
使用條款在「What you cannot do」清單有對應條文:不得干擾或中斷服務,包括繞過速率限制或各種限制,或繞過 OpenAI 加在服務上的防護措施與安全緩解機制。條款是合約,政策是使用規則,兩份文件從不同角度禁止同一件事。
政策版本有個時間點要記下:使用政策的變更紀錄最新一條停在 2025 年 10 月 29 日,那一天政策更新為跨 OpenAI 產品通用的一套。
警告:部分違規會先收到通知
部分違規會先收到警告,通知送到帳號的信箱。說明中心專文解釋警告的類別,其中一項就叫「試圖繞過安全系統」:試圖繞過內建的安全過濾或內容限制,或利用平台漏洞產生被禁止的內容,都屬於這一類,一個從內容限制下手,一個從系統弱點下手,後果走同一條線。
官方特別澄清警告的定位:警告是一份通知,讓你有機會檢視並調整用法,它不等於立即停權。但同一篇文章也寫明,收到警告後若繼續違反,可能導致進一步限制,或永久停用帳號。
官方對部分違規給的是有期限的機會:警告會指定調整的時間,期限內完成調整,就是它留的收尾空間。
收到警告可以做的事很有限,也很清楚:對照通知信裡的類別,停止對應的行為,在期限內完成調整。它能要到的東西是時間,時間用來改正,不是用來試第二次。
停權在什麼條件下發生
說明中心另一篇文章列出帳號停用的原因,總則寫得簡短:停用發生在使用者違反使用政策或服務條款時。原因之一的「違反服務條款」項下,明列繞過安全或存取限制。另一個原因是安全疑慮或未經授權的存取,偵測到可疑活動時,帳號可能先被暫時停用以保護安全。
使用條款給 OpenAI 的權限更寬。三種情況可以暫停或終止服務存取,或刪除帳號:認定你違反條款或政策、為了遵守法律、或你的使用行為可能對 OpenAI、使用者或任何其他人造成風險或傷害。
條款的用語也要看。它寫的是保留權利,沒有承諾必然執行,三個觸發條件涵蓋違約、守法與風險防範。判斷的空間在官方手上,個別案件怎麼處理,決定權也在官方這一側。
把停用文章的原因整理起來,繞過相關的路徑有兩條:直接違反條款與政策是一條,收到警告後未在期限內改善是另一條。什麼行為觸發什麼後果,文件上對得起來。
誤判可以申訴
使用政策的原則段保留了申訴權:如果你認為執行有誤,可以提出申訴,OpenAI 會著手處理。實際管道寫在說明中心:用警告或停用通知信裡的連結提交申訴,信箱已無法存取時,改走停用專文列的 openai.com/form/appeal/ 表單,沒收到通知又失去帳號存取,就改用說明中心的客服對話。
申訴是為誤判留的救濟,管道是公開的,誤判不會因為收不到信就無解。
後果有階段可循,也有直接處置的保留權,每一步都有官方文件對應。
| 階段 | 發生什麼 | 依據 |
|---|---|---|
| 政策明文 | 繞過防護列為禁止項,破壞規則可能失去存取權 | 使用政策、使用條款 |
| 警告 | 收到通知,類別含試圖繞過安全系統,有機會調整用法 | 說明中心帳號警告專文 |
| 升級 | 警告後未在指定期間改善,可能進一步限制或永久停用 | 說明中心帳號警告與停用專文 |
| 停用 | 違反政策或條款、安全疑慮、警告未處理都可能觸發 | 說明中心帳號停用專文、使用條款 |
| 申訴 | 用通知信連結提交,信箱無法存取時改走表單,未收到通知則用客服對話 | 說明中心兩篇專文 |
輸出與職場:繞過之後你拿到什麼
帳號後果之外,繞過直接改變的東西是你拿到的輸出,與它進入工作流程之後的責任。
可靠性條款照樣適用
使用條款對輸出可靠性有完整規定:輸出可能不準確,不應把它當成唯一的事實來源,或專業建議的替代品。
條款的三個層次可以分開讀。第一層講性質:機器學習的輸出有機率性質,可能出錯。第二層講用途:不能當唯一的事實來源,也不能取代專業建議。第三層講動作:使用或分享前,必須自行評估準確與適切,視情況加上人工審查。三層疊起來,輸出的最終責任落在使用者身上。
專業建議那一條界線要單獨記。條款寫明輸出不能取代專業建議,需要專業判斷的用途,不能把模型回答當成專業建議的替代品,使用或分享前仍要評估準確與適切。這條界線對繞過後的輸出一樣成立。
這條規定沒有區分正常輸出與繞過後的輸出,一體適用。查核的深度也要對等:從條款與實測可推,繞過後輸出的風險不低於正常輸出,行為不穩定時,同一個視窗裡前後的回答可以完全相反。
把條款放回越獄的脈絡:繞過沒有換到任何可靠性上的讓步,交換來的只有行為的不穩定。
實際查核可以縮成三個動作:對照可驗證的資料、檢查關鍵數字與名稱、重要用途加一層人工判讀。模型生成的基本性質不因問法改變,幻覺的機制與檢查方法站上另有一篇完整說明。
舉一個具體的查核例子:繞過後模型給出一組統計數字,對照的動作是找回原始報告核對年份與計算口徑,對不起來就整組退回,不從裡面挑順眼的採用。
帳號活動的責任範圍
使用條款把帳號責任寫在註冊與存取的段落:不得分享帳號憑證,不得把帳號交給別人使用,帳號下發生的所有活動都由你負責。自己帳號裡的每一次嘗試,責任都落在自己頭上。
帳號裡的活動由你負責,平台端有自動監控偵測潛在違規,重大安全案件經人工審查後可能移交執法。
Model Spec 也交代了監控的存在。OpenAI 使用自動監控偵測潛在的使用政策違規,經人工審查後,涉及迫切的嚴重人身傷害威脅或其他嚴重公共安全風險的案件,可能移交執法機關。移交的門檻寫得很高,條件是迫切的嚴重傷害威脅,或其他嚴重公共安全風險。
公司網域帳號多一層變數
條款對公司網域另有規定。用公司信箱開的帳號,可能被加進組織的商務帳號。帳號轉移之後,組織的管理員可以控制帳號,包括存取帳號裡的內容,以及限制或移除帳號的存取權。
由這些規定可以判讀,工作帳號上的風險可能擴及組織。公司網域的帳號若已轉移到組織的商務帳號,管理員可以存取帳號裡的內容,也能限制或移除帳號的存取權。對話內容進入組織可存取的範圍之後,該由誰判讀,就不再是一個人能決定的事。
工作場景的判斷可以很簡單:想試新的問法,用自己的個人帳號與公開安全的內容,工作成果要進產品,走 API 與開發者訊息。兩種用途分開處理,責任界線跟著清楚。
再往實務走一步。行銷團隊想讓模型固定用品牌語氣回覆,正確做法是把語氣規則寫進 GPTs 的指示欄或自訂指示。工程團隊要在產品裡固定輸出格式,正確做法是開發者訊息。兩種需求都有現成的位置,不必動到越獄那條路。
不越獄的替代問法:官方留好的四條通道
回到越獄背後的需求:要固定格式、要固定角色,或只是不想被誤拒。這三種需求,官方各有對應機能,從產品設定到 API 各有一條。還不熟基本操作的話,可以先看ChatGPT 新手教學把介面摸熟。
通道分散在不同位置:個人偏好在設定裡就能解,任務規則寫在提示詞裡,產品級的規則走 API 與工作區。越獄把每種需求都塞進使用者訊息那一層,層級天生壓不過規則,結果自然不穩。
自訂指示(custom instructions):把偏好寫進所有對話
自訂指示是 ChatGPT 的內建機能:你把希望它考慮的資訊寫下來,存檔後立即套用到所有對話。截至 2026 年 9 月 11 日查證,說明中心寫明所有方案都能用,Web、Desktop、iOS、Android 四個平台都支援。
它與單次提示詞的差別在範圍。提示詞管一次對話,自訂指示管所有對話,存檔後每一則新對話都自動帶上。它解決的問題也就清楚了:不必每次重講一遍背景,每個對話都會套用這份設定。
設定位置依平台而異。Web 與 Desktop 的路徑是 Settings → Personalization,iOS 與 Android 是 Settings → Customize ChatGPT,兩邊都要開啟 Enable customization。字元上限依方案而定,Free 與 Go 可以存 1,500 字元,Plus、Pro、Enterprise、Business、Education 可以存 5,000 字元。
有個誤解要先排掉:自訂指示不是越獄的溫和版。它影響回應的偏好與呈現,安全規則在更高的層級,自訂指示碰不到那裡。想把模型調整成你要的樣子,它是正路。想用它打開受限的功能,它沒有這個作用。
寫什麼有效?官方的定位是你希望它考慮的任何事情,回應偏好是它的主要用途:語言與語氣、回應長度、先給結論或先給過程、你的專業背景。例如「我在科技公司負責行銷,回應請用繁體中文,先給結論再給理由,提到外部資料時給連結」。
字元上限依方案為 1,500 或 5,000,上限較高的方案,可以把長期偏好一併放進來。
偏好變了就更新內容,回答跑偏就調整措辭。
有跨對話不變的偏好,它就能派上用場。設定之外的日常操作,從對話管理到功能開關,ChatGPT 使用教學有一篇完整整理。
提問結構:Identity、Instructions、Examples、Context
單次任務的結果,可以用提示詞的結構來組織。OpenAI 的提示工程指南給了現成框架:把提示詞分四段,Identity 交代目的與風格,Instructions 放規則,Examples 放範例,Context 放脈絡,指南建議 Context 放在結尾,讓模型帶著完整的規則讀脈絡。
把四段對回三種常見需求,位置就出來了。要固定角色,寫好 Identity。要固定格式,在 Instructions 寫明要求,用 Examples 示範。被拒答時,可以檢查是不是背景條件沒給足,把脈絡補進 Context,讓模型有依據判斷能回答到哪裡。

拿一個任務做示範:把顧客投訴改寫成客服回覆。Identity 寫「你是客服訓練員,目標是把投訴改寫成中性回覆」。Instructions 寫「不改變事實,不指責顧客,長度一百字內」。Examples 放一組原始投訴與改寫結果。Context 補上「語氣參考公司既有的回覆」。
再舉一個產出行銷文案的例子。Identity 寫「你是電商的文案寫手,語氣親切但不誇張」。Instructions 寫「每版給三個標題選項,每個十五字內,不用驚嘆號」。Examples 放兩組過去表現好的標題。Context 補「商品是露營用的輕量摺疊椅,受眾是週末露營的小家庭」。
需要更多示範就加 few-shot:在提示詞裡放幾組輸入與輸出的範例,引導模型做到新任務,不必微調模型。需要資料就補檢索增強生成(RAG):在生成請求加入相關的脈絡資料,讓模型回答時有依據可查。
few-shot 與 RAG 解決的缺口不同,範例約定輸出的樣貌,資料提供回答的依據。要示範輸出樣貌,用範例,要回答有依據,就補資料。兩者可以並用,都寫在提示詞的結構裡。
官方在 GPTs 指示欄給的寫法建議,同樣適用在提示詞:正向、具體的指令勝過一長串禁令。與其寫十條「不要」,不如寫清楚「要什麼」。
四段不必每次都寫滿,需要哪些段落依任務的資訊決定。結構是工具,套用到妨礙溝通就本末倒置了。
被拒答卡住時,先檢查是不是條件給得太少,再考慮換問法。提示詞寫法的完整教學站上有專門一篇。
開發者訊息:把規則放在正確的層級
串接 API 的人,層級是看得到的參數。提示工程指南寫明:可以用 instructions 參數或訊息角色,給模型不同權限層級的指示。instructions 給的是高層級行為指示,優先於 input 裡的提示詞。developer message(開發者訊息)是應用開發者給的指示,排在 user message 之前。
instructions 參數的優先順序是重點:放在這裡的指示,排在 input 提示詞前面。同一句規則,放對位置就自動有高階效力,不需要任何繞路的技巧。開發者訊息同理,它的設計目的就是讓應用程式把規則放在使用者輸入之上。
說明中心把對位關係也寫得明白:自訂指示不會有 API,要用 Chat Completions API 的 system message(系統訊息)達到類似效果。想在應用裡固定行為,這兩個位置就是正確的層級。
越獄想冒充的就是這條通道。差別在層級:開發者訊息真的是高階指示,越獄只是用 User 層的內容假裝。對照五層結構會更明白,同樣一句規則,放在 developer message 是設計,放在 user message 是對話裡的一句話。規則要跨對話、跨使用者固定,就放進系統訊息或開發者訊息,讓它坐在本來就該坐的位置。
GPTs 指示欄與記憶功能
GPTs 的指示欄就是為固定行為設計的。說明中心寫到,指示定義 GPT 的行為:該做什麼、該怎麼回應、該避開什麼,而且套用到每一個對話。寫法建議同樣是正向具體,寫清楚做什麼,勝過一長串不做什麼。
與自訂指示相比,GPTs 的指示欄多了任務邊界:它定義的是一個小應用的行為,可以發布給其他人用。規則寫一次,每個對話都套用,這一點與自訂指示相同,差別在範圍與管理的位置。
現況要留意。個人 ChatGPT 帳號已不再開放建立與發布新的 GPTs,截至 2026 年 9 月 11 日查證,Free、Go、Plus、Pro 都在限制範圍內,既有的 GPTs 仍可使用與編輯。Business、Enterprise、Edu 工作區在設定與權限允許時,可以建立、編輯與發布。
限制的影響依身分不同。個人使用者還能用既有的 GPTs,也能繼續編輯自己先前建立的,缺的只是新建與發布。組織使用者走工作區,權限由管理員與方案決定。對照自訂指示,兩者剛好互補:自訂指示放跨對話的偏好,GPTs 裝任務級的規則。
同在設定裡的記憶功能走另一條路,處理的是你希望 ChatGPT 記住的資訊,與自訂指示分開管理。
四條通道解決的需求不同,門檻也不同。
| 機能 | 解決什麼 | 門檻 |
|---|---|---|
| 自訂指示 | 把固定偏好套用到所有對話 | 任何方案,在設定內完成 |
| 提示詞四段結構 | 組織單次任務的身分、規則、範例與脈絡 | 直接改寫問法即可 |
| 開發者訊息與 instructions 參數 | 把固定規則放進 API 應用的高階層 | 需串接 API |
| GPTs 指示欄 | 為固定任務定義可重複使用的行為 | 個人帳號停建新 GPTs,工作區方案可用 |
真的想測安全防護,走哪條路
把好奇心當成正當需求看,官方給了它自己的位置。
官方對安全測試的定位
模型的邊界在哪裡,是自然會出現的問題,Model Spec 對安全測試這件事有正式定位。文件在 Root 與 System 衝突的段落後寫道:能輸出受限內容、沒有安全護欄的模型,對安全測試與紅隊測試(red teaming)很有用。但公開部署的模型應該遵守 Model Spec,尤其不應因系統訊息而違反 Root 層原則。
這段話畫出了界線:測試的空間存在,位置在官方管理的情境裡。
若期待的是一個無限制的公開版本,文件的答案寫得明白:能輸出受限內容的模型有測試價值,公開部署的模型必須遵守規格書。測試用的自由與公開產品的限制,對應兩種不同的需求,各自有各自的位置。
紅隊測試網絡:有償、保密、官方委託
官方委託的管道叫紅隊測試網絡(Red Teaming Network),OpenAI 在 2023 年 9 月 19 日公告成立,邀請各領域專家參與模型安全的改善,工作在保密協議(NDA)下進行。
公告列出的條件包括:參與專案可獲報酬,工作受保密協議約束,時間投入可能低到一年 5 到 10 小時。這些條件對應的是受官方委託、需要保密的測試工作。
這條路適合真的要做安全工作的人:有領域專業、願意簽保密協議、一年排得出幾小時。它不適合想快速解鎖功能的用法,兩者的目的與身分都不同。
那一輪申請在 2023 年 12 月 1 日截止,公告寫明未來輪次可能重新開放。想等下一輪,可留意官方公告。
回到使用政策的禁止清單:未經同意的安全測試列在裡面。從這幾份文件可推,對防護好奇的正途是官方管道,不是在公開版上私測,兩條路的後果不同。
模型層級與使用者層級:兩種繞過的分工
站上另一篇文章講的是另一個層級的事件:Claude 的 Fable 5 模型因出口管制命令,自 2026 年 6 月 12 日起暫停 19 天,公開聲明提到研究人員回報的防護繞過方法是命令的相關背景。那是模型層級的暫停,涉及供應商、研究人員與管制命令。
使用者層級的繞過,後果落在帳號上,從警告、限制到停權都有文件可循。兩個層級的結論一致:繞過與安全事件都有實際後果,只是發生的層級不同。
分清楚層級,查資料時也省力。找模型防護的機制與事件,看模型層級的討論。找帳號後果與替代做法,看使用者層級的整理。兩種資訊常被放在同一個越獄標籤下,讀的時候先分層再吸收。
下一步:從自訂指示開始
今天打開 Settings,Web 與 Desktop 走 Personalization,手機走 Customize ChatGPT,開啟 Enable customization,把「你希望它怎麼回」寫進自訂指示。存檔之後,這份偏好套用到所有對話。
單次任務可以用 Identity、Instructions、Examples、Context 來組織,依任務資訊選用需要的段落。規則要跨對話固定,用自訂指示。要放進產品,用開發者訊息或工作區的 GPTs。
選擇的判斷很簡單:需求出現的頻率。偶爾一次的任務,現場把提示詞寫好就夠。天天都有的偏好,放自訂指示。整個團隊要共用的規則,放工作區的 GPTs 或 API 的指示參數。頻率對了,位置就對了。
模型拒絕回答時,先檢查背景條件是否影響判斷,有缺漏就補進對應的段落再問一次。
先檢查一次需求本身。想用越獄換到的,多半是固定格式、指定角色,或改善過度保守的回應:格式走提示詞結構,偏好走自訂指示,產品級規則走開發者訊息。拆開之後若還想測防護,問題就離開問法的層面,成了安全測試,應改走官方管道。
設定完成後,拿一個之前被拒答的問題重新問一次,比較前後的差異。如果這次回答了,差別可能在條件:模型有了判斷的依據。






