
決策模型是什麼?從 Jev 看行銷應用
決策模型不做文字生成,只回傳型別化答案與機率,Choice、Score 另附信心值。以 TypeSafe AI 的 System One 模型 Jev 為例,解析 Choice、Score、Noul 三種題型的介面與行銷判斷對應,信心值門檻怎麼設,官方速度與成本數字的正確讀法,中文限制與六個行銷應用落點。
- 決策模型
- 決策型 AI 模型
- System One 模型
- Jev
- TypeSafe AI
- Jev 是什麼
- Jev 題型
- Choice Score Noul
- 信心值
- 機率校準
- Jev 價格
- Jev 行銷應用
- 名單評分
- 訊息分類自動化
約 27 分鐘閱讀作者:Whoops 編輯團隊
決策型 AI 模型,指的是不做文字生成、專門回傳結構化判斷的模型類別。TypeSafe AI 在 2026 年 9 月 15 日發布的 System One 模型 Jev,把這個類別帶進公開市場:餵給它一段狀態和一組事先定義好的題目,它按題型回傳型別化答案與機率,Choice、Score 另附信心值,讓程式直接拿去分流、排序與觸發動作。依官方發布文章,Jev 的端對端回應時間落在 70 至 500 毫秒,輸入計價為每百萬 token 0.042 美元而輸出不計費,而且因為所有可能的輸出與結構在呼叫前就定義完成,模型不會犯型別錯誤,也不會有生成模型那種憑空生成的文字輸出。對行銷團隊來說,這個類別的意義可以一句話講完:流程裡重複出現、答案封閉的判斷,例如這封來信是不是採購意圖、這則留言要不要遮蔽、這筆名單值不值得立刻跟進,多了一種專門承接這類判斷的模型選項。
這個新品類出現的時機,放在模型競賽的脈絡裡看會更清楚。Almeida 稱模型圈對人類語言已經夠好了四年,競賽主軸一直在對話與推理的上限,TypeSafe 卻反其道,發布了一個完全不生成文字的模型,並替這個類別取名 System One 模型,Jev 是 TypeSafe 自述的這個類別第一個模型。背景脈絡可以參考維基百科對 Jev 的條目:TypeSafe 是 2024 年成立的公司,Jev 發布同日宣布了由 DCVC 領投的 4,000 萬美元種子輪。競速的軸線從更會想,換成更快更省地判斷,TypeSafe 正試圖把這類判斷做成可單獨使用的模型服務,而不是聊天模型的附屬功能。
閱讀路線可以按角色調整。平常在導入代理系統的讀者,建議先複習AI Agent 的運作原理,決策模型在代理流程裡扮演快速判斷層,與生成模型分工。負責客服或社群經營的讀者,可以對照聊天機器人的三種類型與挑選方法,看決策層補在哪個環節。負責名單與轉換的讀者,可以直接從判斷盤點一節讀起,再回頭補機制。進入細節前,先把重點收攏:
- 決策型模型是獨立類別:讀進一段狀態,回傳型別化答案與機率,Choice、Score 另附信心值,不寫文字、不給說明,官方把它比喻為前沿智慧等級的函式呼叫。
- 三種題型是這個類別的介面:Choice 從選項清單挑一個,Score 按量尺評分,Noul 回答陳述為真的機率,三種可混在同一個請求裡平行評估。
- 速度與成本是數量級差異:官方口徑回應時間 70 至 500 毫秒、輸出免費,但對照數字出自廠商自辦評測,採用前要打折解讀。
- 信心值校準是自動化的門票:官方訓練目標讓高信心對應高正確率,程式才能照信心值決定自動動作或轉交人工。
- 限制要記住:只吃文字輸入、英文以外語言(含中文)表現較弱、不給判斷理由、仍在早期存取階段。
- 行銷端六個起步落點:進線與名單分級、客服與社群分流、廣告與品牌安全檢查、大量語料普查、顧客聲音特徵化、AI 工作流守門與模型路由。
為什麼需要一個只做判斷的模型類別
這個類別的起點,是一位 ChatGPT 團隊成員的挫折感。創辦人 Diogo Almeida 在 OpenAI 待了約四年,參與 RLHF、InstructGPT、ChatGPT 與 GPT-4 的研究工作,2024 年離開創辦 TypeSafe。他對TechCrunch 的說法是:我們把閃電裝進了瓶子裡,它卻沒有真的被用起來。他的診斷是問題出在大家一直在最佳化人類語言,模型對人類語言已經夠好了四年,但對自動化沒有幫助,因為電腦說的是另一種語言。官方發布文章把同一個提問寫得更直白:模型超人類地會聊天已經好幾年,自動化在哪裡。
官方入門說明對這個落差給出了技術層面的解釋。大型語言模型的設計目的是產出給人讀的文字,當你需要模型下一個程式要消費的判斷時,就出現了錯配:你等於是在逼一個文字生成系統輸出結構化決策,再把結果解析回程式能依賴的東西。字串很有彈性,但程式要用它之前得先解析、驗證,而這一步可能出錯。行銷場景裡這個錯配很好懂:請聊天模型判斷這封信是不是詢價,它可能先寒暄兩句再給答案,答案的格式每次還不一樣。
官方建構指南用三種軟體架構把選擇講清楚。傳統軟體是由簡單而可靠的軟體基本元件組成的複雜決策樹。代理(agent)則是模型自己解讀指令、自己選下一步,有人在旁監看時表現不錯,但每多跑一圈迴圈,就多一次出軌的機會。第三種是官方所稱的 AI 軟體:程式碼負責確定性工作並持有控制流程,模型只出現在系統需要可程式化的常識判斷、或需要解讀非結構化資料的位置,每個 AI 任務都被限定成小而封閉的題目。
把這個架構圖翻成行銷語言(這段對照屬於編輯上的整理,不是官方的行銷文件):行銷流程裡的判斷節點其實到處都是,過去只有三種下場。量小的靠人工刷,量大的靠手寫規則擋,講不清楚規則的塞給聊天模型加一堆提示詞。人工貴、規則脆、提示詞不可靠,三者共同造成了「明明模型很聰明,流程裡卻到處是人肉判斷」的現象。決策模型給了第四個選項:把判斷寫成封閉題目,讓模型回傳一個可信任的數字,組合邏輯留在自己的程式碼裡。
官方入門科普裡有一個值得行銷人記住的預期:大規模 AI 自動化會更接近百分之九十九的機器對機器互動,加上百分之一的人機互動。這句話翻譯過來,就是大多數判斷不需要一篇人讀的說明文,只要一個行為可預測、附帶誠實不確定性的答案。同一頁也點破了目前生成模型的根本限制:一段輸出可以對人很有說服力,卻不夠可靠到能無人值守地自動化,人類偏好與機器可信賴度是兩個不同的最佳化目標。
生成、代理、決策:三種 AI 的分工界線
把行銷會用到的 AI 分成三類,決策模型的位置就清楚了(三類的劃分是為了定位,不是官方分類):生成模型輸出文字給人讀,寫文案、寫信、出摘要。代理在迴圈裡自己決定下一步,LangChain 的整合文章對代理的定義是模型決定做什麼、工具執行、模型評估結果,循環到任務完成。決策模型則只回答你預先定義好的封閉題目,回傳型別化答案與機率。三者的輸入輸出形態不同,計費結構不同,適合的任務也不同。
成本與速度的差距是數量級的。官方對照表裡,現有大型語言模型的輸入單價落在每百萬 token 0.20 到 10 美元,輸出又比輸入貴約五倍。Jev 輸入每百萬 token 0.042 美元、輸出因為只是短小的結構化答案而免費。速度上,官方引用的第三方排行顯示前沿模型的端對端回應時間落在 3 至 329 秒,Jev 是 70 至 500 毫秒。這個差距改變的是可用場景的性質:3 秒以上的回應難以塞進即時的產品迴圈,幾百毫秒的回應則可以,也能放進每秒多次的批次處理。
分工不是取代。LangChain 的建議直接了當:開放式推理與生成交給大型語言模型,過程中快速而結構化的判斷交給 Jev。官方文件也明講,不存在把代理引擎換成 Jev 的設定,因為兩者解決的是不同問題。實務上決策層最自然的位置,是墊在代理與生成模型底下:代理框架已出現現成的守門機制,例如 LangChain 的 AutoModeMiddleware 在工具執行前用 Jev 檢查並擋下高風險動作,客服代理平台這類產品的意圖判斷環節也是同一層的形狀,決策模型把這一層從閉源框架裡解放出來,變成行銷技術團隊可以自己定義規格的元件。
三類能力的界線,用一張表整理:
| 面向 | 生成模型 | 代理 | 決策模型 |
|---|---|---|---|
| 輸出形態 | 文字、程式碼 | 多步驟行動與工具呼叫 | 型別化答案+機率,Choice/Score 另有信心值 |
| 典型速度 | 秒級(官方引第三方排行 3 至 329 秒) | 取決於迴圈圈數 | 官方口徑 70 至 500 毫秒 |
| 計費結構 | 輸入計費、輸出貴約五倍 | 每步都是模型呼叫 | 輸入計費、輸出免費 |
| 適合的行銷任務 | 文案、信件、摘要、開放建議 | 跨系統的多步驟作業 | 分類、評分、真偽判斷、路由 |
| 不適合 | 答案封閉的高量判斷 | 無人監看的關鍵流程 | 任何需要文字產出的工作 |
表中的速度與計費數字來自 TypeSafe 官方文件,屬於廠商自述口徑,細部的打折原則在後面限制一節統一說明。表本身想表達的只有一件事:三類模型是上下游關係,不是競爭關係,行銷技術棧裡的每個節點該用哪一類,取決於那個節點要的是產出、行動,還是判斷。
三種題型對應三種行銷判斷
題型是決策型模型的介面,全部的變化集中在三種。Choice 處理「從幾個選項裡挑一個」的題目:你先定義選項清單,模型回傳選中的選項、每個選項的機率分布,以及一個整體信心值。官方概念頁的例子是客服工單分流,該給帳務組、技術組還是帳號組。行銷端來信分類、留言主題歸屬、進線分派這類需求都是這個形狀:來信是詢價、支援、投訴還是垃圾訊息,留言屬於哪個產品主題,一筆進線該歸哪個負責人。
Score 處理「按量尺打分數」的題目:你定義一組有序的等級或數值區間,模型回傳連續分數、各等級的機率分布與信心值。官方例子是把顧客訊息按沮喪程度評 0 到 2 級,模型可能回傳 1.4 這種落在等級之間的分數,同時告訴你它的判斷分散在哪些等級上。行銷端的對應場景是名單品質、訊息急迫度、內容與品牌調性的吻合度,這類需要排序而非二分的判斷都適用。
Noul 是三種裡最特別的,回答「某個陳述是否為真」,回傳一個 0 到 1 的機率值,接近 1 是強烈肯定,接近 0.5 代表模型認為兩種答案的機率差不多。官方 Noul 說明頁的實測數字很有畫面:一句我已經問三次了,可以讓真人來處理嗎,在要求真人這題上得到 0.99。一句謝謝,問題解決了只剩 0.02。而你是機器人嗎這種隱約想找真人卻沒明說的句子,落在 0.40 的模糊帶,正是需要程式端設閾值接手的地方。Noul 沒有獨立的信心欄位,因為真偽只有兩個結果,單一機率值已經描述了整個分布。
題目怎麼寫,官方給的原則叫原子題:一題只問一件範圍明確、有經驗的人幾秒內能判斷的事。與其問這份商業計畫書幾分,不如拆成市場規模、技術可行性、差異化三題分別評,再用自己的公式在程式裡加權組合,優先順序改變時改個係數就好,不必重寫提示詞。工程上最划算的一點是三種題型可以混在同一個請求裡:所有題目對同一段狀態平行、彼此隔離地評估,加題目幾乎不增加回應時間,也不會因為題目變多而互相干擾,官方稱這個性質不會產生傳統長提示常見的上下文腐化。
題型介面與行銷判斷的對應,整理成表:
| 介面形態 | 問的形式 | 回傳內容 | 行銷端例子 |
|---|---|---|---|
| Choice | 從選項清單挑一個 | 選中項、各選項機率、信心值 | 來信分類:詢價/支援/投訴/垃圾 |
| Score | 按量尺或等級評分 | 連續分數、各等級機率、信心值 | 名單品質、訊息急迫度評分 |
| Noul | 陳述是否為真 | 0 至 1 的機率值 | 這封信是否明確要求報價 |
| 混搭 | 多題同一請求平行評估 | 逐題答案互不干擾 | 一次呼叫完成分類+急迫度+資格判斷 |
把題目寫好,性質上是在寫規格,不是在馴服模型。Jev 不開放用自己的資料微調,同一組權重服務所有客戶,領域知識有三個注入位置:專屬內容、內部紀錄與參考資料放進狀態欄位。領域規則與邊界案例寫進每題的指示與評分標準。寬泛的判斷拆成原子題後,組合邏輯留在自己的程式碼。官方對狀態的比喻很實用:把狀態想成你在請一組專家下判斷前,會先遞給他們看的材料。版本管理、A/B 測試與退版,從此回到工程常規。

信心值與閾值:把誤判成本寫進程式
決策型模型能不能接流程,除了看準確率,也要看校準。校準的定義很樸素:在被標 0.2 機率的那群預測裡,約有兩成真的發生,標 0.8 的群組約八成。官方的訓練方法 RLCD 直接最佳化這個性質,讓信心越高、正確率越高成為模型的內建屬性,而不是靠提示詠唱出來的附註。要注意校準是對群組預測成立的統計性質,不保證任何單一答案正確,這條但書官方文件重複了兩次,工程上它就是你必須保留人工出口的原因。
信心值本身是從答案的機率分布算出來的統計量,Choice 與 Score 每題都附。官方信心值說明給的起手式是把信心分三段:高信心自動動作,中信心謹慎處理,可能是請使用者確認、標記覆核或先補資訊,低信心不要動作,路由給真人、要求釐清或退回另一套系統。這個三段式就是行銷自動化裡「自動回覆、送審、轉人工」三條路的模型版。
官方接著提醒,信心門檻不是一個數字,同一個系統裡不同動作該有不同的門檻,取決於做錯的後果。官方信心值頁的銀行操作範例:信心低於 0.5 轉真人,通過這道門檻後查餘額可直接顯示,核准轉帳在信心高於 0.9 時仍先確認再執行,介於門檻之間的轉帳請求也先確認意圖。搬到行銷流程,自動回覆一則社群留言的門檻可以低,自動發出退款、把名單標成高意向並通知業務主管,門檻就該拉高,具體數字沒有官方建議值,原則只有一條:誤判越貴,門檻越高。

開源社群對這個設計的評價值得參考。打造開源模型工具 Pi 的公司 Earendil,其技術長 Armin Ronacher 對 TechCrunch 說,這種模型等於把幻覺問題某種程度交還給使用端:如果只回來 50% 機率,也許該當擲硬幣看,棄置它。如果是 95%,就可以拿來做事。這句話的另一面是,採用決策模型的團隊等於把「多大的不確定性可以接受」寫成程式碼,這是責任,也是控制權。
把信心值與路由結合,官方給的意圖路由模式是完整教材。客服系統裡,一個 Choice 問進線意圖、一個 Score 問複雜度,意圖信心不足 0.5 直接轉真人。查訂單狀態的走訂單查詢的確定性程式碼,完全不用模型。產品問題與退換貨分流給兩個載入不同背景脈絡的專家模型。投訴類再看複雜度分數決定交模型還是交人。官方的收束句說明了經濟學:分類由決策模型一次快速呼叫完成,昂貴的資源只在真正需要的請求上被啟動。
行銷流程的判斷盤點:六個可起步的落點
知道機制之後,行銷團隊的第一步不是寫程式,是盤點。把行銷流程攤開,列出所有重複出現、答案封閉的判斷,對照官方用途地圖的任務形狀:分類是只有一個正確類別該勝出,偵測是要某屬性出現的機率,評分是答案落在有序量尺上,路由是類別決定下一行程式碼,查核是某產物要被檢查特定錯誤模式,特徵抽取是把非結構化輸入轉成下游模型的訊號。官方依產業列出的用途裡,與行銷直接相關的有六個落點,逐一展開。
落點一,進線與名單的分級路由。官方對名單開發列出的任務包括:把公司檔案、決策者介紹與進線訊息拿去比對理想客戶輪廓,評產業吻合度與企業成熟度,偵測買方相關性、痛點與採購意圖,然後排優先順序並路由名單。這正是 B2B 團隊吃重的工作:B2B 行銷的決策流程長、參與者多,一筆名單值不值得業務立刻跟進,取決於幾個語意訊號的組合。把採購訊號明確嗎、需求與產品吻合嗎、預算線索出現了嗎拆成原子題,用程式按自己的權重組合成分數,自有會員名單的經營也同時獲得一層品質篩選。
落點二,客服與社群訊息分流。官方對客服的任務清單:按問題、產品區域與顧客意圖分類工單,偵測急迫度、沮喪程度、流失風險與退款請求,把案件路由到對的團隊、佇列或自動化流程。這個形狀直接適用於官網表單、信箱、Messenger 聊天機器人與社群私訊的統一進線。在EDM 自動化流程裡,回信分類、抱怨偵測、退訊意願識別也是同一族判斷節點。一次呼叫評完類型、急迫度與是否要求真人,程式照機率與閾值決定自動回覆、進佇列還是通知人員。
急迫度判斷值對語氣的敏感度,實測的畫面很直觀。開發者 Sam Witteveen 的示範裡,同一句重複扣款要求退款的訊息,急迫度判斷值只有 7%,把語氣加重改成就現在退款,判斷值立刻升到六七成。這個例子顯示,語氣變化能反映在急迫度判斷值上,供分流規則參考:同一個規則引擎看得出來的關鍵字,模型看得出語氣。
落點三,廣告與品牌安全檢查。官方對廣告用途列的任務:評估創意素材、廣告文案、到達頁與版位情境,分類品牌安全與受眾適合度,檢查法規遵循與禁用宣稱。投放前的素材健檢靠人工抽驗,法規禁語靠清單比對,但語意層面的問題,例如文案承諾與到達頁實際內容是否對得上、版位周邊內容是否傷害品牌,手寫規則很難涵蓋。這類檢查的答案空間封閉、逐案判斷輕,正是決策題型的形狀。
落點四,大量語料的普查式分析。當單次判斷成本低到某個程度,抽樣就可以變普查。DataCamp 的整理以 5,000 萬列評論舉例說明全量分析的用途,實際成本須按每列內容、題目及狀態的計費輸入 token 重新試算。行銷端的對應:口碑監測全量處理、留言主題歸檔統計、開放式問卷逐則標注,以及把大量查詢字串按意圖分類,後者與SEO 關鍵字分類的方法論直接接軌,模型負責規模化那一端,判準的設計仍在行銷團隊手上。搜尋場景的重排序也有獨立開發者動手驗證過:先用 BM25 這類便宜演算法取出一百個候選,再讓 Jev 逐個對原始查詢評相關分數,極低花費就能補上語意層的精排,站內搜尋與內容推薦都是同一個形狀。
落點五,顧客聲音的特徵化。官方用途表裡的需求預測項目寫的是:用顧客詢問、業務備註、產品評論、客服工單與市場報告裡的語意訊號,強化需求預測模型,萃取採購意圖、急迫度與產品興趣。換句話說,決策模型的輸出可以不直接觸發動作,而是當成下游模型的特徵:把每一則非結構化的顧客聲音變成幾個帶機率的數字欄位,再餵給既有的預測或分群流程。官方文件另提到進階做法:把這些特徵與結構化資料結合,去訓練帶正解任務的模型。
落點六,AI 工作流的守門與模型路由。LangChain 在 2026 年 9 月 17 日發布的整合展示了兩個方向:模型路由讓 Jev 先判斷每個請求是簡單查詢還是高難度任務,再決定派便宜模型或強模型,目的是降低整體模型成本,實際節省仍須按請求分布與各模型費率量測。風險守門則在工具執行前檢查這個動作有沒有風險,高風險先擋下。同篇文章點名的早期案例:有人用它驅動每個決策不到一分錢的瀏覽器操作代理,有人做即時交易代理,有人做大規模郵件分診。TechCrunch 也報導了 Vercel 工程師的實測:把原本跑指令安全審查的分類器從 OpenAI 的 Luna 換成 Jev,速度加快 5 至 18 倍且準確度更好。對正在組自動化流程的行銷技術團隊,這一層等於把過去鎖在閉源框架裡的安全分類器,變成可以自己寫規格的開放元件。
六個落點共享三個前提:答案空間可以事先列舉、判斷重複出現、誤判有明確的出口。判斷量大時更值得優先試點。若答案不封閉或沒有誤判出口,應先調整流程或考慮其他工具,量小時則另評估導入成本。盤點的產出是一張判斷清單,清單上每一項都標好題型、閾值與邊界案件的接手人,這張清單本身就是導入文件。
跟規則引擎、自訓分類器與 JSON 提示詞相比
決策模型不是憑空出現的需求,它取代的是三個既有做法。第一個對手是手寫規則。官方把 System One 模型的用途稱為智慧 if 判斷式:把分類、路由、評分、抽取、分支放進一般軟體裡,取代手寫邏輯太脆的地方。規則引擎顧得住關鍵字完全匹配的案例,顧不住語意變體,同一個投訴意圖有許多種寫法,規則清單隨案例不斷加長,改動的風險也跟著累積。決策模型讀的是語意,判斷的規格卻和規則一樣明確。
第二個對手是自訓分類器。傳統機器學習路線需要標注資料、訓練管線與後續維護,換主題就要重來一輪。Jev 不能微調,反而把「教模型」變成「寫規格」:領域知識放狀態、規則寫進題目指示與評分標準、組合邏輯在程式碼。對沒有機器學習團隊的行銷組織,這條路的進入門檻明顯更低,把領域知識寫成規格就能開始。對有資料科學團隊的組織,決策模型可以先當標注機與特徵產生器,等累積夠多帶答案的資料,再考慮訓練自家的專屬模型。
第三個對手最直接:叫大型語言模型回 JSON。官方文件的說法是,用一個構造上就回傳型別化數值的呼叫,取代那種請 LLM 回傳 JSON 的脆弱提示。脆弱有兩層:格式層面,解析隨時可能失敗。判斷層面,生成模型被要求給信心估計時傾向過度自信且不一致。TechCrunch 報導的開發者實測提供了中性的對照:Bryo AI 的技術長用商務信件分類比較 Jev 與 Gemini,Gemini 略微更準,但貴 10 至 20 倍,而讓他更看重的是 Jev 把真實機率交回來,適合接自動化流程。若團隊的判斷任務仍需要文字輸出,小型語言模型是另一種壓成本的路線,只是它仍在生成的軸線上。
收斂成一條選擇原則:要產出文字,用生成模型。要跨系統行動,用代理。要的是可驗證的封閉判斷,尤其數量大時,可評估決策模型。三類之間的取捨,與Gemini 3 從模型取捨到工作流的討論是同一個問題的不同切面:模型選擇的本質從來不是誰最強,而是每個節點的工作形狀最適合誰。
限制清單與數字的正確讀法
官方對自家模型的已知弱點毫不遮掩,已知缺陷頁列了九項。對行銷應用最要緊的幾條:逐字讀題,模型回答你寫的題目而不是你想的題目,否定詞與隱含條件都按字面算。它不是計算器,計數與算術該留在程式碼。日期當文字讀,先後與區間比較不可靠。間接指涉越多層,準確度越低。狀態裡塞滿無關細節會拖累準確度,官方明說 Jev 會受上下文腐化所苦。對抗性內容會移動答案,狀態是資料,模型預設不把它當敵意處理,部署前要測邊界案例。
對台灣團隊最關鍵的限制是語言。官方模型說明頁寫明:英文是主要訓練語言、準確度目前最好,其他語言包含中日韓文在內可以處理但不同等好,建議先用自己的內容測試,並在路由上緊盯信心值。行銷素材又常夾雜中英混合、社群縮寫與在地用語,這一步不能省。做法沿用官方原則:準備一批有人工標準答案的歷史資料,跑一輪看答案與信心值的對齊程度,把閾值校在自己資料的分布上。
第二個結構性限制是沒有判斷理由。模型回傳機率,不回傳自然語言的解釋,DataCamp 的整理把這點列為除錯與受監管產業稽核的實質約束。可行的繞法分兩段看:把高量路由交給決策層,依據是官方的三段式信心分流;把低信心與被標記的案件交給能寫書面解釋的模型或真人,並在系統裡保留原始狀態與當時的機率,作為事後檢討與稽核的軌跡,這一段則是工程端的配套做法。
獨立開發者 Simon Willison 在試用後的筆記提出同一個疑慮的更尖銳版本:這類模型等於讓人工智慧更進一步退回黑箱機器學習。大型語言模型至少還能被要求說明判斷,決策模型連這一層都沒有,丟進再多文字,拿回來的就是一個數字,內容被標成垃圾訊息時,你無從知道是哪些訊號觸發。他把偏見疑慮排到最前面,希望沒有團隊拿它排序求職者這類涉及人的評比,因為單一數字可能藏著模型內建的偏見,而且不易拆解驗證。同一篇筆記的收束建議與前面的檢查清單同一個方向:評測與結構化實驗要比一般模型專案更認真做,而決策模型的便宜恰好把評測成本壓到幾美分等級,跑幾千次實驗提示都不心疼。
規格面的限制還有幾條要記:只吃文字輸入,字串、JSON 物件或文字陣列,圖片音訊影片要先轉成文字。每個請求上限 64k token,其中狀態加最長一題占 32k。速率限制標示為每秒 25 萬 token、每分鐘 1,200 個請求,但官方明說需求量太大、限制正在動態調整,可能無預警變動,更高額度要走企業方案。TechCrunch 也報導過發布初期需求太大,API 一度無法正常服務。早期採用者的紅利與風險,在這個產品上是打包出售的。
效益數字的讀法,官方其實自己給了教科書等級的示範。維基百科條目整理的官方宣稱:比前沿模型快 40 至 200 倍、省 40 至 400 倍,峰值數字 193.6 倍快與 444.6 倍省出自自家工作流評測,而官方在發布文裡明說這些屬於現實增益的高端值。那套評測的設計是四個工作流(資安事件回應、代理軌跡觀測、發票處理、客服),以 GPT-6 Astra 與 Fable 的平均答案當參考標準。DataCamp 轉述的結果:Jev 平均 67.8%,與 GPT-5.6 Terra 的 67.9% 實質打平,每案成本約 0.0004 美元、耗時 0.4 秒,Terra 同口徑是 0.0304 美元與 10.1 秒。最準的 Sol 74.1% 與 Opus 5 的 73.1% 保有 5 到 6 個百分點優勢。
這些數字要打的三個折扣,官方同樣自己列出:工作流出自自家模型能力團隊,可能存在有利偏差。參考答案取自 OpenAI 與 Anthropic 模型的平均,可能低估 Jev 與 DeepSeek 系統的相對表現。DataCamp 認為,準確度平價仍待大規模獨立第三方複現,該結論屬有希望而非已定案。TechCrunch 另點出一個背景:TypeSafe 對架構細節保持沉默,外界推測它可能建立在開放權重模型之上,而官方沒有發表技術論文。採購決策上穩當的做法,是把官方數字當方向,拿自己場景的樣本實測後再定案。
中文行銷團隊的導入檢查清單
把前面的證據與限制收斂成五個問題,任何「我們該不該用決策模型」的討論,先過這五關。
第一問,答案空間封閉嗎。列不出這個判斷所有可接受的答案,它就不是決策模型的題目,該交回生成模型或人。訊息分類、資格篩選、意圖判斷、違規偵測都符合。要它寫文案、想策略、給開放式建議,用錯工具。
第二問,中文校準驗了嗎。用人工標注過的歷史樣本跑一輪,看答案對不對、信心值誠不誠實,兩者都要過再上量。官方對非英語負載的建議就是這一條,而且建議緊盯信心值再做路由。
第三問,閾值按誤判成本設了嗎。每個自動動作有自己的門檻,低風險動作門檻低,觸及顧客權益或對外承諾的動作門檻高,中間帶有明確的覆核出口。三段式的起手式:高分自動動作、低分自動擱置、中間送人審。
第四問,邊界案件誰接手。分數落在模糊帶、信心不足的答案,要有真的被接住的出口,真人審查佇列或能寫書面理由的模型都行,同時保留原始狀態與機率紀錄。沒有出口的自動化,等於把誤判直接漏給顧客。
第五問,試點的成本算過了嗎。按官方費率換算,以單一請求共計 32k 個計費輸入 token 試算(即狀態與最長一題合計的上限),輸入成本約 0.0014 美元,逼近 64k 全額也約 0.0027 美元,試點的財務風險可以忽略,真正的成本在題目設計與資料標注的工時。五問都過,挑一個重複量最高的判斷先跑雙軌,比對分歧案件再校準題目與閾值,這是最便宜的驗證路徑。

入門的現實門檻也夠低。數位時代的實測整理給的起步路徑:到官網註冊免費帳號,不需要綁信用卡就有 5 美元測試額度,按官方費率約等於一億多個輸入 token 的判斷量。會用 AI 程式助理的團隊,可以讓助理代寫串接,把分類標準與信心門檻用白話交代清楚就好,該實測整理給的入門範本是信心低於 0.6 一律送人工檢查。第一輪試點就用人工標注過的歷史資料對答案,獨立實測連跑二十個分類任務的帳單是 0.05 美分,要投資的是題目設計的時間。
決策型 AI 模型這個類別還很年輕,單一產品的表現數字也還在等待獨立檢驗,但類別本身指向的方向很清楚:TypeSafe 的產品示範了將這類判斷單獨計價、接入與管理的一種做法。官方替模型取名時引用了十九世紀經濟學家 Jevons 的觀察,蒸氣機效率提升之後,煤的消耗量不減反增,他們賭智慧成本每降一個數量級,就會解鎖數量級更多的新用途。對行銷團隊,與其預測哪個產品會贏,不如先把判斷盤點做實:題目規格、閾值邏輯與邊界出口一旦寫成文件與程式碼,就是跟著團隊走的資產,日後評估其他方案時可以沿用這份需求規格,但仍須重新驗證題型、回傳欄位、校準與串接方式。





