🗺️ AI 學習與考證地圖
TypeSafe AI・2026 年 9 月 15 日開放早期存取・原理與應用案例整理

Jev:不寫字,只負責「做判斷」的 AI

ChatGPT、Claude 這類大型語言模型會把答案「寫」出來。Jev 反其道而行:你把情境和幾個選擇題交給它,它只回你「選哪一個」以及「有多確定」。因為不必一個字一個字生成文字,官方宣稱速度快上數十到數百倍、費用低上百倍。這頁整理它為什麼會出現、內部怎麼運作、開發者第一週做出了什麼,以及哪些地方要小心。

Jev(一次回傳所有判斷)
0.000
官方 side-by-side 示範的紀錄值
GPT-5.6 Terra(逐字生成回答)
0.000
同一題、同一份輸入;官方也註明這份輸入偏短,對 Jev 有利

兩條都會跑到滿格,差別在「跑完要等多久」:這裡用的是真實秒數,Jev 0.114 秒、GPT-5.6 Terra 8.566 秒,旁邊的數字會跟著跑,你可以自己數。捲到這一區才會開始跑,想再看一次就按下面的按鈕。

它想解決什麼問題:軟體裡有太多「聰明的 if」

先想一件事:一套客服系統收到一封來信,程式真正需要知道的,通常只有幾個很短的答案——這封信該給哪個部門?客人有多生氣?他是不是在要求退款?程式拿到這三個答案就能往下走,接下來是查訂單、開退款單、轉給某位同事,都是普通程式碼在做的事。

過去這幾年,大家的做法是把這封信丟給一個會聊天的大模型,請它「回傳 JSON,包含部門、情緒、是否退款」。它做得到,但過程很不划算:模型得先讀懂信,再一個字一個字把答案寫成文字;寫完後程式還要解析、驗證格式,偶爾會遇到多了一句廢話、少了一個欄位、或是自己編出不存在的部門名稱。更麻煩的是,模型答錯的時候通常不會告訴你它其實沒把握。

Jev 的創辦人 Diogo Almeida 曾在 OpenAI 參與 RLHF、InstructGPT 與 ChatGPT 的研發,他在發布文裡問了一句話:模型早就比人會聊天了,為什麼自動化還沒大量發生?他的答案是,瓶頸不在智力,而在「用文字回答」這個介面本身。人讀文字很自然,程式讀文字卻很笨拙。所以 TypeSafe 決定做一種天生給程式呼叫的模型:輸入還是自然語言或 JSON,輸出直接是型別固定的判斷結果,附帶機率。

在 AI Agent 越來越常見的今天,這個需求特別明顯。一個複雜的 Agent 任務內部可能發生幾十次、幾百次模型呼叫,其中很大一部分其實是「該走哪條路」「這段資料有沒有用」「該不該叫這個工具」這類小判斷。每一次都動用完整的生成模型,等於每次都請主廚出來替你決定客人該坐哪一桌。

用急診檢傷來理解它

台灣的急診室門口都有檢傷分類站。護理師看一眼病人、問幾句話、量個生命徵象,一兩分鐘內就給出一到五級的檢傷等級,並決定病人先去哪一區。護理師不負責診斷、不開藥、不動手術——那是後面醫師的事。但正因為她只做這幾個判斷,她可以又快又穩地處理一整個候診區的人,醫師的時間就留給真正需要深入處理的病人。

Jev 就是這位檢傷護理師。它讀完你給的情境,直接回答幾個事先定好的問題,然後把人送到正確的地方。會寫文章、能推理、能解釋的生成式模型,則是後面的醫師。

病人的描述與生命徵象檢傷站看到的資訊
state(狀態)你傳給 Jev 的文字或 JSON
「幾級?該去哪區?有沒有外傷?」檢傷單上固定的欄位
questions(問題)Choice、Score、Noul 三種題型
「三級,先到內科區」勾選好的檢傷單
typed answer + 機率 + 信心度程式可以直接用的結構化結果
後方的醫師診斷、治療、解釋病情
生成式 LLM 或人工需要寫文字、深入推理的部分

這個比喻有一個地方和實際情況不同,要先講清楚:檢傷護理師如果被問「為什麼判三級」,她講得出理由;Jev 講不出來。它只回傳選項和機率,沒有任何解釋文字。如果你的流程需要留下判斷理由給稽核或主管看,這一段得另外用生成式模型補,或由人來做。

它實際上怎麼運作

一次 Jev 呼叫只有兩個部分。state 是要被判斷的情境,可以是一段文字、一個 JSON 物件,或一串對話訊息;questions 是針對這個情境的一組問題,每一題都要指定型別。官方文件把問題的型別限制在三種,這不是還沒做完的功能,而是刻意的設計:答案的範圍是你事先寫死的,模型只能在範圍內選,所以永遠不會回傳格式錯誤或不存在的選項。

Choice
從一組選項中挑一個

例如「這封信該給哪個部門」,選項是 billing、technical、sales。最多可放 255 個選項,每個選項只多花幾個 token。官方建議一定要加一個 other,讓模型能說「都不像」,而不是硬選一個最接近的錯答案。

回傳:choice、每個選項的 probabilities、confidence
Score
在一條由低到高的量尺上定位

例如「客人有多生氣」,量尺是「冷靜陳述/不滿但客氣/非常生氣」,可以有 2 到 10 級,每一級用文字描述。回傳的分數可以落在兩級之間,例如 1.035。

回傳:score(機率加權值)、probabilities、confidence
Noul
是或否,以機率表示

例如「客人是否明確要求退款」。回傳一個 0 到 1 之間的數字,代表答案為「是」的機率。它沒有另外的信心度欄位,因為這個數字本身就是模型的把握程度。

回傳:noul(0~1)

下面是官方 SDK 的用法,把三種題型放在同一次呼叫裡。所有問題會同時被回答,不是一題一題排隊。

# pip install typesafe-sdk
from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

client = TypeSafeClient()   # 讀取環境變數 TYPESAFE_API_KEY,預設模型 jev-latest

response = client.system_one(
    state={
        "ticket": {"subject": "重複扣款",
                   "messages": [{"from": "customer",
                                 "text": "訂單 A-104 被扣了兩次,請退掉重複的那筆。"}]},
        "refund_policy": "重複扣款可以退款。",
    },
    questions={
        "department": Choice(instructions="哪個團隊應該處理",
                             criteria={"billing": "付款或訂閱問題",
                                       "technical": "程式錯誤或整合問題",
                                       "sales": "價格或方案問題",
                                       "other": "以上皆非"}),
        "frustration": Score(instructions="客人看起來有多不滿",
                             criteria=["冷靜陳述事實", "不滿但客氣", "非常生氣、用詞強烈"]),
        "refund_requested": Noul(instructions="客人明確要求退款"),
    },
)

dept = response.answers["department"]
print(dept.choice, dept.confidence)          # 例如 billing 0.93
print(response.answers["frustration"].score)  # 例如 0.42(介於「冷靜」與「不滿」之間)
print(response.answers["refund_requested"].noul)  # 例如 0.97

為什麼可以快這麼多:平行取樣,而不是逐字生成

一般 LLM 是「自回歸」的:每產生一個字,都要看前面所有的字,再決定下一個字。答案有 300 個字,就要跑 300 輪。Jev 讀完 state 之後,用 TypeSafe 稱為「parallel sampler」的機制,一次算出所有問題、所有選項的機率。不管你問 3 題還是 13 題,時間幾乎一樣,多問一題只多付一點輸入 token 的錢。官方文件裡有一個例子:對一篇長文章問 13 個法規相關問題,一次問完比逐題問便宜 12.2 倍、快 10 倍,答案相同。

這也解釋了它的計價方式:輸入 token 每百萬 0.042 美元,輸出免費。因為輸出根本不是一串一串生成出來的文字,成本低到官方說不值得計費。

為什麼機率值得信:RLCD 訓練法

光是回傳「billing:0.93」還不夠,關鍵是這個 0.93 值不值得信。很多人試過請 ChatGPT 在回答後附上信心分數,結果模型常常過度自信,而且同一題問兩次給的數字不一樣。這是因為 ChatGPT 那類模型的訓練目標是 RLHF——讓人類評分者喜歡它的回答——沒有人在訓練時要求它的機率要「準」。

TypeSafe 改用他們稱為 RLCD(Reinforcement Learning for Calibrated Decisions,校準決策的強化學習)的方法,訓練目標直接是機率要和實際結果對得上。所謂校準(calibration)的意思是:模型說「90% 是 billing」的那些案子,長期統計下來大約有 90% 真的是 billing。這件事在自動化裡非常重要——一個做對 95% 但不知道哪 5% 錯的模型,你不敢放手;一個會老實說「這題我只有六成把握」的模型,你就可以寫規則:把握夠就自動處理,不夠就轉人工。

「不會幻覺」要聽清楚它的範圍。官方說 Jev 的結構化輸出錯誤率是 0%,指的是它不可能回傳你沒定義的選項,這在數學上是保證的。但它仍然可能在你給的選項裡選錯一個。格式錯誤和判斷錯誤是兩回事,Jev 消滅了前者,後者要靠你自己用有正確答案的資料去驗證。

動手看看:判斷結果長什麼樣

下面這個小工具模擬一次 Jev 呼叫的輸入與輸出,讓你感覺一下「回傳機率」和「照信心度分流」是什麼意思。

客服來信分流(示意)

Choice department:哪個團隊該處理
confidence:
Score frustration:客人有多不滿
0 冷靜
1 不滿但客氣
2 非常生氣
score:
Noul refund_requested:是否要求退款

這裡的機率是用簡單的關鍵字規則在瀏覽器裡算出來的示意值,不是真正呼叫 Jev 的結果;真實模型的輸出會依情境有所不同。Jev 本身只回傳數字,分流規則(門檻、動作)是由呼叫它的程式決定的。

玩過一輪應該會注意到兩件事。第一,同一封信的判斷結果不是一個答案,而是一組機率——程式可以只看第一名,也可以看分布是否集中。第二,「門檻」不是模型的一部分,是你根據錯誤代價自己訂的:查餘額這種判錯了也沒事的動作,門檻可以低;轉帳這種動作,門檻就要拉高。這正是 RLCD 校準後的機率能派上用場的地方。

五種常見的用法模式

這些模式來自 TypeSafe 的文件與早期使用者的整理,共同點是:迴圈、安全檢查、算術留在普通程式碼,Jev 只負責中間那一小段程式碼很難寫成規則的判斷。

1. 一次問完,事後再挑(speculative fan-out)

因為所有問題平行處理,第十題幾乎不多花時間。這翻轉了過去「先問便宜的問題,需要再追問」的直覺——現在應該把所有可能用到的問題一次全問,由程式決定哪些答案有意義。例如同時問「這是 bug 還是帳務問題」「如果是 bug 有多嚴重」「如果是帳務要不要退款」,就算最後只有一半的答案用得上,也比來回兩趟快。

2. 依信心度分流(confidence-gated routing)

不要全系統只用一個門檻,而是每個動作各訂一個,依「做錯的代價」調整。信心度低於某個底線一律轉人工;只讀不寫的動作門檻低;會動到錢的動作門檻高,不夠高就先向使用者確認。也可以直接看原始的機率分布:如果分布很平,通常代表你的選項描述寫得不夠清楚,而不是模型糊塗。

3. 拆成多個維度分別評分(composite scoring)

「這位候選人好不好」這種問題其實藏了好幾個判斷。比較好的做法是拆成「Python 深度」「帶團隊經驗」「系統設計經驗」各一個 Score,再由程式用你自己定的權重加總。這樣調整權重就變成改一行程式碼,可以做 A/B 測試,而不是重寫提示詞。

4. 串聯分層(the cascade)

Jev 不是要取代 GPT-5.6 或 Opus 5,而是替它們決定哪些請求值得動用它們。一個客服訊息進來,Jev 先判斷意圖與複雜度:查訂單狀態這種事直接用程式查資料庫,完全不需要 LLM;產品問題交給裝了產品知識的 LLM;客訴如果複雜或信心不足就轉人工。

訊息進來Jev 一次回答:intent(Choice)、complexity(Score)
查訂單狀態純程式碼查詢,零 LLM 呼叫
產品問題/退換貨交給對應的專門 LLM 處理
信心不足或複雜客訴轉人工

一篇實作文章用 TypeSafe 的單價估算:一百萬張工單走這條路線,費用約 6,480 美元,而全部交給前沿 LLM 約 30,400 美元;其中約八十萬張在半秒內就有答案。這是估算而非實測,但方向很清楚。

5. 先精準檢索,再便宜判斷(retrieve, then judge)

Jev 對世界一無所知,它只知道你放進 state 的東西,而且 state 塞了太多無關資料時準確度會下降(官方文件稱為 context rot)。所以正確的搭配是:程式或檢索工具先把資料篩到只剩問題需要的欄位,再讓 Jev 判斷。RAG 系統裡常見的做法是對每一段檢索到的文字問一個 Noul「這段和問題有關嗎」,先過濾一輪,再把留下來的送進昂貴的生成模型。以每百萬 token 0.042 美元的價格,這道過濾比它省下的上下文空間便宜得多。

開發者第一週做出了什麼

Jev 在 9 月 15 日開放,下面這些都是發布後幾天內的實驗作品,數字全部是作者自行回報、未經第三方驗證,請當成方向的示範而不是生產環境的成績單。

1,018 篇論文分類,花費 0.08 美元

1kpapers.com・Hassan El Mghari

流程分兩段:先用生成模型 DeepSeek V4 Flash 替每篇論文寫摘要,再把標題、摘要和 24 個候選主題交給 Jev 用一個 Choice 分類。帳單分得很清楚:摘要花了 3.99 美元,分類只花了 0.08 美元,每篇端到端中位延遲 256 毫秒。作者的評語是,不同模型負責流程的不同部分,會比用一個模型做所有事更合理;他也提到在正式替換前會先跑評測,這是很多發布週作品省略掉的步驟。

瀏覽器代理 7.1 秒訂完一張機票

browser-use/jev-ultrafast・Gregor Zunic(Browser Use)

每次觀察時把網頁轉成一張編號的元素表格,然後用一次 Jev 呼叫同時決定「做什麼操作」(點擊、輸入、選擇、捲動、等待、完成、卡住)和「對哪個元素」。只有操作是「輸入文字」時才呼叫一個小型 LLM 產生文字。在真實的 Google Flights 上,蘇黎世到倫敦的搜尋含頁面載入共 7.1 秒0.0039 美元。這是「一次問完」模式用在動作決策上的例子。

電腦操作代理,每步 0.0002 美元

awlevin/typesafe-computer-use

不把螢幕截圖送給大模型,而是先用 OCR 讀出畫面文字,由 Jev 選下一步動作,只有需要自由文字時才叫寫作模型。作者比較:Jev 每個決策 0.0002 美元、模型延遲 0.13~0.38 秒;Opus 5 直接看截圖則是每個決策 0.032 美元、延遲 5.2 秒。作者也留下最有價值的一句提醒:前沿模型會自己從畫面讀出日期並比較大小,換成 Jev 之後,這些推理全部要改寫成明確的程式邏輯

自主無人機:每秒 2.5 次「戰術判斷」,而且只是建議

RomanSlack/jev-drone

這個專案值得學的是它把 Jev 放得非常有節制。500 Hz 的飛控與 50 Hz 的安全反射完全由程式負責,15 Hz 的視覺由傳統電腦視覺把畫面壓成「各方向距離、障礙高度、目標方位」這類符號化資訊,Jev 只在約 2.5 Hz 回答三題:選哪個動作(Choice)、風險多高(Score)、目標是真的丟了還是暫時被擋住(Noul),而且只做建議,不直接控制。README 直言:Jev 不能當感知層,也跑不了控制迴圈的速度。

其他值得一看的

LangChain 推出了以 Jev 為基礎的模型路由中介層:讓 Jev 讀使用者訊息後決定這次任務該交給便宜的小模型還是昂貴的大模型。另有專案讓 Jev 每個區塊(約 300 毫秒)在鏈上下單做市、用模擬器記憶體轉成的 JSON 玩超級瑪利歐、分階段做程式碼審查(先用 Noul 建風險矩陣,再用 Choice/Score 決定嚴重度與路由),以及一個叫 openjev 的開源專案,用 4B 參數的開放模型的 logits 重現「回傳選項機率」這個介面型態——作者明說那不是 Jev 的模型或訓練方法。

限制與踩過的坑

TypeSafe 在文件裡公開了一頁叫「jaggedness」(能力不平整)的清單,列出目前版本 jev-1.13 做不好的事。以一個發布週的產品來說相當坦白,這些也是實際導入前最該先知道的。

關於那些漂亮的數字

官方的「快 193.6 倍、便宜 444.6 倍」來自他們自己設計的四組工作流程評測,而且是用 GPT-6 Astra 與 Claude Fable 5.1 兩個前沿模型答案的平均當作參考答案,再看每個模型和參考答案有多一致。所以評測表上的 67.8%,衡量的是「和兩個前沿模型的一致程度」,不是有正確答案的準確率;也因此這兩個模型本身不會出現在榜上。目前沒有獨立的第三方重現這些結果,官方自己也在文章裡逐項寫了「nuance」提醒偏差可能在哪。實務上的結論很簡單:用自己的資料、自己的流程跑過再決定。

另外幾個營運面的事實:目前是候補名單制的早期存取;速率限制約每秒 25 萬 token、每分鐘 1,200 次請求,官方說會隨 GPU 容量調整;jev-latest 會隨新版本移動,如果你調過門檻,請把版本釘在像 jev-1.13.0 這樣的固定 ID,並把回應裡的 model 欄位記錄下來。價格方面官方坦承無法證明目前沒有補貼,但預期會降不會漲。

和一般大型語言模型的分工

一般 LLM(ChatGPT、Claude、Gemini 等)Jev(System One Model)
訓練目標RLHF/RLVR:讓人類偏好的回答、或可程式驗證的答案RLCD:讓機率與實際結果對得上(校準)
輸入非結構化文字,偏重「一連串訊息」非結構化文字或 JSON,偏重「程式狀態」
輸出文字字串,什麼都能寫,程式要再解析驗證事先定義的型別值,附機率與信心度,不會有格式錯誤
生成方式逐字自回歸生成一次平行算出所有答案
速度(官方數字)前沿模型端到端 3~329 秒70~500 毫秒
價格(官方數字)輸入每百萬 0.2~10 美元,輸出約為輸入 5 倍輸入每百萬 0.042 美元,輸出免費
信心度即使要求也常過度自信、不一致每個答案都附,校準過;相似輸入給相似答案
能解釋理由嗎可以不行
適合聊天、寫作、寫程式、長篇研究、多步推理、需要人在迴圈的任務分類、路由、評分、過濾、守門、大規模資料標註、需要即時回應的判斷

兩者不是誰取代誰。比較合理的架構是:程式掌握流程與權限,Jev 處理高頻、答案範圍已知的判斷,生成式模型負責需要自由文字或複雜推理的步驟,低信心與高風險案例交給人。

什麼時候該考慮它

適合的情境

  • 工單、訊息、文件的分類與路由
  • 內容審核、垃圾與濫用偵測
  • RAG 檢索結果送進 LLM 前的相關性過濾
  • 替 LLM 的輸入或輸出打分、做守門、偵測越獄
  • 以前因為太貴而做不起的大規模標註
  • 任何要在一次請求裡、一秒內做完的判斷

不適合的情境

  • 要生成任何文字、程式碼或摘要
  • 算術、計數、日期運算
  • 稽核或法規要求留下書面判斷理由
  • 一次性的複雜推理問題
  • 答案空間真的開放、無法事先列舉
  • 沒有時間用自己的資料驗證就要上線

最有用的心態轉換是:這不是「比較便宜的 LLM」,而是一種不同的積木——一個剛好很聰明的函式呼叫,回傳一個型別,並告訴你該相信它幾分。有了這塊積木之後,很多原本只是為了「處理模型回傳的一大段字」而存在的程式碼,就不再需要了。

名字的由來。「System One」取自 Daniel Kahneman《快思慢想》裡快速直覺的系統一,相對於慢而深思的系統二;「Jev」則來自經濟學家 William Stanley Jevons,他觀察到蒸汽機效率提高後煤的用量反而增加。TypeSafe 的賭注就是:智能的成本每降一個數量級,用途就會多出好幾個數量級。

資料來源

  1. TypeSafe AI, Introducing System One Models & Jev(官方發布文,2026-09-15)——架構、RLCD、計價、評測方法與各項 nuance 說明。
  2. Valyu AI / Prosper Otemuyiwa, How to Use Jev: A practical guide(DEV Community)——三種題型、五種模式、失敗模式、發布週專案整理。
  3. DataCamp, Jev: TypeSafe's System One Model That Never Hallucinates
  4. TrueFoundry, TypeSafe AI's Jev: What "System One Models" Actually Are
  5. Turing Post, What Is Jev AI? Inside TypeSafe's RLCD Model——把 RLCD 放回既有研究脈絡的批判性整理。
  6. LangChain, Building a harness with Jev——模型路由中介層。
  7. Flavio Copes, A deep dive into Jev
  8. KodeLab, Jev 是什麼?TypeSafe System One 決策模型Frank Chiu, Jev 是什麼?AI 決策模型的用途、費用與限制動區, 爆紅的 Jev 模型是什麼?——中文報導與導入前確認事項。

頁面內所有速度、價格、比例數字皆引用 TypeSafe 官方或各專案作者自行公布的數值,截至 2026 年 9 月 22 日尚無獨立第三方重現。互動示範中的機率為瀏覽器端規則產生的示意值。