🗺️ AI 學習與考證地圖
JEV /實測筆記
2026.10.06

01 / 認識 JEV

Jev這模型不會聊天,
只會專心做判斷。

曾在 OpenAI 參與 ChatGPT 背後研究的 Diogo Almeida,後來創辦 TypeSafe。團隊經過兩年低調研發,於 2026 年 9 月推出 JEV。

白話說,它「不會講話,只會判斷」:能讀懂文字,但不生成聊天回覆或長篇解說,只回傳選項、分數、是非判斷與機率,讓程式直接接著做事。

例如把客戶來信分到「帳務」或「技術支援」。這次,我們讓它從 A–D 選答案,測試它的判斷能力。

JEV 作答流程動畫題目與四個選項送給 Jev,由 Jev 判斷後回傳選項及機率,最後在本機核對答案。此圖為流程示意。 題目+選項 ABCD Jev判斷哪個最合適 選項+機率再獨立核對答案 作答時,不提供答案與提示。

怎麼做到又快、又便宜?

官方稱它為 System One 決策模型:採用新模型架構、平行取樣與 RLCD(校準決策強化學習)。平行取樣讓多個輸出一起產生;RLCD 的目標則是讓判斷與機率更可靠,例如說「八成把握」時,長期表現也盡量接近八成。

它省去了逐字生成長篇回答的工作,專注在事先定義好的判斷結果。格式受到限制,仍然可能選錯答案。

低成本|官方單價US$0.042

每 100 萬個輸入 token
輸出免費;token 是文字計量單位。

快回應|官方公布0.07–0.5 秒

端到端回應時間
實際速度會受輸入與網路影響。

這次 IPAS 實測0.21 秒/題

平均 API 耗時
包含請求送出到收到回應。

背景與技術:TypeSafe 發表文章。單價:官方模型文件(2026.10.06 查核)。官方速度與本次實測分開呈現;本次未進行其他模型的同條件比較。

RLHF 與 RLCD:訓練時,獎勵什麼?

強化學習可以先想成「用獎勵引導模型進步」。兩者的重點差異,在於希望模型朝哪個目標進步。

RLHF|人類回饋強化學習

Reinforcement Learning from Human Feedback

重點:學會給出人類更認可的回答。

讓人比較不同回答,評選哪些更有幫助、更符合指令,再用這些偏好訓練模型。這是 InstructGPT、ChatGPT 所使用的重要訓練方法;Diogo Almeida 也參與了相關研究。

例如客服來信:
比較兩份回覆,鼓勵模型寫出更清楚、合適、能幫到客戶的那一份。

RLCD|校準決策強化學習

Reinforcement Learning for Calibrated Decisions

重點:做出判斷,並讓機率反映實際可靠程度。

這是 TypeSafe 為 JEV 採用的訓練方法。模型回傳決定與機率,訓練目標包含機率校準:許多標成 80% 的預測,長期應約有 80% 正確,而不是每題都表現得很有把握。

同一封客服來信:
判斷應交給「帳務、物流或技術」,附上各選項機率,讓系統決定如何分流。

「人類喜歡」與「機率可靠」是不同的訓練目標。TypeSafe 認為,偏好訓練可能獎勵迎合或聽起來很有把握的回答,因此改以校準決策為目標。但 RLHF 並非只訓練討好,RLCD 也不保證每題正確;本次考試測的是答案一致率,沒有另外驗證機率校準程度。

上方客服情境為示意,並非實際回應。來源:OpenAI:RLHF 與 InstructGPT、TypeSafe:RLHF 與 RLCD。

JEV 的三種答題型態

同一份文字資料,可以在一次請求裡搭配多個 Choice、Score 或 Noul 問題,平行取得結果。依需求選用即可,不必三種都問。

Choice|選擇題

「它屬於哪一類?」
從預設選項中選一個,最多 255 個選項;同時回傳各選項機率與 confidence。

例如:客服信應分到「退款、投訴、配送」哪一類?

本次 IPAS 測試用這一種:每次一題,從 A–D 選答案。

Score|評分題

「程度有多高?」
先定義有順序的等級,再回傳分數、各等級機率與 confidence。分數可以落在兩個等級之間。

例如:定義「平靜、略有不滿、非常憤怒」,評估留言的情緒程度。

先把各級標準寫清楚,分數才有可比較的意義。

Noul|是非題

「這件事是否成立?」
回傳「是」的機率,介於 0 與 1。接近 1 偏向是,接近 0 偏向否,接近 0.5 表示難以確定。

例如:「這封信是釣魚郵件嗎?」回傳 0.9,表示模型估計「是」的機率為 90%。

它是成立機率,不是危險程度分數;Noul 沒有另附 confidence。

上述情境與數值均為示意。本次只實測 Choice,沒有測試 Score 或 Noul。官方文件:Choice、Score、Noul。

02 / 測試計畫與結果

讓 JEV 考最新一批 IPAS AI 試題。

初級 2 科+中級 3 科
每科 50 題・模型 jev-1.13.0

我們的計畫很直接:拿這次選定的最新一批 IPAS AI 應用規劃師試題,讓 JEV 逐題作答,再獨立核對答案、記錄時間。範圍是題庫中的115 年第三次初級與115 年第一次中級,共五科、250 題。

初級・第一科人工智慧基礎概論

初級・第二科生成式 AI 應用與規劃

中級・第一科人工智慧技術應用與規劃

中級・第二科大數據處理分析與應用

中級・第三科機器學習技術與應用

每次只給一題與四個選項,不提供參考答案、提示、解析或搜尋資料,也不因答案不同而重問。含圖題先轉成文字,作答完成後才進行評分。這是使用試題的離線評測,並非正式報考或取得證照。

99.2%與題庫答案一致
248/ 250一致題數/總題數
0.21秒平均每題 API 耗時
五科答題結果初級兩科與中級第一科均 50 題一致,中級第二科及第三科各 49 題一致。完整數值在下方展開表格。

以題庫答案計分。每條長條的滿分都是 50 題。

五科共完成 250 題,其中 248 題與題庫答案相同。初級兩科與中級第一科都是 50 題一致;另外兩科各有一題不同。這裡的 99.2% 是「與題庫答案的一致率」,遇到有爭議的題目,還要回頭看題意。

兩題答案不一致:中級第二科第 19 題、中級第三科第 30 題。第 30 題涉及兩個概念重疊,下方另作說明。

圖片怎麼處理?
JEV 目前無法直接輸入圖片,因此先將圖片轉成文字並核對,再交給 JEV 作答。本次有 23 題採此方式,並非 JEV 直接看圖。這些題目的結果也會受轉錄是否完整影響;圖片轉文字的準備時間,沒有算入作答時間。

時間怎麼看?平均每題 API 耗時約 0.21 秒,包含送出請求、等待服務與收到回應,並非模型純運算時間。切換「作答時間」可看整科 50 題的執行時間,另包含本機存檔;五科累計約 53.51 秒,不含跨次暫停。

展開完整逐題數據(250 題)

切換科目查看每題結果;點「題目與紀錄」可讀題幹、選項、圖片轉錄及回應紀錄。機率與 confidence 是不同欄位,都不代表保證答對。

五科 API 耗時合計 52.49 秒;執行時間累計 53.51 秒,另含本機存檔等工作。排除中斷等待及圖片準備時間。初級第一科採最新重測批次。

保留原題與選項順序,逐題獨立作答,不提供答案、提示或解析。23 張圖片由助理轉錄並自行核對,沒有另做獨立人工覆核。

248/250 是與這份題庫答案的一致程度。未另行查核官方答案,也沒有其他模型的同條件比較;這次成績不代表所有任務都會有相同表現。

值得細看的一題 / 中級・第三科・第 30 題

選 C,就一定是觀念錯了嗎?

這題 JEV 選的是 C「過擬合」,本次題庫參考答案是 B「高變異」。爭議在於:題目同時放進了支持這兩個選項的線索,卻要求只能選一個。

某信用風險模型:訓練 AUC=0.97、驗證 AUC=0.72、少數違約樣本預測波動極大及不同 K-fold 切分結果差異明顯。下列何者為最可能的問題?

A 高偏差B 高變異C 過擬合D 資料漂移

AUC 可先理解為模型區分違約與未違約客戶的能力,數值越高通常越好;0.97 並不等於答對 97%。K-fold 則是把資料分組,輪流拿一組來驗證。

C 過擬合:練習好,換題就掉分

模型在用來學習的資料上表現很好(0.97),換到驗證資料卻明顯下降(0.72)。這個落差是過擬合的常見警訊,因此 C 有合理依據。

像學生把練習題背得很熟,換一份沒看過的試卷,成績就掉下來。

B 高變異:換批資料,結果就晃動

題目還強調預測波動大、不同切分結果差很多。這讓人懷疑模型對訓練資料的變動很敏感,也就是高變異;這是題庫解析偏向 B 的理由。

像換幾份練習材料來學,最後學到的判斷方式就差很多,表現不夠穩定。

真正的爭議:兩個概念有關聯,選項不夠互斥。
高變異的模型容易出現過擬合;「學過的資料表現好、換資料變差」與「對資料變動敏感」,可能同時發生。B 能呼應後半段的不穩定,C 也能解釋前半段的落差,題幹未清楚說明要優先判斷哪一個面向。

而且,少數違約樣本分到各組的數量不同,也可能讓驗證結果波動。單看 K-fold 分數不穩,還不足以完全確定原因。因此,本報告將這題視為「答案不一致,且題意有爭議」,不直接認定 JEV 缺乏相關知識,也不逕自斷言官方答案一定錯。

計分仍保留 248/250。我們沒有事後把 C 改判成正確,避免因為偏好某個答案而調整成績。閱讀這份結果時,可以把「有沒有對上答案」與「概念是否說得通」分開看。

說明來源:題幹、選項與 B 答案取自本次題庫;B 的解讀參考題庫解析。以上爭議分析為報告的事後評析,並非 JEV 的解題理由。使用者指出這題曾討論過官方答案爭議;本報告未另查證官方公告或更正。概念依據:scikit-learn:高變異與過擬合、交叉驗證與類別比例。

03 / 可以用在哪

把明確的小判斷,交給 JEV。

很多工作每天都在重複做選擇:這封信交給誰?這份文件放哪裡?下一步要做什麼?當資料能整理成文字、選項也定義清楚,就可以嘗試讓 JEV 先做判斷,再由程式或人員接手。

以下是應用設計示例,並非本次考題實測已驗證的功能成效。

01 客服分流

客戶說「已經扣款,但訂單還沒成立」。把訊息交給 JEV,從「帳務、物流、技術」中選出處理單位。

接著做:系統送到對應佇列;跨部門或不確定的案件交給人員確認。

02 文件與訊息分類

每天收到大量文件,可以先把文字分成「報價、合約、會議紀錄、其他」,或替客戶回饋標記主題。

接著做:系統加上標籤、整理資料夾,讓人更容易找資料。

03 流程下一步

提供案件內容與處理規則,請它判斷「資料齊全、需要補件、需要人工確認」。

接著做:系統依結果顯示補件提醒,或送進下一個處理階段。

04 替大型 AI 選工具

收到「查訂單」「找操作說明」或「幫我寫一封信」時,先判斷該查資料庫、搜尋文件,還是交給能生成文字的模型。

接著做:主程式呼叫選定工具。JEV 負責選路,其他工具完成查詢或寫作。

05 檢查內容是否合用

把草稿與檢查規則一起提供,判斷是否偏離主題、是否缺少必要欄位,或語氣是否適合讀者。

接著做:標記需要修改的內容,交給作者或生成模型修訂;JEV 本身不重寫文章。

06 學習題目分類

把題幹交給它,從「資料處理、模型訓練、成效評估」等既定主題中選擇,協助整理大量題目。

接著做:系統建立主題索引,再由老師抽查,或依分類提供相應教材。

開始用時,先挑一件小事。

例如先測試「客服訊息分到哪一組」,準備一批已由人員確認的案例,看看哪些能判斷穩定、哪些容易混淆,再決定何時自動處理、何時交給人。

分類與分流可以交給 JEV;需要寫回覆、解說原因或產生文章時,再搭配能生成文字的模型。這次考試的一致率很高,但每種新用途仍要用自己的資料驗證。

📝 iPAS 考點提醒

這頁可以順便複習三個常考觀念。第一是鑑別式 AI 與生成式 AI:Jev 只從既定選項中做判斷、不產生新內容,是典型的鑑別式用法;寫回信、改文案才是生成式。第二是過擬合與高變異:訓練分數高、驗證分數掉很多,是過擬合的警訊;換一批資料或換一種 K-fold 切法,結果就大幅晃動,則指向高變異。兩者常一起出現,解題時要看題幹強調的是「訓練與驗證的落差」還是「對資料變動很敏感」。第三是機率校準:模型說有 80% 把握的那些預測,長期大約應該對八成;準確率高不代表機率校準得好,這也是 Jev 採用 RLCD 想改善的地方。

想練情境題與詳解 → Akira iPAS AI 互動式考證地圖

❓ 常見問題

Jev 是什麼?和 ChatGPT 這類聊天模型差在哪?

Jev 是 TypeSafe 在 2026 年 9 月推出的 System One 決策模型。它能讀懂文字,但不生成聊天回覆或長篇解說,只回傳事先定義好的結果——從選項中選一個(Choice)、給一個等級分數(Score)或是非機率(Noul),並附上機率,讓程式直接接著處理。適合客服分流、文件分類這類明確的小判斷;需要寫回覆或解釋原因時,仍要搭配能生成文字的模型。

Jev 考 iPAS AI 應用規劃師試題的成績如何?

本頁用 115 年第三次初級(2 科)與 115 年第一次中級(3 科)共 250 題測試 jev-1.13.0,每次只給一題與四個選項,不提供參考答案、提示或解析,也不重問。結果 248 題與題庫答案一致,一致率 99.2%:初級兩科與中級第一科全部一致,中級第二科第 19 題與中級第三科第 30 題不同。這是使用試題的離線評測,不是正式報考成績。

平均每題 0.21 秒是怎麼算的?

這是平均每題的 API 耗時,從送出請求到收到回應,包含網路與服務等待,並非模型純運算時間。五科 API 耗時合計約 52.49 秒;整科執行時間另含本機存檔,累計約 53.51 秒。含圖的題目先轉成文字再作答,轉錄準備時間沒有算進去。

官方說 Jev「0% 幻覺」,是不是代表不會答錯?

不是。TypeSafe 說的 0% 指輸出格式與型別錯誤為 0%:可回傳的結果事先定義好,例如只能選 A 到 D,模型就不會編出第五個選項或一段不合格式的文字,這是設計上的保證。格式一定符合,不等於答案一定正確——本次 250 題中仍有 2 題與題庫答案不同。

中級第三科第 30 題,該選「過擬合」還是「高變異」?

題庫參考答案是 B 高變異,Jev 選 C 過擬合。題幹同時給了訓練 AUC 0.97、驗證 AUC 0.72 的落差(過擬合的常見警訊),以及不同 K-fold 切分結果差異明顯(高變異的特徵);這兩個概念常同時出現,選項不夠互斥。本頁把它列為有爭議的題目,但計分仍維持 248/250,沒有事後改判。

🧭 相關主題

← 返回 Akira iPAS AI 互動式考證地圖