模型驗證:資料利用效率與泛化能力

100%
總資料量:2,000 筆
標註比例 (%) F1-Score 0 100 0.4 1.0
方案 B: BERT (鑑別式)
方案 A: VAE+分類 (生成式)
方案 B:BERT 分類器
0.950
資料飢渴,高標註時精準
方案 A:VAE 潛在語意
0.870
泛化力強,低標註時抗跌

圖解說明:為什麼要減少標註比例來測試?

在資源充足(100% 標註)的情況下,像 BERT 這種強大的鑑別式模型通常會取得最高分,因為它能直接針對任務最佳化。但這無法測出模型真正的泛化與抗壓能力

💡 結論:因為 VAE (方案 A) 先建構了無監督的潛在空間,它利用了文字本身的結構,不完全依賴標籤。透過逐步減少標註比例,我們完美突顯了:鑑別式模型追求極致準確,生成式模型追求穩健泛化。這在未來標註成本高昂的實務場景中,是非常重要的決策依據!

📊 公平比較模型的面向
面向看什麼
效能同資料、同指標、同 CV 切分
統計顯著差異是否超出隨機波動
成本訓練/推論時間、資源
可解釋/維運可否解釋、易不易上線維護
✅ 自我檢測
怎麼公平比較不同模型?
用「相同的資料切分、相同指標、相同前處理」比;最好用交叉驗證平均並看變異,別各調各的。
兩個模型差一點點算贏嗎?
不一定;要看差異是否統計顯著、是否超過 CV 折間的波動,微小差距可能只是隨機。
為什麼有時選較差但簡單的模型?
簡單模型更好解釋、更快、更好維運、較不易過擬合;在效能相近時常更值得(奧坎剃刀)。
🎯 重點整理
  1. 相同資料切分、指標、前處理才公平。
  2. 用 CV 平均並看折間變異。
  3. 微小差距可能不顯著。
  4. 也要比成本、可解釋、維運。
  5. 效能相近時,簡單模型常更好。

📝 iPAS 考點提醒

模型比較是 iPAS 中級的實務考點(科目三)。重點:在相同切分、相同指標、相同前處理下用測試集或交叉驗證公平比較,並兼顧穩定度、推論速度、成本與可解釋性,不只單一分數。易混點:差一點點不一定有意義(需看多折分數分布或統計檢定);常見陷阱是資料洩漏、用測試集調參、只跑一次就下結論。情境:有時選較差但簡單、好維護的模型更值得上線。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

怎麼公平比較不同模型?

用相同的訓練與測試切分、相同評估指標與前處理,並在獨立測試集或交叉驗證下比較,避免條件不一致。

該看哪些面向?

不只看單一指標;還要看穩定度(多次或多折的變異)、推論速度與成本、可解釋性、維護難度與資料需求。

兩個模型差一點點算贏嗎?

要看差異是否穩定且有統計意義;可用多折交叉驗證看分數分布、或統計檢定,避免被隨機波動誤導。

為什麼有時選較差但簡單的模型?

若指標只差一點,簡單模型在速度、成本、可解釋與維護上更佔優,綜合考量常更值得上線。

比較時常見的陷阱?

資料洩漏、用測試集調參、指標選錯(不平衡只看準確率)、只跑一次就下結論、忽略部署成本。

🧭 相關主題

← 返回 AI 學習與考證地圖