在資源充足(100% 標註)的情況下,像 BERT 這種強大的鑑別式模型通常會取得最高分,因為它能直接針對任務最佳化。但這無法測出模型真正的泛化與抗壓能力。
💡 結論:因為 VAE (方案 A) 先建構了無監督的潛在空間,它利用了文字本身的結構,不完全依賴標籤。透過逐步減少標註比例,我們完美突顯了:鑑別式模型追求極致準確,生成式模型追求穩健泛化。這在未來標註成本高昂的實務場景中,是非常重要的決策依據!
| 面向 | 看什麼 |
|---|---|
| 效能 | 同資料、同指標、同 CV 切分 |
| 統計顯著 | 差異是否超出隨機波動 |
| 成本 | 訓練/推論時間、資源 |
| 可解釋/維運 | 可否解釋、易不易上線維護 |
模型比較是 iPAS 中級的實務考點(科目三)。重點:在相同切分、相同指標、相同前處理下用測試集或交叉驗證公平比較,並兼顧穩定度、推論速度、成本與可解釋性,不只單一分數。易混點:差一點點不一定有意義(需看多折分數分布或統計檢定);常見陷阱是資料洩漏、用測試集調參、只跑一次就下結論。情境:有時選較差但簡單、好維護的模型更值得上線。
想練情境題與詳解 → AI 學習與考證地圖
用相同的訓練與測試切分、相同評估指標與前處理,並在獨立測試集或交叉驗證下比較,避免條件不一致。
不只看單一指標;還要看穩定度(多次或多折的變異)、推論速度與成本、可解釋性、維護難度與資料需求。
要看差異是否穩定且有統計意義;可用多折交叉驗證看分數分布、或統計檢定,避免被隨機波動誤導。
若指標只差一點,簡單模型在速度、成本、可解釋與維護上更佔優,綜合考量常更值得上線。
資料洩漏、用測試集調參、指標選錯(不平衡只看準確率)、只跑一次就下結論、忽略部署成本。