🗺️ AI 學習與考證地圖
Model Development · 全流程地圖

模型開發

從問題到上線的完整流水線
期待微笑的 Mochi 貓老師攤開模型開發八階段路線圖

做 AI 不是按一下訓練就好。模型開發是一條八階段的迭代流水線——
問題定義、EDA、清洗、特徵、切分、基準、訓練調參、評估,缺一不可。

問題 → 資料 → 特徵 → 切分 → 基準 → 訓練 → 評估(會回頭迭代)
01 — 白話直覺

模型開發不是「訓練模型」那一步而已

好奇歪頭的 Mochi 貓老師依序排列模型開發流程積木

很多人以為做 AI 就是「丟資料、按訓練、出模型」。其實真正寫 model.fit() 的時間不到 10%,前面的問題定義、資料清洗、特徵工程才是決定成敗的關鍵。模型開發是一條有順序、會回頭的流水線。

有順序
一步接一步

問題沒定義好,後面全白做。

會回頭
迭代

評估不好,常要回去調特徵或資料。

資料為王
8 成工夫

清洗與特徵決定上限,模型只是逼近它。

這頁是整條「模型開發」路線的地圖。下面點任一步驟,看它在做什麼、為什麼重要、以及和前後步驟的關係。

02 — 核心互動

點亮流程,看每一步在做什麼

驚喜睜大眼睛的 Mochi 貓老師指向會回頭迭代的流程迴圈

下面是模型開發的8 個階段。點任一節點,看它的職責與重點;注意它是一條主線向右、但隨時可能回頭的迴圈——評估不佳就繞回特徵工程或資料清洗。

點上面任一步驟

每個階段都有它的任務與常見陷阱,點一下看說明。

紅色虛線箭頭代表「迭代回頭」:模型評估沒過關,最常見的修法不是換模型,而是回去把資料和特徵做得更好。

03 — 全流程心法

模型開發的關鍵原則

托腮思考的 Mochi 貓老師用天平比較乾淨資料與複雜模型

優點

  • 先定義問題與成功指標,再動手
  • 資料切分要在特徵工程之前,避免洩漏
  • 先做基準模型,立一根誠實的及格線
  • 把它當迭代迴圈,而非一次性直線

缺點 / 限制

  • 跳過問題定義,做出沒人要的模型
  • 資料洩漏:特徵工程偷看了測試資料
  • 沒有基準,無法判斷模型到底好不好
  • 只想調模型,卻忽略資料品質才是上限

八個階段一覽

溫柔自信的 Mochi 貓老師帶著工具箱完成模型開發檢查站
專注微笑的 Mochi 貓老師抱著問題定義目標靶
問題定義
把業務願望翻成可學習的問題
好奇睜大眼睛的 Mochi 貓老師用放大鏡探索彩色資料點
資料探索 EDA
先看懂資料長什麼樣
認真但可愛的 Mochi 貓老師清掃雜亂資料積木
資料清洗
處理遺失、異常、不平衡
專心低頭的 Mochi 貓老師把原始資料加工成發亮特徵
特徵工程
把原始資料變成好特徵
小心側看的 Mochi 貓老師把資料卡片分進三個籃子
資料切分
Train/Val/Test、交叉驗證
戴端正圓眼鏡的 Mochi 貓老師用尺測量簡單基準模型
基準模型
先立及格線
興奮亮眼的 Mochi 貓老師調整模型訓練旋鈕
訓練與調參
訓練、正則化、超參數
鬆一口氣的 Mochi 貓老師檢查最終模型評估圖表
模型評估
測試集最終驗收
安心閉眼微笑的 Mochi 貓老師揮手並拿著模型開發考點檢核板

❓ 常見問題

機器學習專案的標準流程?

大致為問題定義→資料蒐集與清理→特徵工程→選模型與訓練→驗證與調參→部署→監控與維運,是反覆迭代而非一次到位。

為什麼要切出獨立的測試集?

訓練與驗證集用來訓練與調參,若拿同一批評估會高估表現;獨立測試集只在最後評估一次,才能反映真實泛化能力。

驗證集和測試集差在哪?

驗證集用於調整模型(選超參數、早停);測試集用於最終評估,過程中不可拿來調整,否則等於間接洩漏、分數失真。

開發時最常見的坑?

資料洩漏、用測試集調參、評估指標選錯(不平衡只看 Accuracy)、訓練與上線資料分布不一致、忽略基準線(baseline)比較。

為什麼要先建一個簡單基準(baseline)?

先用簡單模型或規則當基準,才能判斷複雜模型是否真的有價值;若複雜模型贏不了基準,可能是資料或設定有問題。

🧭 相關主題

← 返回 AI 學習與考證地圖