基準模型刻意做得很簡單,當一把尺。
你的新模型至少要贏過「永遠猜多數」這種笨方法,否則再炫也沒價值。
基準模型(Baseline)是一個刻意簡單的模型——簡單到幾乎不用學習。它的價值不是準,而是當一把尺:你的炫炮深度模型,至少要贏過它,否則就白忙了。常見基準:永遠猜多數類別、永遠猜平均值、或一條簡單規則。
新模型贏不過它,等於沒價值。
永遠猜最常出現的類別。
永遠猜訓練資料的平均。
警世故事:資料裡 95% 是「正常」,一個「永遠猜正常」的基準準確率就有 95%。如果你的模型只有 94%,其實比亂猜還爛!
下面是一個不平衡分類問題(多數是藍、少數是橘)。先看基準(永遠猜多數)的準確率有多唬人,再拖動「新模型能力」,看它要到什麼程度才真正贏過基準。
把「少數類別佔比」調到 10%,基準準確率就有 90%。這時新模型要超過 90% 才有意義——基準幫你看穿「高準確率」的假象。
基準模型(baseline)是 iPAS 評估方法論的重點(中級科目三)。重點:先用最簡單的模型(多數類、平均值、邏輯迴歸)當及格線,複雜模型必須穩定贏過它才有價值。易混點:不平衡資料下多數類基準就有高準確率,贏不過基準常代表方向或資料有問題;baseline(起點對照)與 SOTA(最佳水準)不同。情境:導入評估常考要先建基準再比較。
想練情境題與詳解 → AI 學習與考證地圖
一個簡單、易實作的參考模型(如多數類、平均值、邏輯迴歸);用來當最低標準,衡量複雜模型是否真的更好。
沒有基準就無法判斷模型好不好;若花大力氣的模型贏不過簡單基準,代表方向或資料有問題。
分類用多數類或隨機猜;迴歸用平均值或中位數;進階一點用線性或邏輯迴歸、決策樹當強基準。
先建立並記錄其指標,之後每個新模型都跟它比;只有顯著且穩定超越,才值得採用更複雜的方案。
基準是起點與對照(求簡單可靠);SOTA 是目前最佳水準(求極致)。實務先打贏基準,再視需求逼近 SOTA。