深度學習 · 訓練目標

損失函數 Loss Functions

模型的「扣分表」。它定義了什麼叫「預測得好」,訓練就是想辦法把總扣分壓到最低。

定義什麼叫好MSE交叉熵可微分對離群值

💡一句話定義

損失函數(Loss Function)= 量化「一筆預測與真實答案差多少」的一把尺。把所有樣本的損失加總/平均,就是模型的總損失訓練=調整參數讓總損失最小。它決定了模型往哪個方向學。

先有損失函數,梯度下降才知道「往哪走能變更好」。所以選對損失,等於幫模型定義了正確的目標。

📝用「扣分表」來想

損失函數就像老師的扣分規則:答錯扣越多分,代表這種錯越不能容忍。MSE(迴歸)用「差距的平方」扣分,離得越遠、扣分暴增;交叉熵(分類)則對「很有信心卻答錯」重罰。模型的目標,就是調整自己、把被扣的總分降到最低。

🎮互動:MSE 與交叉熵

切換兩種損失。MSE:拖動斜率/截距,看紅色方塊(誤差平方)總面積怎麼變。交叉熵:把真實標籤設成正類、再把預測機率拉向 0,看損失如何急速飆高(有信心卻答錯 → 重罰)。

損失函數 (Loss Functions) 互動演示
當前損失值 Loss = 0.00

📊常見損失函數對照表

損失任務公式(概念)特性
MSE 均方誤差迴歸平均 (y−ŷ)²平滑可微、好優化;對離群值敏感(平方放大大誤差)
MAE 平均絕對誤差迴歸平均 |y−ŷ|對離群值穩健;但在 0 點不可微、優化較不平滑
Huber迴歸小誤差像 MSE、大誤差像 MAE兩者折衷:既平滑又對離群穩健
二元交叉熵 BCE二分類−[y·log p +(1−y)·log(1−p)]配 Sigmoid;對「有信心卻錯」重罰
類別交叉熵 CCE多分類−Σ yₖ·log pₖ配 Softmax;ImageNet 等多類分類標配
選型:迴歸先想 MSE(怕離群值換 Huber/MAE);分類用交叉熵(二分類 BCE、多分類 CCE)。

⚠️為什麼分類不用 MSE?(必考)

分類問題若硬用 MSE 搭配 Sigmoid/Softmax,會有兩個麻煩:

🪫梯度消失
Sigmoid 飽和區導數趨近 0,MSE 讓梯度更小,前期幾乎學不動。
🌀非凸難優化
MSE+Sigmoid 的損失面不是漂亮的碗形,容易卡局部極小。
🎯交叉熵更貼合
交叉熵梯度性質好、收斂快,且直接對應「機率」輸出。
結論:分類用交叉熵,不用 MSE——這是考試最愛的判斷題。

🔍損失函數 ≠ 評估指標

兩者容易混淆:損失函數是「訓練時要最小化的目標」,必須可微才能梯度下降(如交叉熵、MSE);評估指標是「拿給人看、判斷好壞」的分數,重可解讀但不一定可微(如準確率、精確率、召回率、F1)。訓練用損失、驗收看指標,常常是不同的兩個東西。

自我檢測

Q1. 訓練跟損失函數是什麼關係?
損失函數量化「預測與真實差多少」,訓練就是調整模型參數讓總損失最小。它決定了模型優化的方向與目標。
Q2. 迴歸和分類各用什麼損失?
迴歸常用 MSE(怕離群值可換 MAE、Huber);分類用交叉熵(二分類 BCE、多分類 CCE)。任務不同、損失不同。
Q3. 為什麼分類不建議用 MSE?
MSE 搭配 Sigmoid/Softmax 容易梯度消失、損失面非凸難優化。交叉熵梯度性質好、收斂快,又直接對應機率輸出,因此是分類標配。
Q4. MSE 為什麼對離群值敏感?Huber 怎麼改善?
MSE 對誤差取平方,離群點的大誤差被平方後暴增,強烈拉動模型去遷就它。Huber 對小誤差像 MSE(平滑)、大誤差像 MAE(線性),因此兼顧可微與對離群穩健。

🎯重點整理

📝 iPAS 考點提醒

損失函數定義什麼叫好,是模型優化的目標,iPAS 必考(中級科目三)。重點:迴歸常用 MSE、MAE、Huber;分類常用交叉熵(對數損失)。易混點:分類不用 MSE(配 Sigmoid 或 Softmax 易梯度消失、非凸難優化),交叉熵梯度性質好、更貼合機率輸出;損失要可微以利優化、評估指標重可解讀(如 F1),兩者常分開。情境:不平衡可用加權或 Focal Loss。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

損失函數是什麼?

量化單筆預測與真實值差距的函數;訓練就是調參數讓總損失最小(迴歸用 MSE、分類用交叉熵),它定義了什麼叫好。

迴歸和分類各用什麼損失?

迴歸常用 MSE、MAE、Huber;分類常用交叉熵(對數損失);任務不同、損失也不同。

為什麼分類不用 MSE?

配 Sigmoid 或 softmax 時 MSE 易使梯度消失、非凸難優化;交叉熵梯度性質好、收斂快、更貼合機率輸出。

什麼是 Huber 損失?

小誤差像 MSE(平滑)、大誤差像 MAE(線性);兼顧可微與對離群穩健,是迴歸的折衷選擇。

損失函數和評估指標一樣嗎?

不一定;損失要可微以利優化(如交叉熵),評估指標重在可解讀(如準確率、F1),兩者常分開。

🧭 相關主題

← 返回 AI 學習與考證地圖