📈 迴歸入門 · iPAS 常考

線性迴歸 & 多項式迴歸:用一條線預測未來

從「畫一條最貼近資料的線」開始,一路搞懂殘差、最小平方法、MAE/MSE,以及為什麼「線彎得越誇張」反而越糟。邊讀邊玩下面的互動畫布,概念會自己長進腦袋裡。

白話定義動手玩數學原理MAE vs MSE過擬合陷阱實務應用

🤔 一、迴歸到底在做什麼?

一句話:用已知的資料,找出「輸入 → 輸出」的規律,再拿這個規律去預測新的、連續的數字。

💡 白話定義

迴歸(Regression)就是「找一條最能代表一堆資料點的線」。有了這條線,看到新的輸入值,就能順著線預測它對應的輸出。輸出是連續數字(像價格、溫度、體重)時叫迴歸;如果輸出是類別(貓/狗、會不會違約)那就是分類了。

🧍 生活比喻:用身高猜體重

你蒐集了班上 30 個同學的「身高 vs 體重」,把每個人畫成一個點。整體看起來「身高越高,體重通常越重」。於是你拿尺畫一條最貼近大家的斜線——這條線就是迴歸線。下次來了一位只知道身高的新同學,你把身高代進線裡,就能合理猜出他的體重。模型做的事,跟你拿尺畫線一模一樣,只是它用數學算得更準。

線性迴歸就是規定那條線必須是「直線」;而 多項式迴歸則放寬限制,允許線彎曲(拋物線、S 形…),去貼合更複雜的趨勢。下面的畫布兩種都能玩——把滑桿從 1 拉大,直線就會開始彎。

🎮 二、動手玩:自己畫資料、自己找線

先按「載入範例資料」最快上手;或直接點畫布到處點出資料點。再拖階數滑桿,看橘色線怎麼追著藍點跑,右邊的 MAE/MSE 怎麼變。

1 = 直線(線性迴歸)
2 = 拋物線(1 個彎)
3+ = 越來越扭曲的曲線
MAE 平均絕對誤差・越小越貼合 0.00
MSE 均方誤差・重罰大誤差 0.00

目前的模型方程式:
尚未計算
係數為 x 正規化到 0–1 後的值(避免高次方爆掉)。

🟦 藍點 = 你的資料 🟧 橘線 = 模型找到的線 🟨 黃虛線 = 殘差(每個點到線的距離)

🧮 三、它怎麼知道「哪條線最好」?

關鍵字:殘差最小平方法。看完這四步,你就懂畫布背後在算什麼。

1
先定義「錯多少」=殘差(Residual)
每個資料點到線的垂直距離,就是這個點的誤差,叫殘差:
殘差 = 真實值 y 預測值 ŷ 畫布上那些黃色虛線就是殘差。線越貼近點,虛線越短。
2
為什麼要「平方」?
我們把每條殘差平方再加起來。三個理由:
避免正負抵消——線上方的點誤差是正、下方是負,直接相加會互相抵銷,平方後全變正;
重罰大誤差——差 2 平方是 4、差 10 平方是 100,逼模型別把任何一點偏太多;
數學好算——平方後是平滑的碗狀函數,可微分、有唯一最低點。
3
目標:讓「殘差平方和」最小
把所有點的殘差平方加總,這個總和叫 SSE(誤差平方和)。最好的線,就是讓它最小的那條——這就是大名鼎鼎的最小平方法(OLS, Ordinary Least Squares)目標:min Σ ( y ŷ )²
4
兩種找法
正規方程(Normal Equation):直接用公式一步解出最佳係數,資料不大時最快、最準(畫布用的就是這招);
梯度下降(Gradient Descent):從隨便一條線開始,沿著「讓誤差變小」的方向一小步一小步調整,資料量很大時更划算。兩者殊途同歸。

📐 係數在說什麼?

直線模型寫成 y = w₀ + w₁·xw₁(斜率)= x 每增加 1 單位,y 平均變動多少;w₀(截距)= x = 0 時的基準值。多了 x²、x³ 項,就變成會彎的多項式。

⚖️ 四、MAE vs MSE:兩把不一樣的尺

畫布右邊那兩個數字,都是在量「模型錯多少」,但個性差很多。考試最愛考它們的差別。

MAE = 平均( |y ŷ| )   MSE = 平均( (y ŷ)² )
比較MAE 平均絕對誤差MSE 均方誤差
怎麼算誤差取絕對值再平均誤差平方再平均
單位和 y 相同(直覺好懂)是 y 的平方(較難直接解讀)
對離群值敏感、較穩健敏感(平方會放大)
數學性質在 0 點不可微,較難優化平滑可微,好做梯度下降
適合時機資料有離群值、想要穩健指標大誤差特別不能忍、要訓練模型

🧪 在畫布上親眼看差別

載入範例後,故意在很遠的地方點一個離群點。你會發現 MSE 立刻暴衝(因為它把那個大誤差平方了),而 MAE 只是溫和上升。這就是「MSE 對離群值敏感」的真面目。

➕ 還有 RMSE 和 R²

RMSE = √MSE,把單位開根號拉回和 y 一樣,兼顧「重罰大誤差」又「好解讀」,實務最常報這個。R²(決定係數)則是換個角度:模型比「直接猜平均值」好多少,1 代表完美、0 代表跟亂猜差不多。👉 想深入可看 MAE/MSE/RMSE/R² 專頁

⚠️ 五、陷阱:誤差越小,真的越好嗎?

把畫布的階數慢慢拉到 6、7,你會看到橘線開始瘋狂扭動、硬是穿過每一個點,MSE 幾乎變 0。看起來完美——但這其實是大災難。

🌀 過擬合(Overfitting)

階數太高時,模型不是在「學規律」,而是在死背每一個點,連雜訊都背下來。它在你給的舊資料上幾乎零誤差,但只要來一個沒見過的新點,預測就會錯得離譜。這叫過擬合:記性太好,理解太差

🥱 反過來:欠擬合(Underfitting)

如果資料明明是彎的,你卻硬用階數 1 的直線去配,線怎麼擺都貼不上——這叫欠擬合:模型太簡單,連舊資料的規律都抓不到

所以黃金法則是:不是訓練誤差越小越好,而是要對「沒見過的資料」也準。太簡單會欠擬合、太複雜會過擬合,要在中間找平衡。實務上靠這些手段拿捏:

🔁 交叉驗證留一部分資料當「模擬考」,看模型對沒見過的資料表現。
🎚️ 正則化Ridge(L2)/Lasso(L1) 懲罰過大的係數,逼線別亂彎。
📉 選對複雜度從低階數開始加,驗證誤差開始變差就停。

🏠 六、現實世界用在哪?

迴歸是資料科學最常用的起手式,凡是「想用幾個因素預測一個數字」都用得上。

🏡 房價預測用坪數、屋齡、地點預測成交價。
📊 銷售預測用廣告花費、季節預測下個月營收。
🌡️ 用電量用氣溫預測電力負載。
🩺 健康指標用生活習慣預測血壓、血糖趨勢。

🔑 怎麼讀係數(最實用的技能)

假設房價模型算出 價格 = 80 + 12 × 坪數(單位:萬)。意思是:坪數每多 1 坪,價格平均增加 12 萬;80 是基準截距。係數的正負告訴你方向(正相關/負相關),大小告訴你影響力——但要注意各變數單位尺度不同時不能直接比大小。

🚫 三個常見誤會

相關 ≠ 因果:迴歸找到「冰淇淋銷量和溺水數」一起上升,不代表冰淇淋害人溺水(其實是夏天)。
外推有風險:模型在見過的範圍內準,硬套到超出範圍的值容易失真。
離群值與共線性:極端點會拉歪線;高度相關的自變數會讓係數變得不可靠。

✅ 七、30 秒重點整理

迴歸=找最貼合的線用來預測連續數字;線性是直線、多項式可彎。
殘差=真實 − 預測就是畫布上的黃虛線,越短越好。
最小平方法讓「殘差平方和」最小的那條線最佳。
MAE 穩健 / MSE 重罰大誤差有離群值看 MAE,訓練模型常用 MSE、報告用 RMSE。
過擬合 = 死背雜訊誤差小不等於好,要對新資料準。
係數會說話斜率=x 每增 1、y 平均變動多少。

📝 iPAS 考點提醒

線性迴歸是最基礎的監督式迴歸模型,iPAS 常考(初級科目一、中級科目三)。重點:找一條直線或超平面讓殘差平方和最小,用自變數的線性組合預測連續目標。易混點:有線性、誤差獨立同方差、近常態、不高度共線等假設,違反會失準;對離群值敏感。情境:房價、銷售預測;係數可解讀為該變數每增一單位、目標平均變動的量。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

線性迴歸在做什麼?

找一條直線(或超平面)讓預測值與真實值的誤差最小,用自變數的線性組合預測連續目標。

怎麼找最佳直線?

最小化殘差平方和(最小平方法);可用正規方程一步直接解,或用梯度下降迭代逼近(大資料較適用)。

線性迴歸有什麼假設?

線性關係、誤差獨立且同方差、誤差近常態、自變數間不高度共線;違反時結果與推論會失準。

係數怎麼解讀?

在其他變數固定下,該自變數每增加一單位、目標平均變動的量;正負代表方向、大小代表影響(需注意尺度)。

線性迴歸的限制?

只能捕捉線性關係、對離群值敏感、易受共線性影響;非線性問題需轉換特徵或改用非線性模型。

🧭 相關主題

← 返回 AI 學習與考證地圖