Explained Variance · Reconstruction

PCA 的評估指標

解釋變異比例 × 重建誤差

降維保留了多少資訊、又丟了多少?
解釋變異比例告訴你「保住多少」,重建誤差告訴你「失真多少」——兩者一加正好是 100%。

累積解釋變異 = Σλₖ / Σλ · 重建誤差 = 1 − 累積變異
01 — 白話直覺

降維保留了多少?又丟了多少?

PCA 把資料壓到少數幾個主成分。評估它的兩個核心問題:保留了多少資訊?(解釋變異比例)、以及壓縮後還原回去差多少?(重建誤差)。兩者是一體兩面——保留越多,還原誤差越小。

陡坡圖
Scree Plot

每個主成分各解釋多少變異,由大到小排列。

累積變異
越接近 100%

取前幾個主成分,加總保留的資訊比例。

重建誤差
還原差距

壓縮再還原,和原始資料的距離。

02 — 核心互動

選幾個主成分?看資訊與誤差的權衡

下方陡坡圖是 8 個主成分各自的解釋變異比例(由大到小)。拖動滑桿決定保留幾個,被保留的會亮起,並即時算出累積解釋變異重建誤差

2
累積解釋變異
重建誤差(丟失)
壓縮率

注意「報酬遞減」:前 2~3 個主成分通常就保留了大部分變異,後面加再多也只多一點點。找那個「手肘」轉折,就是 CP 值最高的 k。

累積變異 = Σ(前 k 個 λ) / Σ(全部 λ) · 重建誤差 = 1 − 累積變異
03 — 指標一覽

PCA 怎麼判斷降到幾維才夠?

常用準則:累積解釋變異達到門檻(如 90% / 95%)就停;陡坡圖手肘法找下降變平的轉折;或直接看重建誤差能否接受。三者其實是同一件事的不同視角。

優點

  • 解釋變異比例直觀量化「保留了多少資訊」
  • 重建誤差能對應到實際的失真程度
  • 陡坡圖一眼看出該保留幾個主成分

缺點 / 限制

  • 門檻(90%/95%)的選擇帶有主觀
  • 只衡量變異,不保證對下游任務最有用
  • 非線性結構下,線性 PCA 的指標會低估真實可壓縮性

典型應用場景

🗜️
資料壓縮
用最少主成分逼近原始資料
🔇
去雜訊
丟掉變異小的成分=濾掉雜訊
🎚️
選維度
用 95% 變異門檻決定降到幾維

📝 iPAS 考點提醒

PCA(主成分分析)是最常用的非監督降維,iPAS 中級科目三考點。重點:找變異最大的正交方向投影降維,用累積解釋變異比例決定保留幾維(如 90% 或 95%)、或看陡坡圖轉折。易混點:PCA 非監督(只看整體變異)、LDA 監督(用標籤找最能分類方向);用前要標準化、PCA 假設線性、對離群敏感。情境:視覺化、去冗餘、加速後續模型。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

PCA 降維後怎麼評估好壞?

主要看解釋變異比例(explained variance ratio)——保留的主成分共解釋了原資料多少變異;也看重建誤差。

解釋變異比例怎麼用?

累積解釋變異(如達 90 到 95%)決定要保留幾個主成分;陡坡圖(scree plot)看變異下降的轉折點輔助判斷。

重建誤差是什麼?

把降維後的資料還原回原空間、與原資料的差距;誤差越小代表保留的主成分越能代表原資料。

PCA 評估要注意什麼?

PCA 是線性、對尺度敏感(需先標準化);解釋變異高不代表對下游任務最有用,仍要看實際模型表現。

PCA 和 t-SNE、UMAP 的評估差在哪?

PCA 看變異與重建(全局);t-SNE 與 UMAP 是非線性視覺化,用 Trustworthiness、Continuity、kNN 保留率等結構保留指標。

🧭 相關主題

← 返回 AI 學習與考證地圖