降維保留了多少資訊、又丟了多少?
解釋變異比例告訴你「保住多少」,重建誤差告訴你「失真多少」——兩者一加正好是 100%。
PCA 把資料壓到少數幾個主成分。評估它的兩個核心問題:保留了多少資訊?(解釋變異比例)、以及壓縮後還原回去差多少?(重建誤差)。兩者是一體兩面——保留越多,還原誤差越小。
每個主成分各解釋多少變異,由大到小排列。
取前幾個主成分,加總保留的資訊比例。
壓縮再還原,和原始資料的距離。
下方陡坡圖是 8 個主成分各自的解釋變異比例(由大到小)。拖動滑桿決定保留幾個,被保留的會亮起,並即時算出累積解釋變異與重建誤差。
注意「報酬遞減」:前 2~3 個主成分通常就保留了大部分變異,後面加再多也只多一點點。找那個「手肘」轉折,就是 CP 值最高的 k。
常用準則:累積解釋變異達到門檻(如 90% / 95%)就停;陡坡圖手肘法找下降變平的轉折;或直接看重建誤差能否接受。三者其實是同一件事的不同視角。
PCA(主成分分析)是最常用的非監督降維,iPAS 中級科目三考點。重點:找變異最大的正交方向投影降維,用累積解釋變異比例決定保留幾維(如 90% 或 95%)、或看陡坡圖轉折。易混點:PCA 非監督(只看整體變異)、LDA 監督(用標籤找最能分類方向);用前要標準化、PCA 假設線性、對離群敏感。情境:視覺化、去冗餘、加速後續模型。
想練情境題與詳解 → AI 學習與考證地圖
主要看解釋變異比例(explained variance ratio)——保留的主成分共解釋了原資料多少變異;也看重建誤差。
累積解釋變異(如達 90 到 95%)決定要保留幾個主成分;陡坡圖(scree plot)看變異下降的轉折點輔助判斷。
把降維後的資料還原回原空間、與原資料的差距;誤差越小代表保留的主成分越能代表原資料。
PCA 是線性、對尺度敏感(需先標準化);解釋變異高不代表對下游任務最有用,仍要看實際模型表現。
PCA 看變異與重建(全局);t-SNE 與 UMAP 是非線性視覺化,用 Trustworthiness、Continuity、kNN 保留率等結構保留指標。