在輸入加上人眼難辨的微小擾動,模型就會自信地答錯。
最有效的防禦是「對抗訓練」——把對抗樣本也拿去訓練,讓模型變得更穩。
對抗式攻擊(Adversarial Attack)是 AI 安全裡最經典的一種:在輸入上加一點人眼幾乎看不出的擾動,模型就會自信滿滿地答錯。一張小貼紙貼在路標上,自駕車就可能誤判——這是真實存在的風險。
模型判斷正確:停止標誌。
加上幾乎看不見的雜訊。
同一張圖,卻被判成別的類別。
可怕的是:擾動小到人眼看不出,模型卻錯得很有信心。這暴露了神經網路「決策邊界很脆弱」的本質。
下圖模型對一張圖的正確類別信心。拖動擾動強度:一開始人眼幾乎看不出差別,但信心會快速下滑,過了某個臨界點就突然翻盤誤判。再開啟「對抗訓練」防禦,看模型變得多穩。
無防禦時,小小擾動就能讓模型翻車;開啟對抗訓練後(把對抗樣本也拿去訓練),同樣的擾動下模型穩得多——這就是最主流的防禦法。
對抗式攻擊是 AI 安全的核心威脅,iPAS 治理考點(中級科目二)。重點:對輸入加上人眼幾乎看不出的微小擾動,就能讓模型自信地誤判(如把停止標誌誤認),防禦有對抗訓練、輸入淨化等。易混點:對抗樣本利用的是模型脆弱的決策邊界,與一般雜訊不同(是刻意設計的);與強健性、安全性密切相關。情境:自駕、人臉辨識、內容審核的安全評估。
想練情境題與詳解 → AI 學習與考證地圖
對輸入加上人眼幾乎看不出的微小擾動,卻能讓模型自信地誤判(如把停止標誌看成限速),暴露模型脆弱性。
高維空間中模型的決策邊界對某些方向極敏感;微小但對的方向的擾動就能跨過邊界、造成錯誤分類。
白箱(知道模型梯度,如 FGSM、PGD)、黑箱(只看輸出)、定向(指定誤判成某類)與非定向,也有實體攻擊(如貼紙)。
對抗訓練(把對抗樣本加入訓練)最有效;還有輸入前處理、偵測對抗樣本、整體與認證式防禦(梯度遮蔽較弱)。
自駕、人臉辨識、內容審核等若被對抗攻擊後果嚴重;穩健性與防禦是部署高風險 AI 的必要考量。