Adversarial Defense

對抗式攻擊防禦

肉眼看不出的擾動,卻能騙倒 AI

在輸入加上人眼難辨的微小擾動,模型就會自信地答錯。
最有效的防禦是「對抗訓練」——把對抗樣本也拿去訓練,讓模型變得更穩。

防禦核心:對抗訓練 + 輸入淨化 + 異常偵測
01 — 白話直覺

一張貼紙,讓 AI 把停止標誌看成限速

對抗式攻擊(Adversarial Attack)是 AI 安全裡最經典的一種:在輸入上加一點人眼幾乎看不出的擾動,模型就會自信滿滿地答錯。一張小貼紙貼在路標上,自駕車就可能誤判——這是真實存在的風險。

🛑
原始輸入
正確

模型判斷正確:停止標誌。

加微小擾動
肉眼難辨

加上幾乎看不見的雜訊。

⚠️
模型誤判
出錯

同一張圖,卻被判成別的類別。

可怕的是:擾動小到人眼看不出,模型卻錯得很有信心。這暴露了神經網路「決策邊界很脆弱」的本質。

02 — 核心互動

加大擾動,看模型何時崩潰

下圖模型對一張圖的正確類別信心。拖動擾動強度:一開始人眼幾乎看不出差別,但信心會快速下滑,過了某個臨界點就突然翻盤誤判。再開啟「對抗訓練」防禦,看模型變得多穩。

0
正確類別信心
判定

無防禦時,小小擾動就能讓模型翻車;開啟對抗訓練後(把對抗樣本也拿去訓練),同樣的擾動下模型穩得多——這就是最主流的防禦法。

03 — 防禦方法

怎麼抵抗對抗攻擊?

優點

  • 對抗訓練:把對抗樣本加入訓練,最有效
  • 輸入淨化:先把可疑擾動濾掉再餵模型
  • 偵測異常輸入,可疑就拒絕或人工複核

缺點 / 限制

  • 對抗訓練成本高、會略降乾淨樣本準確率
  • 攻防是軍備競賽,沒有一勞永逸
  • 防得了已知攻擊,新攻法仍可能突破

典型應用場景

🚗
自動駕駛
防路標、車道被惡意干擾
🔓
人臉辨識
防偽裝、對抗式眼鏡攻擊
🛡️
內容審核
防繞過過濾的對抗文字/圖

📝 iPAS 考點提醒

對抗式攻擊是 AI 安全的核心威脅,iPAS 治理考點(中級科目二)。重點:對輸入加上人眼幾乎看不出的微小擾動,就能讓模型自信地誤判(如把停止標誌誤認),防禦有對抗訓練、輸入淨化等。易混點:對抗樣本利用的是模型脆弱的決策邊界,與一般雜訊不同(是刻意設計的);與強健性、安全性密切相關。情境:自駕、人臉辨識、內容審核的安全評估。

想練情境題與詳解 → AI 學習與考證地圖

❓ 常見問題

對抗樣本(adversarial example)是什麼?

對輸入加上人眼幾乎看不出的微小擾動,卻能讓模型自信地誤判(如把停止標誌看成限速),暴露模型脆弱性。

為什麼模型會被騙?

高維空間中模型的決策邊界對某些方向極敏感;微小但對的方向的擾動就能跨過邊界、造成錯誤分類。

有哪些攻擊類型?

白箱(知道模型梯度,如 FGSM、PGD)、黑箱(只看輸出)、定向(指定誤判成某類)與非定向,也有實體攻擊(如貼紙)。

怎麼防禦?

對抗訓練(把對抗樣本加入訓練)最有效;還有輸入前處理、偵測對抗樣本、整體與認證式防禦(梯度遮蔽較弱)。

為什麼這是 AI 安全重點?

自駕、人臉辨識、內容審核等若被對抗攻擊後果嚴重;穩健性與防禦是部署高風險 AI 的必要考量。

🧭 相關主題

← 返回 AI 學習與考證地圖