差分隱私在結果加入數學雜訊,保證「有你」和「沒你」查出的答案幾乎一樣——
別人就無法反推你的個資。隱私預算 ε 控制隱私與準確的拉鋸。
差分隱私(Differential Privacy, DP)是隱私保護裡最嚴謹的一種。它的保證很強:不論你有沒有把自己的資料放進資料庫,查詢結果幾乎不會改變——所以別人無法從結果反推「你在不在裡面」。做法是在結果上加入精心設計的隨機雜訊。
「有你」和「沒你」這兩個版本的資料庫,查出來的答案幾乎一模一樣。既然看不出差別,就無從得知你的個人資料。
控制強度的旋鈕叫隱私預算 ε(epsilon):ε 越小 → 加越多雜訊 → 越隱私,但結果越不準;ε 越大 → 越準,但越不隱私。這是一個必須拿捏的權衡。
假設要統計「平均薪資」。拖動隱私預算 ε:ε 小(左)→ 加大量雜訊,查詢結果在真值附近劇烈跳動,個人被藏得很好;ε 大(右)→ 幾乎不加噪,結果很準但保護很弱。
真值固定是 50K。ε 越小,每次查詢結果跳動越大(雜訊多)→ 個人隱私越安全但統計越不可靠;ε 越大則相反。多按幾次「重新查詢」感受跳動幅度。
差分隱私是保護個資的嚴謹技術,iPAS 治理與隱私考點(中級科目二)。重點:在查詢或訓練中加入校準過的雜訊,使某一個人是否在資料集中幾乎無法分辨,以隱私預算 ε 量化保護強度(ε 越小越私密)。易混點:去識別化(移除欄位)可能被重新識別,差分隱私提供數學保證更強;隱私與準確度需權衡。情境:釋出統計資料、聯邦學習、敏感資料訓練。
想練情境題與詳解 → AI 學習與考證地圖
一種數學上的隱私保證:在分析或訓練中加入校準過的隨機雜訊,使某個人是否在資料集中對結果幾乎沒有可辨別的影響。
因為任一個體的加入或移除幾乎不改變輸出,攻擊者就難以從結果推斷某特定人的資料,即使握有其他背景知識。
量化隱私強度的參數:ε 越小隱私越強(加更多雜訊)但效用越低;ε 越大則相反,是隱私與準確的取捨旋鈕。
統計發布(如人口普查)、機器學習訓練(DP-SGD 在梯度加噪)、大型科技公司的遙測資料收集等。
加噪會降低準確與統計精度,小資料或小群體尤其明顯,需在可接受的效用下選擇合適的 ε。