De-identification(去識別化)
又稱:去識別化 · 匿名化 · 脫敏 · anonymization
把資料裡指向個人的部分拿掉或改寫,讓它還能被分析,但(理想上)認不出來是誰。
你會在什麼時候遇到它
想用真實資料測 Agent、建知識庫、或把案例交給外部模型時,這是必經的一步。跳過它的代價在 PII 那條講過了;但更危險的是做了它、然後以為安全 —— 去識別化常常是可逆的,尤其當攻擊者手上握有旁側資訊。
打個比方
像把照片裡的臉打馬賽克。多數情況夠用;但如果照片裡有獨特的背景、日期、制服名牌,或者看的人本來就認識當事人,打碼的照片照樣認得出來。馬賽克遮掉的是最明顯的那條路,不是所有的路。
最小範例
原始:「王小明,男,34 歲,某市某科技公司工程師,
3 月 12 日因車禍送醫,診斷為左腿骨折」
去識別化:「一名 30-39 歲男性,居住於某地區,
於某季因車禍就醫,診斷為下肢骨折」
攻擊者若握有旁側資訊(例如知道 3 月 12 日某區發生過
一起工程師車禍),第二條照樣能對回第一條。注意泛化的方向:具體欄位被換成區間(34 → 30-39、日期 → 季節),分析價值保留了大部分;但每留下一個罕見組合,可逆性就多一分。去識別化是一場「保留多少 vs 暴露多少」的交易,不是一個開關。
最常搞錯的地方
- 把去識別化當成不可逆的「已安全」狀態。只要攻擊者握有旁側資訊 —— 其他資料集、新聞、內部知識 —— 組合起來就可能重新認出個人。這類重新識別攻擊在學術與實務上都有大量記錄。
- 以為「匿名化」和「去識別化」是一回事。嚴格意義上的匿名化要求不可逆,難度高得多;多數團隊實際做的是假名化或泛化,卻用「已匿名」的名義放鬆了所有後續保護。
相關詞條
下一步
- 企業資料安全基本盤:哪些資料不能餵給 AI8 min
- AI 合規與風險邊界:企業導入的法務檢查表18 min