Agentic Research

De-identification(去識別化)

又稱:去識別化 · 匿名化 · 脫敏 · anonymization

把資料裡指向個人的部分拿掉或改寫,讓它還能被分析,但(理想上)認不出來是誰。

你會在什麼時候遇到它

想用真實資料測 Agent、建知識庫、或把案例交給外部模型時,這是必經的一步。跳過它的代價在 PII 那條講過了;但更危險的是做了它、然後以為安全 —— 去識別化常常是可逆的,尤其當攻擊者手上握有旁側資訊。

打個比方

像把照片裡的臉打馬賽克。多數情況夠用;但如果照片裡有獨特的背景、日期、制服名牌,或者看的人本來就認識當事人,打碼的照片照樣認得出來。馬賽克遮掉的是最明顯的那條路,不是所有的路。

最小範例

原始:「王小明,男,34 歲,某市某科技公司工程師,
       3 月 12 日因車禍送醫,診斷為左腿骨折」

去識別化:「一名 30-39 歲男性,居住於某地區,
       於某季因車禍就醫,診斷為下肢骨折」

攻擊者若握有旁側資訊(例如知道 3 月 12 日某區發生過
一起工程師車禍),第二條照樣能對回第一條。

注意泛化的方向:具體欄位被換成區間(34 → 30-39、日期 → 季節),分析價值保留了大部分;但每留下一個罕見組合,可逆性就多一分。去識別化是一場「保留多少 vs 暴露多少」的交易,不是一個開關。

最常搞錯的地方

  • 把去識別化當成不可逆的「已安全」狀態。只要攻擊者握有旁側資訊 —— 其他資料集、新聞、內部知識 —— 組合起來就可能重新認出個人。這類重新識別攻擊在學術與實務上都有大量記錄。
  • 以為「匿名化」和「去識別化」是一回事。嚴格意義上的匿名化要求不可逆,難度高得多;多數團隊實際做的是假名化或泛化,卻用「已匿名」的名義放鬆了所有後續保護。

相關詞條

下一步