PII(個人識別資料)
又稱:個人識別資料 · 個資 · 個人資料 · personally identifiable information
能單獨或組合起來認出特定個人的資料:姓名、身分證字號、電話、住址、病歷、精確位置……
你會在什麼時候遇到它
餵資料給模型、建 RAG 知識庫、讓 Agent 讀工單時,你遲早會遇到它 —— 而且通常是在資料已經進了上下文之後才遇到。PII 要特殊處理,不是因為模型會「記住」它,而是因為送出去這個動作本身就可能觸法:多數司法管轄區對個資的處理、跨境與目的外使用都有法律要求,而進了第三方服務的資料收不回來。
打個比方
像病歷表:對醫生有用的是病症和用藥,不是姓名和住址。把整張病歷表貼上公告欄,和把去掉名字的那張貼進教學案例牆,是完全不同的兩件事 —— 資料的用處沒變,暴露的面變了。
最小範例
原始工單(示意,人物為虛構):
「王小明(0912-345-678)反映其住處的網路
自 3 月 5 日起中斷,身分證字號 A123456789」
兩種處理:
遮罩(redaction):
「[姓名]([電話])反映[地址]的網路自 3 月 5 日起中斷,[ID]」
→ 直接拿掉,需要時回原系統查
假名化(pseudonymisation):
「用戶 U-8842 反映其住處網路自 3 月 5 日起中斷」
→ 換成代號,對照表另行保管;分析仍可跨工單追蹤同一人注意兩者的差別在可不可逆:遮罩是拿掉,假名化是換個代號、對照表仍存在於某處。假名化保留了跨記錄關聯的分析價值,也保留了被還原的風險 —— 所以對照表的保護等級,要跟原始資料一樣高。
最常搞錯的地方
- 以為只有姓名、身分證字號才算 PII。組合起來能指向個人的都算:「某公司+某職位+某城市」三個單獨無害的欄位,放在一起常常就指向唯一一個人。
- 把「丟給 AI 前自己看過一眼」當成處理流程。人眼抓不住批次資料裡的 PII;要在管線裡用規則和掃描自動化,並且假設總有漏網。
相關詞條
下一步
- 企業資料安全基本盤:哪些資料不能餵給 AI8 min
- AI 合規與風險邊界:企業導入的法務檢查表18 min