Agentic Research

PII(個人識別資料)

又稱:個人識別資料 · 個資 · 個人資料 · personally identifiable information

能單獨或組合起來認出特定個人的資料:姓名、身分證字號、電話、住址、病歷、精確位置……

你會在什麼時候遇到它

餵資料給模型、建 RAG 知識庫、讓 Agent 讀工單時,你遲早會遇到它 —— 而且通常是在資料已經進了上下文之後才遇到。PII 要特殊處理,不是因為模型會「記住」它,而是因為送出去這個動作本身就可能觸法:多數司法管轄區對個資的處理、跨境與目的外使用都有法律要求,而進了第三方服務的資料收不回來。

打個比方

像病歷表:對醫生有用的是病症和用藥,不是姓名和住址。把整張病歷表貼上公告欄,和把去掉名字的那張貼進教學案例牆,是完全不同的兩件事 —— 資料的用處沒變,暴露的面變了。

最小範例

原始工單(示意,人物為虛構):
  「王小明(0912-345-678)反映其住處的網路
    自 3 月 5 日起中斷,身分證字號 A123456789」

兩種處理:
  遮罩(redaction):
    「[姓名]([電話])反映[地址]的網路自 3 月 5 日起中斷,[ID]」
    → 直接拿掉,需要時回原系統查
  假名化(pseudonymisation):
    「用戶 U-8842 反映其住處網路自 3 月 5 日起中斷」
    → 換成代號,對照表另行保管;分析仍可跨工單追蹤同一人

注意兩者的差別在可不可逆:遮罩是拿掉,假名化是換個代號、對照表仍存在於某處。假名化保留了跨記錄關聯的分析價值,也保留了被還原的風險 —— 所以對照表的保護等級,要跟原始資料一樣高。

最常搞錯的地方

  • 以為只有姓名、身分證字號才算 PII。組合起來能指向個人的都算:「某公司+某職位+某城市」三個單獨無害的欄位,放在一起常常就指向唯一一個人。
  • 把「丟給 AI 前自己看過一眼」當成處理流程。人眼抓不住批次資料裡的 PII;要在管線裡用規則和掃描自動化,並且假設總有漏網。

相關詞條

下一步