Agentic Research

Data Classification(資料分級)

又稱:資料分級 · 數據分級 · 敏感資料分類 · data classification

先按敏感度把資料分類(公開/內部/機密/受限),再決定每一類可以流向哪裡 —— 包括能不能進模型的上下文。

你會在什麼時候遇到它

這是把資料交給 AI 之前的第零步,也是其他一切控制的前提:沙箱限制的是 Agent 能碰什麼,但「這份資料到底能不能給它碰」得先有答案。沒有分級,後面每一道控制都在盲猜,「哪些資料不能餵給模型」這個問題根本無從回答。

打個比方

像檔案室的密級標籤:公開架、內部架、保密柜。貼了標籤,清潔工、訪客、正式員工各能進到哪一區就有依據;沒貼標籤,只剩兩個極端 —— 假設所有人都能看所有東西,或者所有人都什麼都不能看。

最小範例

一個最小分級表(示意,依組織調整):

  公開   官網內容、已發布的研究         → 任何模型皆可
  內部   一般程式碼、內部文件           → 限公司核准的模型
  機密   客戶名單、財務明細、合約       → 先脫敏或取得授權,否則不進上下文
  受限   密碼、金鑰、PII、未公開併購案  → 原則上永不進模型

注意分級是資料的屬性,不是系統的屬性:同一個 Agent,可以碰內部資料、不能碰受限資料。分級做完,沙箱和權限閘門才有東西可參照 —— 規則從「小心點」變成「機密以上要審批」。

最常搞錯的地方

  • 先接了 AI 再補分級。事後補等於在已經洩漏的池子裡畫線:資料進了第三方模型的上下文就收不回來,而且你通常無法確認它被怎麼使用。
  • 分級分細到沒人執行得了。三十個等級、每份文件都要評審,結果是沒人分類,或者全部被分成「內部」了事。能落地的粗分級,勝過精緻的紙上分級。

相關詞條

下一步