「哪些資料可以給 AI、哪些絕對不行?」——這個問題如果沒有標準答案,第一線的判斷就會五花八門,而只要有一次把客戶個資或機密條款貼進外部工具,外洩就無法回收。這篇文章要建立的就是這個標準答案:先給資料分級,讓每一類資料有明確的使用規則;再給紅線清單與工具選擇的判斷依據;最後給一份可以直接拿去和 IT、法務開會用的問題清單。讀完你會發現,資料安全不是「能不能用 AI」的問題,而是「什麼資料、配什麼工具」的對應問題。
資料分級:四分法
先把公司資料分成四級。分級的意義在於:每一級對應一組明確的 AI 使用規則,第一線員工不需要懂技術,只需要會分類。
| 等級 | 定義 | 例子 | AI 使用規則 |
|---|---|---|---|
| 公開 | 已對外發佈或可公開取得 | 官網文案、已發佈的產品型錄、公開新聞稿 | 各類工具都可用 |
| 內部 | 限公司內部流轉,外洩影響輕微 | 內部公告、流程文件、會議紀錄(不含敏感內容) | 公司核準的企業版工具;禁用個人免費帳號處理 |
| 機密 | 外洩會造成商業損害 | 客戶合約與報價、未公開財務資訊、原始碼、行銷策略、人事薪資 | 預設不出網:本地部署,或經法務核準、簽有資料處理協議的企業方案 |
| 受監管 | 法律法規對其收集、處理、跨境傳輸有專門要求 | 個人身分資料、健康醫療資料、金融帳戶與交易資料、受出口管制的技術資料 | 未經法務與資安核準,一律不得輸入任何 AI 工具;優先本地部署 |
分級要落在文件上,而不是留在觀念裡:給每一級配上「正面表列」的具體例子,貼到內部規範中,員工才判得動。哪一級算「受監管」、跨境傳輸的界線在哪,各地法規不同,必須由你們的法務依公司所在與客戶所在市場認定,本文不構成法律意見。
紅線清單:這些內容絕對不要直接貼進公有雲 AI
不論工具多有名、條款多好看,以下內容在未經核準前都屬於紅線:
- 個人身分與聯絡資料:身分證字號、護照號碼、住址、電話、病歷、帳戶號碼。
- 存取憑證:密碼、API 金鑰、權杖、內部系統的連線字串。這類內容一旦進入對話紀錄,等同憑證外洩,應立即撤換。
- 客戶的機密:合約條款、報價、技術文件。注意這是「客戶的」機密,你對客戶負有保密義務,無權代為決定上傳。
- 未公開的重大資訊:未公佈的財務數字、併購規劃、重大投資。對上市公司或金融機構,這類資訊的使用另有監管要求,先問法務。
- 核心智慧財產:演算法原始碼、配方、製程細節、專利申請前的技術內容。
- 受管制資料:受出口管制或跨境傳輸限制的技術與資料。
一個常被忽略的細節:去識別化不等於拿掉姓名。把姓名換成代號,但保留「某公司董座、某日期、某醫院」的組合,識別的門檻依然很低。真正的去識別化要拿掉所有能交叉比對出特定人或特定機密的欄位,這件事的標準同樣應由資安與法務定義。
萬一已經貼進去了怎麼辦? 紅線存在的意義是事前防範,但事故還是會發生。建議事先把應變動作寫成流程,事故發生時照著做:第一,記錄事故內容(什麼資料、貼到哪個工具、什麼帳號、什麼時間);第二,涉及憑證的立即撤換憑證,這比任何刪除動作都優先;第三,刪除該對話與相關紀錄,並確認供應商條款中關於刪除的效力範圍;第四,依公司資安事件流程通報,由資安與法務評估是否觸發對外通報義務(對監管機構或對當事人的通知時限,各地法規不同,由法務判斷);第五,把事故案例去識別化後納入內部宣導。切記:通報不追責的文化和清晰的流程,決定了事故會被如實上報還是被隱瞞——後者的代價大得多。
企業版與消費版:差別在條款,不在功能
很多工具的企業版和個人版介面幾乎一樣,差別藏在條款裡。決定能不能商用於內部資料的,是下面這張對照表裡的每一項:
| 檢查項 | 消費版常見情況 | 企業版應確認的內容 |
|---|---|---|
| 輸入是否用於模型訓練 | 條款可能預設允許,或提供關閉選項 | 明確的書面承諾:不使用客戶資料訓練模型 |
| 資料保留期間 | 可能保留用於濫用防範等目的 | 保留天數、可否要求刪除、刪除的執行方式 |
| 管理後台 | 無 | 集中管理帳號、用量、功能開關 |
| 稽核紀錄 | 無 | 誰在什麼時間用了什麼,可匯出查核 |
| 單一登入與權限 | 無 | 支援公司的 SSO,離職即停用 |
| 資料處理協議(DPA) | 不提供 | 可簽署,且能列出 subprocessor(再委託的第三方)清單 |
| 資料存放地區 | 不保證 | 可指定或有明確說明 |
兩個使用原則:第一,每一項都以供應商當前的條款原文為準,不要依賴記憶、銷售口頭說法或網路上的舊文章——條款會改版,本文也不對任何供應商的現行條款做斷言。第二,免費版永遠按消費版對待:不允許處理內部級以上的資料。
本地部署選項:資料不出網的代價與選擇
如果分級結果是「機密或受監管,且必須用 AI」,主流做法是把開源模型部署在自己的機器或伺服器上。資料全程留在公司邊界內,這是最強的控制,代價是能力與便利性通常低於最先進的雲端模型,且需要有人維運。
三個常見的開源部署方案,定位各不相同:
| 方案 | 定位 | 適合誰 | 需要什麼 |
|---|---|---|---|
| Ollama | 用最簡單的方式在本機跑開源模型 | 個人或團隊的實驗與輕量使用 | 一台記憶體足夠的電腦;技術門檻低 |
| LM Studio | 圖形介面的本機模型工具 | 不碰命令列的使用者 | 個人電腦;適合單人場景 |
| vLLM | 伺服器級的高吞吐推理引擎 | 要對整個公司提供服務的資訊部門 | 伺服器與 GPU 資源、專人維運 |
硬體需求的判斷方式:每個開源模型的發佈頁都會標註建議的記憶體與顯示記憶體需求,模型愈大、能力愈強、需求愈高。做法是先確定場景需要的能力等級,再從「能力夠用」的模型裡挑資源需求最小的,而不是反過來。
也要說清楚本地部署的邊界:資料不出網不等於絕對安全。模型檔案要從可信來源取得;本機服務仍要做帳號權限控制,否則敏感資料只是換了一條外洩路徑(從雲端變成內部任意存取);開源模型的能力更新節奏也需要有人跟進。想深入評估安全面,可參考AI 安全紅隊測試。
需要跟 IT 與法務確認的問題清單
把這篇文章變成行動的最快方式,是拿著下面的清單約一次會。每個問題後面留出「公司答案」欄,會後歸檔,就是你們第一版 AI 資料使用規範的雛形。
| # | 問題 | 該問誰 | 公司答案 |
|---|---|---|---|
| 1 | 我們有沒有正式的資料分級標準?AI 使用規則要不要掛進去? | 資安/法務 | __ |
| 2 | 哪些資料屬於受監管類別?適用的法規清單是什麼? | 法務 | __ |
| 3 | 公司核準的 AI 工具清單有哪些?各自核準到哪個資料等級? | IT/資安 | __ |
| 4 | 現有 AI 供應商的條款中,訓練使用與資料保留怎麼約定? | 法務/採購 | __ |
| 5 | 員工目前實際在用哪些未核準的 AI 工具處理公司資料? | IT(網路與帳號稽核) | __ |
| 6 | 發生資料誤上傳事件時的通報與處置流程是什麼? | 資安 | __ |
| 7 | 客戶合約中的保密條款,對使用第三方 AI 處理客戶資料有無限制? | 法務/業務 | __ |
| 8 | 若採本地部署,硬體預算、維運人力、模型來源審查由誰負責? | IT | __ |
| 9 | 跨境傳輸的限制如何影響工具選擇(含供應商子公司與伺服器位置)? | 法務 | __ |
| 10 | AI 使用規範要不要納入新人到職訓練與定期宣導? | HR/資安 | __ |
常見誤區
誤區一:「刪除對話就等於資料收回來了。」 你刪除的是自己介面上的紀錄;資料在供應商端經過了哪些系統、保留了多久,由條款決定,不由你的刪除鍵決定。紅線內容的正確處置是「一開始就不輸入」,以及輸入過憑證就立即撤換憑證。
誤區二:「大公司的產品就是安全的。」 安全與否取決於你用的方案與條款等級,不是品牌大小。同一家的免費版與企業版,資料待遇可能完全不同。
誤區三:「內部用就沒風險。」 內部使用的風險不在對外發佈,而在資料經過外部伺服器這件事本身。內部資料一樣要按分級走規則。
誤區四:「本地部署之後就不用管了。」 本地部署把風險從「資料出網」換成了「內部管控與維運」。權限、來源審查、能力更新,一樣都不能少。
誤區五:「規範寫好就等於執行到位。」 沒有配套的核準工具清單與稽核,規範只是紙面作業。讓「合規的路」比「違規的路」更好走——把核準的工具做得方便,員工才不會繞道。
下一步
- 把資料分級的答案帶回選型:選 AI 工具的判斷框架的第一題就是它。
- 分級之後哪些場景直接出局:什麼時候不該用 AI的場景三。
- 要開法務與供應商審查的完整檢查表:AI 合規與風險邊界。
- 準備好安全邊界後動手實作:不寫程式做出你的第一個 AI 工作流。