「我把公司文件貼給 ChatGPT,安全嗎?」
這個問題得不到有用的答案,因為它把三件不同的事混在一起了:有什麼東西離開了你的電腦、它到了那邊會怎樣、這樣做有沒有違反你該遵守的規定。
第一篇是技術事實,可以自己驗證。第二篇是別人的承諾,你驗證不了。第三篇不是技術問題,也不是本站能回答的。
這篇只處理第一篇,然後給三條不管第二篇的答案是什麼都成立的規則。
先講清楚邊界:本文不構成法律意見,不引用任何供應商的服務條款原文(那些條款會改版,而且各地版本不同),也不替任何一家公司斷言它拿你的資料做了什麼。要確認這些,去讀你要用的那個工具的官方隱私與條款頁面,以及問你公司的法務與 IT。
先分清兩件事:雲端工具與本地工具
這是整篇的地基,詞條在 本地 vs 雲端(自己跑還是呼叫 API)。
雲端工具:模型跑在別人的伺服器上。你打的字必須透過網路送到那邊,才能算出回答。這不是設計缺陷,這是它的運作方式 —— 沒有辦法「用雲端模型但不要把內容送過去」,那句話本身是矛盾的。
本地工具:模型跑在你自己的機器上。你的內容不需要出門。代表:Ollama、LM Studio。
代價要講清楚:本地方案不是「又免費又安全又強」。它的能力上限通常低於雲端最新的那幾個模型,而且吃你的記憶體與算力;下載模型本身要幾個 GB 的磁碟空間。它換到的是「內容不出門」這一件,不是全部。
詞條 本地 vs 雲端(自己跑還是呼叫 API) 也把另一個方向的誤解點出來了:「本地=免費」也是錯的,硬體、電力、你自己的維運時間都是成本。
用雲端工具時,實際離開你機器的四類東西
一、你打字輸入的內容。 包含你的問題、你貼上去的那段文字、以及你上傳的檔案內容。這一類最明顯。
二、Agent 自己去讀的檔案。 這一類最多人漏掉,也是新手最驚訝的一項。
如果你用的不是網頁聊天框,而是一個能動你電腦的 AI Agent(命令列工具、AI IDE 這類),它會為了回答你的問題去讀檔案 —— 讀你的程式碼、讀你的筆記、列你的資料夾。它讀到的內容,會成為它送給模型的上下文的一部分。
你沒有「貼」任何東西,但內容還是出去了。
這件事的正常邊界在哪、它到底能看到多少,有一整篇在講:AI Agent 到底看得到你電腦裡的什麼。短版是:一個設計正常的 Agent 看得到它被啟動的那個資料夾,看不到你整顆硬碟 —— 而它每次要做超出範圍的事,應該要問你。
三、錯誤訊息與診斷資訊。 你回報一個 bug、或工具自己送出崩潰報告時,附帶的內容可能包含路徑、環境變數名稱,有時甚至包含變數的值本身。這就是為什麼 怎麼讀一則錯誤訊息 裡有一條「貼出去之前先塗掉密鑰」。
四、使用紀錄。 哪個帳號、什麼時候、用了多少。這一類通常不含你的內容本身,但它能證明「某人在某時用了這個工具」。
「我們不用你的資料訓練模型」這句話
你會在幾乎每一家的官方頁面上看到這句話或它的變體。它值得認真對待,但也值得看清楚它的邊界。
它承諾的:你送去的內容不會被拿去改進那個模型。
它沒有承諾的(這幾項都跟「安全」有關,但都不在「不訓練」的範圍內):
- 資料不會被傳輸。 它一定會,那是雲端工具的運作方式。
- 資料不會被暫時存放。 多數服務會保留一段時間以維持對話、偵測濫用、或履行法律義務。保留多久,各家不同。
- 不會有人看到它。 多數供應商保留在特定情況下(例如濫用偵測、法律要求)檢視內容的權利。這條幾乎都在條款裡,而且很少人讀到。
- 資料外洩時它會消失。 如果那家公司的系統出事,你送過去的東西就在範圍內。
- 這個承諾適用於你正在用的這個方案。 這是最容易被漏掉的一項:同一家的「個人免費版」「個人付費版」「企業版」常常有不同的資料處理條件。你在網路上讀到的「它不用你的資料訓練」,可能只對其中一個方案成立。
還有一個更根本的問題:這是一個你無法驗證的承諾。
你可以驗證「有沒有東西離開你的電腦」(關掉網路再試一次就知道了)。你無法驗證「它到了那邊之後被怎麼用」。
所以正確的做法不是去猜哪一家的承諾比較可信,而是從源頭控制什麼東西會被送出去。這就是下面那三條規則。
三條規則
規則一:不要貼秘密
「秘密」指的是:洩漏之後,你能做的只有善後,沒有挽回。
具體包括:
- API key、密碼、私鑰(見 Private Key(私密金鑰))、憑證
- 資料庫連線字串、內部服務的網址與埠
- 未公開的財務數字、未公開的產品計畫
- 任何「一旦出現在公開網頁上就會造成損失」的文字
這條規則有一個很好用的判斷式,比背清單可靠:
如果這段文字明天出現在一個公開的網頁上,我會不會有事?
會 → 不要貼。不會 → 可以貼。
注意「秘密」不只看內容,也看組合。單獨一個數字無害,加上公司名與日期可能就是一則新聞。
規則二:不要貼別人的個人資料
這一條跟第一條的性質不同,值得單獨講。
別人的個資不是你的東西,你沒有權利把它交給一家第三方公司。 這跟它安不安全無關 —— 即使那家公司完全可信,這個動作本身也可能已經越線。
什麼算個資,比多數人以為的寬。詞條 PII(個人識別資料) 講得很準:能單獨或組合起來認出特定特定個人的都算。姓名、身分證字號、電話、住址、病歷、精確位置是明顯的;而「某公司+某職位+某城市」三個單獨無害的欄位放在一起,常常就指向唯一一個人。
實務上最常出事的是這幾種檔案:客戶名單、履歷、員工資料、含個資的對話記錄、從某個系統匯出來的一整張表。
如果你手上是這種檔案,而你又真的需要 AI 處理它,兩條路:
- 先去識別化(見 De-identification(去識別化)):姓名換成代號、公司換成「甲公司」、身分證字號與電話整欄刪掉、金額換成比例。注意詞條 PII(個人識別資料) 的提醒:人眼抓不住批次資料裡的個資,一份兩千行的表格你「看過一眼」不算處理過。
- 用本地工具(規則三)。
規則三:敏感檔案用本地工具
這是最乾淨的一條:內容不出門,前面兩條的風險就都不存在。
什麼時候值得付這個代價(能力較弱、速度較慢、要佔磁碟與記憶體):
- 檔案裡有別人的個資,而且去識別化會破壞你要做的事
- 內容是公司機密,而你還沒拿到明確許可
- 內容受法規約束(醫療、金融帳戶、受出口管制的技術資料)
- 你在一個不能連外網的環境裡工作
怎麼開始:圖形介面走 LM Studio,命令列走 Ollama。
一條重要的提醒:本地模型解決的是「內容不出門」,它不解決 Agent 在你電腦上亂動檔案的問題。那是沙箱與權限閘門的工作,跟模型跑在哪裡無關。兩件事要分開處理。
步驟
把一份檔案交給任何 AI 工具之前,走這五步。前三步決定「該不該給、給哪一個工具」,後兩步是送出之前的最後檢查。
步驟一:先回答那個判斷式
「如果這份檔案的內容明天出現在公開網頁上,我會不會有事?」
不會 → 直接跳到步驟四。會 → 往下走。
步驟二:確認你有沒有權利把它交出去
如果這份檔案不是你自己的(公司的、客戶的、別人的),答案不由你決定。去問主管或 IT。
公司場景有一份可以直接拿去開會的問題清單:企業資料安全基本盤。它的核心是一套四分法(公開/內部/機密/受監管),每一級對應一組明確的規則 —— 有分級,第一線的人才判得動。
步驟三:選路:去識別化,或改本地
- 去識別化之後任務還做得成 → 去識別化,然後用雲端工具(能力較強)
- 去識別化會破壞任務(例如你要它分析的就是姓名與地址的對應關係)→ 改本地工具
不要選第三條路:「我就貼一次,應該沒事。」 這條路的問題不在單次風險,在於它是一個你不會記得做過幾次的動作。
步驟四:貼之前,最後掃一眼
三個地方最容易漏:
- 檔案頂部與底部:信頭、簽名檔、內部編號、浮水印
- 附加的 metadata:文件的作者欄、修訂紀錄、Excel 的隱藏欄位與註解
- 你自己剛剛補上去的那句話:很多人會在貼上的內容前面加一句「這是我們公司某某專案的資料」—— 這句話本身就把上下文補齊了
步驟五:記住你貼過什麼
如果你之後要評估風險(例如那家公司出了資料外洩事件,或你公司開始做工具盤點),你需要知道你送出去過什麼。
這就是稽核記錄在個人層面的版本。做法很土但有效:給每個 AI 工具開一個筆記檔,記下日期、送出去的檔案、用途。 不需要記內容,記「送了什麼檔案」就夠。
三個常見誤解
一、「我用的是付費版,所以比較安全。」 付費通常買到的是能力、額度與支援。資料處理條件是否不同,要看那一家的方案說明 —— 有些家的企業方案確實有不一樣的條件,有些沒有,而且這件事會改版。不要從「我付了錢」推論任何資料處理上的結論。
二、「我刪掉那則對話,資料就沒了。」 你刪掉的是你這一側的顯示。你無法用它推論對方那一側的保留狀態。
三、「本地工具就完全安全。」 本地解決的是內容出門這件事。它不解決:Agent 動到你的檔案、你在本地工具裡也一樣可能貼進別人的個資、以及你的機器本身有沒有被保護。換工具不能取代判斷。
下一步
- Agent 到底能看到多少:AI Agent 到底看得到你電腦裡的什麼
- 本地方案怎麼開始:Ollama、LM Studio
- 公司場景的完整框架:企業資料安全基本盤、AI 合規與風險邊界
- 密鑰這一類「貼出去就收不回」的東西:API Key 是什麼
- 詞條:PII(個人識別資料)、Data Classification(資料分級)、De-identification(去識別化)、本地 vs 雲端(自己跑還是呼叫 API)、Audit Log(稽核日誌)、Sandbox(沙箱)