你把一個 AI Agent 裝在電腦上,然後它說「我來讀一下你的專案」。
這時候大多數人心裡會浮現兩個相反的念頭,而且兩個都錯:
- 「它是不是能看到我整台電腦?」—— 通常不能,但很多人以為能,於是不敢用。
- 「反正它只是個聊天機器人,能怎樣?」—— 於是給了它所有權限,然後它刪了不該刪的東西。
真實情況在兩者之間,而且可以被拆成四個獨立的問題分別確認。搞混這四個問題是大多數恐懼與大多數事故的共同來源。
四個問題,分開問
一、它能看到哪些檔案?
答案幾乎總是:只有它被啟動時所在的那個資料夾,以及那個資料夾底下的東西。
這叫工作目錄。你在終端機裡 cd 到某個專案資料夾、然後在那裡啟動工具,那個資料夾就是它的視野範圍。它不會自動看到你的桌面、你的下載資料夾、你的相簿、或另一個專案。
為什麼是這樣:這不是你設定的,是它啟動時繼承的。任何程式都是這樣 —— 你用圖示開啟一個編輯器,它預設也只看得到你給它的那個檔案。
怎麼確認:啟動之後直接問它「你現在的工作目錄是什麼」,或者看它列出的檔案是不是只有那個專案的內容。
但有三個例外要注意:
- 你明確給它的路徑。如果你把一個檔案拖進去、或貼了一個完整路徑叫它讀,它就能讀那個檔案 —— 即使在工作目錄之外。
- 有些工具預設範圍比較寬。桌面型或網頁型的工具可能要求「存取你的檔案」權限,那作業系統層級的授權,範圍比工作目錄大。安裝時看到這類要求要停下來想。
- 它執行的指令可能超出範圍。這是最重要的例外,見第三個問題。
二、它說的話會去哪裡?
這是最常被搞混的一個問題,因為它有兩個完全不同的答案,取決於你用的是雲端工具還是本機工具。
雲端工具(大多數):你輸入的內容會被送到該公司的伺服器去產生回應。這是它運作的方式,不是漏洞。
在這情況下要問的是:它會不會被拿去訓練模型?
- 這件事每個工具、甚至同一工具的不同方案都不一樣,而且會隨時間改變。
- 消費級免費方案與企業方案的條款通常不同。
- 不要相信任何一句概括的話(包括這篇文章)。唯一的辦法是去看那個工具的官方說明,找「data」「privacy」「training」相關的章節。
- 看到「我們不會用你的資料訓練模型」時要注意:這句話可能只適用於某個方案、可能有你必須手動開啟的設定、可能有例外(例如被標記為濫用的內容)。
本機工具(例如在你自己機器上跑開源模型):推理過程不出你的機器。但注意 —— 下載模型、更新、或某些功能仍可能需要聯網,那部分照樣會送出一些資訊。
一個實務判斷:如果你不願意把某段內容貼進一個公開的網路表單,就不要貼進雲端 AI 工具。這個類比不完美,但作為預設姿勢是安全的。
三、它能對你的電腦做什麼?
這是四個問題裡唯一可能造成不可逆損害的一個,也是權限設定真正在管的東西。
一個只能聊天的工具什麼都改不了。但現在多數 Agent 工具能執行指令與改檔案,因為那正是它們有用的原因。
三個機制,擋的東西不一樣:
權限模式(permission mode) —— 決定它做之前要不要問你。
- 最嚴:每個動作都問
- 中間:讀取不用問,寫入與執行要問
- 最寬:全部自動,不問
新手應該從最嚴開始,用到覺得煩了再放寬一格。這個「煩」是有資訊量的:它告訴你哪些動作是它在反覆做的,那些才是值得放寬的。一開始就開最寬,你永遠不會知道它做了什麼。
沙箱(sandbox) —— 決定它「能」做什麼,不管它想不想。
沙箱是作業系統或工具層面的限制:即使它決定要刪某個檔案,沙箱也可以讓那個動作失敗。這比權限模式可靠,因為權限模式靠它自己遵守,沙箱靠系統擋。
人工閘門(approval) —— 那個跳出來說「要執行這個指令,同意嗎」的東西。
關於閘門有三件事必須知道:
- 它擋能力,不擋意圖。它能限制「可以做什麼」,擋不住 Agent 被說服「想做什麼」。如果你的指令是「幫我把這個資料夾清乾淨」,它會請求同意去刪檔案 —— 而你會按同意,因為你叫它這麼做的。
- 批准疲勞是真的。第一百次跳出來的時候,你已經不看內容就按同意了。所以閘門要少而準,不是什麼都問。
- 請求必須讓你能判斷。一個好的請求會顯示完整指令與影響範圍;一個壞的只說「將執行一個命令」。如果你看不懂它要幹嘛,就按拒絕 —— 拒絕不會弄壞任何東西,你隨時可以再問一次。
四、它能不能上網、能不能花錢?
分開問,因為答案常常不同。
上網:多數工具預設可以(它要查資料、要下載套件)。這意味著你給它的任何秘密都可能被送出去 —— 不是因為它惡意,而是因為它可能把你檔案裡的 API key 當成需要處理的內容。
花錢:這是最需要警惕的一類。如果它有能力呼叫付費 API、下訂單、或啟動雲端資源,那些動作會產生真實費用,而且通常不可逆。
實務規則:如果你給它的環境裡有任何綁定付款方式的憑證,先想清楚它能不能用到。
一個具體的檢查清單
裝好一個新工具、第一次真正用它之前,花五分鐘確認這五件事:
- 工作目錄:啟動它之後,問它現在在哪個目錄、列出看到的檔案。確認那只有你預期的內容。
- 權限模式:找到設定,確認它現在是哪一檔。新手從最嚴開始。
- 第一個動作:叫它做一個無害且可驗證的小事,例如「列出這個資料夾的檔案並告訴我各有幾行」。看它是否有請求同意、請求裡顯示了什麼。
- 資料去向:去官方說明找 privacy/data 章節,看你的輸入會不會用於訓練。找不到就假設會。
- 付款憑證:確認環境裡有沒有它能用到的付費憑證。有就想清楚要不要留著。
不要跳過第三步。 看一次它實際怎麼請求權限,比讀十篇說明都有用 —— 你會知道那個對話框長什麼樣子、資訊夠不夠你判斷、以及你自己在什麼情況下會反射性地按同意。
三個常見的誤解
「它讀了我的檔案,所以要小心。」
讀取本身通常不是風險來源 —— 它需要讀才能幫你的忙。風險在於讀到的東西被送到哪裡(第二個問題)與它接著能做什麼(第三個問題)。把「能讀」直接當成危險,會讓你無法使用工具;把「能讀」當成無害,則會讓你漏掉真正該管的兩個問題。
「我按了同意,所以是我的責任。」
部分對。但一個設計不良的工具會讓同意變得毫無意義 —— 例如不告訴你它要執行什麼、或者每三分鐘問一次讓你進入機械式按同意的狀態。如果你發現自己在不看內容就按同意,那是工具設計的問題,該修的是權限設定,不是怪自己不小心。
「開源/本機就完全安全。」
本機推理確實解決了資料外送的問題。但:本機工具照樣能執行指令、照樣能改檔案、照樣能被提示注入影響。「本機」管的是第二個問題,不管第三個。
什麼時候該真的擔心
按風險排序,值得花時間防的是:
- 給了最寬權限、又在一個有你不想丟的東西的目錄裡跑 —— 最常見的實際事故來源
- 環境裡有生產環境的憑證(雲端、資料庫、付款)
- 讓它處理來路不明的內容(外部網頁、別人給的文件)—— 那是提示注入的入口,見 Prompt Injection(提示詞注入)
- 多人共用的機器上跑
反過來,在一個空資料夾裡用最嚴權限跑一個無害任務,風險接近於零。大多數初學者的第一個任務就屬於這一類 —— 這意味著你可以放心開始,同時把上面那四件事留到真正需要的時候再處理。
安全設定的正確姿勢不是「一開始就鎖到最緊然後放棄使用」,也不是「全部放開然後祈禱」,而是從最嚴開始、按實際需要一格一格放寬、每次放寬都知道自己為什麼放。
下一步
- Sandbox(沙箱) / Permission Gate(權限閘門) / Working Directory(工作目錄) —— 這三個機制的定義
- Prompt Injection(提示詞注入) —— 為什麼「讓它讀外部內容」是一個獨立的風險類別
- AI 安全與紅隊測試 —— 這篇的進階版,含攻擊面與防禦架構
- 企業資料安全基礎 —— 如果是要在公司環境裡用
- 裝完沒反應 —— 如果權限設定本身出了問題
- 第一個十分鐘 —— 上面的檢查清單在那裡有可照著做的版本