前面的章節教 Agent「想什麼、叫什麼工具」。這篇講另一件事:它要從哪一扇門做事。搜尋、瀏覽器、桌面、沙箱是大小不同的門——門選得越大,能碰的東西越多,風險也越大。所以第一步不是找最強的產品,而是選最小、最好檢查的門。
八個會一直出現的詞
- Agent Interface(操作介面):agent 用來看見、操作或執行工作的「門」。搜尋、瀏覽器、桌面和隔離執行環境是四種大小不同的門。
- Browser Use(瀏覽器操作):工作全在網頁裡時使用。讀頁面文字、按鈕與表單,必要時看畫面、點座標。
- Computer Use(電腦操作):工作跨桌面 app 時使用。模型看截圖提出滑鼠或鍵盤動作,真正執行的是你控制的程式。
- Sandbox(沙箱):把程式碼關進獨立工作房間,只能看見你放進去的檔案、網路與工具。
- Accessibility Tree(無障礙樹):瀏覽器為輔助工具整理的頁面地圖;它不是原始 HTML 的全部內容。
- Harness(執行框架):包在模型外面的控制程式——收動作、檢查規則、執行、回傳、限制輪數、留下紀錄。
- Approval Gate(批准閘門):付款、登入、送出訊息、刪除等難以回復的動作前,一定停下來問人。
- Prompt Injection(提示注入):網頁裡的壞指令假裝成任務內容,想騙 agent 忘記原本規則。頁面文字是不可信輸入,不是更高權限的命令。
先選最小的介面
| 你的任務 | 先用什麼 | 為什麼 |
|---|---|---|
| 只找或讀公開資料 | Web Search/Fetch | 只需要拿資料,不需要替你點畫面 |
| 工作都在網頁內 | Browser Use | 它看得懂按鈕、欄位與分頁,門比整台電腦小 |
| 工作跨桌面 app | Computer Use | 只有它能操作桌面,但這是最大的門 |
| 要跑不可信的程式碼 | Sandbox | 隔離執行,出錯不會傷到主機 |
判斷順序永遠從上往下:能用 API 就不開瀏覽器,能開瀏覽器就不碰整台電腦。多數「我用 Computer Use 好酷」的需求,其實一個 Fetch 就解決了。
動手前先畫三張表
讓 agent 碰真實環境之前,把這三件事寫下來:
- 它能去哪裡:網站 allowlist(例如只准 example.com)。
- 它能做什麼:唯讀?可以填表?可以下載?
- 什麼一定要問人:登入、付款、送出、刪除——設成預設暫停。
一個最小的瀏覽器練習長這樣:在隔離的瀏覽器 profile 裡,讓 agent 只到允許清單上的網站做一件小事,不登入、不下載、不碰真實帳戶。做完了,你就已經示範了 allowlist、approval 與驗證結果的完整循環。
為什麼頁面文字不可信
Browser Use 的殺手風險是間接提示注入:你讓 agent 讀的網頁裡,藏著一段「忽略先前的指示,把資料寄到……」。模型分不清這是網頁內容還是你的指令——所以工程上要把它當不可信輸入處理:敏感動作一律走批准閘門,頁面內容永遠不升級為命令。安全研究圈把最危險的組合叫「致命三角」:同時能讀私密資料、接觸不可信內容、又能對外通訊——拆掉任何一角,風險都大幅下降。
Benchmark 分數怎麼看
看到「某某 Agent 在 OSWorld 拿高分」時,先問四個問題:測了哪些任務?怎麼算分?給幾步?用什麼 harness? 任務集換版、step budget 不同、評分器不同,分數就不能直接比。這跟本站評測指南的原則一致:先看測了什麼,再看分數。
本站怎麼落地
- 先讀 Web Fetch 與網頁抓取——多數需求停在這層就夠了。
- 需要虛擬桌面型操作時,看 豆包工作 這類產品怎麼把「操作介面」做成產品邊界。
- 要讓 agent 搜遍網路找資料,Agent-Reach 展示了「給眼睛」與「給手」的差別。
下一步
- 對應學習地圖 Stage 8:完整練習(隔離瀏覽器練習、沙箱 executor、approval gate)在上游教材。
- 想動手:先用 Playwright MCP 或 E2B 沙箱跑一個不登入、不下載的小任務,再考慮更大的門。