Agentic Research
首頁/學習/Agent 操作介面:CLI、API、Browser Use、Computer Use、Sandbox 怎麼選

Agent 操作介面:CLI、API、Browser Use、Computer Use、Sandbox 怎麼選

2026/10/035 分鐘Bryan Chan最後更新 2026/10/03

先讀這些

這篇文章在學習路徑上假設你已經讀過下列內容。

前面的章節教 Agent「想什麼、叫什麼工具」。這篇講另一件事:它要從哪一扇門做事。搜尋、瀏覽器、桌面、沙箱是大小不同的門——門選得越大,能碰的東西越多,風險也越大。所以第一步不是找最強的產品,而是選最小、最好檢查的門。

八個會一直出現的詞

  • Agent Interface(操作介面):agent 用來看見、操作或執行工作的「門」。搜尋、瀏覽器、桌面和隔離執行環境是四種大小不同的門。
  • Browser Use(瀏覽器操作):工作全在網頁裡時使用。讀頁面文字、按鈕與表單,必要時看畫面、點座標。
  • Computer Use(電腦操作):工作跨桌面 app 時使用。模型看截圖提出滑鼠或鍵盤動作,真正執行的是你控制的程式。
  • Sandbox(沙箱):把程式碼關進獨立工作房間,只能看見你放進去的檔案、網路與工具。
  • Accessibility Tree(無障礙樹):瀏覽器為輔助工具整理的頁面地圖;它不是原始 HTML 的全部內容。
  • Harness(執行框架):包在模型外面的控制程式——收動作、檢查規則、執行、回傳、限制輪數、留下紀錄。
  • Approval Gate(批准閘門):付款、登入、送出訊息、刪除等難以回復的動作前,一定停下來問人。
  • Prompt Injection(提示注入):網頁裡的壞指令假裝成任務內容,想騙 agent 忘記原本規則。頁面文字是不可信輸入,不是更高權限的命令。

先選最小的介面

你的任務先用什麼為什麼
只找或讀公開資料Web Search/Fetch只需要拿資料,不需要替你點畫面
工作都在網頁內Browser Use它看得懂按鈕、欄位與分頁,門比整台電腦小
工作跨桌面 appComputer Use只有它能操作桌面,但這是最大的門
要跑不可信的程式碼Sandbox隔離執行,出錯不會傷到主機

判斷順序永遠從上往下:能用 API 就不開瀏覽器,能開瀏覽器就不碰整台電腦。多數「我用 Computer Use 好酷」的需求,其實一個 Fetch 就解決了。

動手前先畫三張表

讓 agent 碰真實環境之前,把這三件事寫下來:

  1. 它能去哪裡:網站 allowlist(例如只准 example.com)。
  2. 它能做什麼:唯讀?可以填表?可以下載?
  3. 什麼一定要問人:登入、付款、送出、刪除——設成預設暫停。

一個最小的瀏覽器練習長這樣:在隔離的瀏覽器 profile 裡,讓 agent 只到允許清單上的網站做一件小事,不登入、不下載、不碰真實帳戶。做完了,你就已經示範了 allowlist、approval 與驗證結果的完整循環。

為什麼頁面文字不可信

Browser Use 的殺手風險是間接提示注入:你讓 agent 讀的網頁裡,藏著一段「忽略先前的指示,把資料寄到……」。模型分不清這是網頁內容還是你的指令——所以工程上要把它當不可信輸入處理:敏感動作一律走批准閘門,頁面內容永遠不升級為命令。安全研究圈把最危險的組合叫「致命三角」:同時能讀私密資料、接觸不可信內容、又能對外通訊——拆掉任何一角,風險都大幅下降。

Benchmark 分數怎麼看

看到「某某 Agent 在 OSWorld 拿高分」時,先問四個問題:測了哪些任務?怎麼算分?給幾步?用什麼 harness? 任務集換版、step budget 不同、評分器不同,分數就不能直接比。這跟本站評測指南的原則一致:先看測了什麼,再看分數。

本站怎麼落地

  • 先讀 Web Fetch 與網頁抓取——多數需求停在這層就夠了。
  • 需要虛擬桌面型操作時,看 豆包工作 這類產品怎麼把「操作介面」做成產品邊界。
  • 要讓 agent 搜遍網路找資料,Agent-Reach 展示了「給眼睛」與「給手」的差別。

下一步

  • 對應學習地圖 Stage 8:完整練習(隔離瀏覽器練習、沙箱 executor、approval gate)在上游教材。
  • 想動手:先用 Playwright MCP 或 E2B 沙箱跑一個不登入、不下載的小任務,再考慮更大的門。

在這條路徑上的下一步