Agent 操作介面
「Agent 怎麼操作 API 以外的真實環境?」
完成後你能:選擇 Computer Use、Browser Use 或 Code Sandbox。
📌 學習目標
- 看一個任務,就知道該用搜尋、網頁操作、整台電腦操作,還是隔離執行。
- 用自己的話解釋八個會一直出現的核心詞。
- 在 agent 動手前,先畫出它能去的網站、能做的動作與一定要問人的地方。
- 完成一個不登入、不下載、不碰真實帳戶的小練習。
- 看 benchmark 時先問「測了什麼、怎麼算、給幾步」,不只看一個分數。
進入條件
懂 Stage 3 的「模型提出工具呼叫 → 程式執行 → 結果回給模型」就能開始;Track A 可以只做第一題,Track B 再做第二題。門選得越大,能碰的東西越多,風險也越大 — 第一步是選最小、最好檢查的門。
🧭 本站課程
按建議順序讀;勾選結果與 /learn 課程頁共用同一份瀏覽器進度。- 01Agent 操作介面:CLI、API、Browser Use、Computer Use、Sandbox 怎麼選
Agent 要從哪一扇門做事?這篇改編自 MIT 授權教材的 Stage 8 概念篇:八個核心詞、一張「先選最小介面」的判斷表、動手前要畫的三張表(allowlist、動作、批准閘門),以及看 Browser/Computer Use benchmark 分數時必問的四個問題。門選得越大,風險越大——第一原則是選最小、最好檢查的那扇。
5 分鐘 - 02
- 03Agent-Reach — 給 AI Agent 一雙看遍互聯網的眼睛
GitHub Trending #7 · 5.2K ⭐/週 · 讓 AI Agent 搜索並閱讀 Twitter/Reddit/YouTube/B站/小紅書等 10+ 平台內容,無需 API 費用,純網頁抓取
5 分鐘 - 04豆包工作是什麼:會操作虛擬桌面、深度接飛書的辦公 Agent
豆包工作(Doubao Work)是位元組跳動的 AI 辦公 Agent:桌面用戶端加手機遠端派任務,Agent 在虛擬桌面裡實際操作而不是只回文字,深度整合飛書的企業知識(會議紀要、群聊、文檔),有快速、專家、任務三種模式。附計費模式與適用人群。
7 分鐘
📚 必修閱讀
- 1.Anthropic — Computer Use tool⭐⭐⭐⭐⭐看懂「模型提出動作,應用程式執行」。
- 2.Anthropic — Browser Use tool⭐⭐⭐⭐⭐看網頁元素與像素回退怎麼合作。
- 3.OpenAI — Computer Use guide⭐⭐⭐⭐看 GA tool 與安全邊界。
🎯 精選資源
| 資源 | 適合誰 | 推薦度 | 為什麼推薦 |
|---|---|---|---|
官方文件 OpenAI Agents SDK — Sandbox guide | 要做可變工作區 | ⭐⭐⭐⭐ | Sandbox Agents 仍是 Beta;舊 preview shape 已 deprecated。 |
瀏覽器操作 microsoft/playwright-mcp | 要可控的瀏覽器自動化 | ⭐⭐⭐⭐⭐ | 先看 container、credential 與 framework;仍需限制 origin、權限與資料。 |
瀏覽器操作 browser-use/browser-use | 要現成的框架 | ⭐⭐⭐⭐⭐ | 依 README 與 release 驗證實際 stack。 |
電腦操作 bytedance/UI-TARS-desktop | 要桌面 GUI agent | ⭐⭐⭐⭐ | 看截圖驅動的桌面操作怎麼做隔離與觀測。 |
電腦操作 trycua/cua | 要 macOS/Linux 虛擬機路線 | ⭐⭐⭐⭐ | 在 VM 裡跑 computer use,降低碰壞主機的風險。 |
沙箱 e2b-dev/E2B | 要程式碼執行沙箱 | ⭐⭐⭐⭐⭐ | 獨立工作房間:只能看見你放進去的檔案、網路與工具。 |
沙箱 Modal — Sandboxes | 要受管的隔離執行 | ⭐⭐⭐⭐⭐ | 雲端 microVM 沙箱,出錯時比較不會傷到主機。 |
沙箱 Vercel Sandbox | agent 需要遠端 code runtime | ⭐⭐⭐⭐ | 快速起一個隔離的可拋棄執行環境。 |
GUI 解析 microsoft/OmniParser | 要做截圖→可操作元素 | ⭐⭐⭐⭐ | weights 授權要逐版本讀:v3 採 MIT 的 YOLOv9 實作,較早的 Ultralytics detectors 保留 AGPL。 |
Benchmark xlang-ai/OSWorld | 要評真實電腦環境任務 | ⭐⭐⭐⭐⭐ | 看分數時一起找任務集、metric、step budget 與 harness;2.0 與舊版任務集不能直接比百分比。 |
Benchmark web-arena-x/webarena | 評 self-hosted web tasks | ⭐⭐⭐⭐ | 環境 setup 與 evaluator 會影響結果。 |
安全研究 Brave — Indirect prompt injection | 要建立 browser-agent threat model | ⭐⭐⭐⭐ | 研究示範不是每個產品的現況證明;與 Perplexity BrowseSafe 一起看供應商回應與防禦方向。 |
🛠 動手練習(官方版)
完整練習與 starter code練習摘要取自上游教材;完整程式碼、成本與延遲估算見官方版。
- 練習 1:最小瀏覽器練習 — 在隔離的瀏覽器 profile 裡,讓 agent 只到 example.com 這類允許清單網站做一件小事(不登入、不下載)。
- 練習 2:沙箱執行 — 用 Python 3.10+ 在不連網、不需要 API key 的環境,實作最小 executor 與 approval gate。
- 動手前先畫三張表:能去的網站(allowlist)、能做的動作、一定要問人的地方(approval gate)。
- 頁面文字要當成不可信輸入(prompt injection 防線),不是更高權限的命令。
✅ 自我檢查
- 我能先選最小介面,不會把每題都丟給 Computer Use。
- 我能解釋八個核心詞,也知道 Browser Use 不只看 DOM。
- 我會先隔離、列 allowlist、設 approval,再驗證結果與 log。
- 我完成了 example.com 練習,agent 沒有離開允許範圍。
- 我看 OSWorld 分數時,會一起找任務、metric、step budget 與 harness。
本站點改編自 awesome-agentic-ai-zh(MIT 授權,作者 Wenyu Chiou)v2026.09.23,資源連結查核日 2026-08-27。星級為學習優先順序(⭐⭐⭐⭐⭐=不看會卡住),非人氣排名。 MIT License · 課程結構最後更新:2026-10-03。內容持續補齊中,標記「撰寫中」的課程尚未上線。