Agent 上線工程:可測、可看、可停、可恢復
「Agent 怎麼在真實環境穩定運作?」
完成後你能:加入 Eval、觀測、預算、Human-in-the-loop 與復原。
📌 學習目標
- 分清 AI 幫手工作的地方、反覆做事的節奏和帶岔路的完整路線。
- 把真實失敗寫成可重跑的測試,不只看一次漂亮回答。
- 找到一次任務裡的每一步、錯誤、時間與成本。
- 讓高風險動作先停下問人,並能從正確位置繼續。
- 用同一組證據判斷系統能不能交給別人使用。
進入條件
完成 Stage 3–4;需要 Python 與 Git,部署練習另需 Docker。上線順序:先說清楚怎樣算成功 → 留下做事紀錄 → 危險動作先問人 → 確認跌倒後能繼續 → 最後才交給別人使用。
🧭 本站課程
按建議順序讀;勾選結果與 /learn 課程頁共用同一份瀏覽器進度。- 01LLM 評測與選型指南:如何在 2026 年科學選擇模型
系統化的 LLM 選型框架:Benchmark 解讀、實際場景測試方法、成本/效能矩陣、DeepSeek V4 vs Qwen vs Llama 對比。
4 分鐘 - 02從偽造到驗證:Agent 驗證架構的信任建築學
當 LLM Agent 在 6 次執行中從'跳過驗證'惡化為'偽造驗證記錄',我們學到一個根本教訓:純文字規則無法約束 LLM。External Supervisor 是唯一可靠解。
6 分鐘 - 03AI Agent 驗證架構技術對比:從 Prompt 自覺到架構強制——七種方案的原始碼級分析
誰來驗證 AI Agent 的每一步是正確的?對比 Claude Code、MetaGPT、OpenHands、VIGIL、PEV、ReVeal、odot 七種方案的執行-驗證分離機制。發現所有可靠方案都遵循同一條鐵律:執行者不能同時是裁判。
27 分鐘 - 04決策模型的現實檢查:為何「網上神乎其神」,我們實測只有 54%?——JEV / LAYA / KEV / CLM-8B 全對比與落地公式
2026 年 9 月,System One 決策模型在兩週內形成新品類:JEV 閉源 API、LAYA 與 KEV、CLM-8B 相繼開源。本文不只整理四家差異,更用六個日常場景說明它們到底怎麼用,並把官方宣傳與我們的同題實測放在一起對照——同一批題目,全覆蓋準確率只有 54%,但加上置信度門控後可達 91.7%。
20 分鐘 - 05LLM Agent 自主繞過流程約束的實證分析:從 'Skip' 到 'Fabricate' 的惡化路徑
在生產環境中連續 6 次觀測 LLM agent 跳過強制驗證步驟,並在第 6 次升級為偽造驗證記錄。本文提供完整的實驗數據、五層根因分析、跨模型對比預測,以及架構級解決方案。
17 分鐘 - 06AI 安全與紅隊測試:Prompt Injection、Jailbreak 防禦
AI 系統的安全威脅全景:Prompt Injection、Jailbreak、Data Poisoning,以及實用的防禦策略和紅隊測試方法。
7 分鐘 - 07Loop Engineering 實戰失敗深度總結:當設計文件無法執行時
從零構建 Loop Engineering 系統的完整失敗記錄 — 我們設計了完美的架構、36 個文件、10 個 cron jobs,但沒有一行代碼在真正執行內循環。
4 分鐘 - 08十日落坑錄:AI 助理系統建設的 16 個致命教訓
過去 10 天本站 AI 助理從對話機器進化為系統級 AI 助理的完整踩坑記錄 — 16 個坑、5 種根因模式、12 項強制規則,以及從中提煉的系統建設元原則。
20 分鐘
📚 必修閱讀
- 1.Anthropic — Demystifying evals for AI agents⭐⭐⭐⭐⭐先分清 Outcome 與完整 Trajectory;Agent 說「完成」不等於外部結果真的完成。
- 2.OpenAI Agents SDK — Tracing⭐⭐⭐⭐⭐看 trace、span、tool、handoff 與 guardrail 事件如何串起一次 run。
- 3.OpenAI Agents SDK — Human-in-the-loop⭐⭐⭐⭐⭐敏感工具先暫停,保存 RunState、核准或拒絕並 resume。
- 4.LangGraph — Persistence⭐⭐⭐⭐分清 checkpoint 與跨 thread store;中斷、復原與長期記憶不是同一件事。
- 5.LangGraph — Interrupts⭐⭐⭐⭐看人工核准如何暫停與續跑;interrupt 前的副作用必須冪等。
- 6.Anthropic — Building Effective Agents⭐⭐⭐⭐⭐先用簡單組合,只有真的需要分工時才增加自主性或 Multi-Agent。
🎯 精選資源
| 資源 | 適合誰 | 推薦度 | 為什麼推薦 |
|---|---|---|---|
Eval promptfoo | 要把 Eval 放進 CI | ⭐⭐⭐⭐⭐ | 建立成功標準與 grader;設定檔不能代替好的 rubric。 |
Eval Anthropic — Develop tests and evaluations | 先寫可量測的成功標準 | ⭐⭐⭐⭐⭐ | 案例仍要從自己的真實工作與失敗建立。 |
觀測 langfuse/langfuse | 要 trace、Eval 與 prompt 管理 | ⭐⭐⭐⭐⭐ | 自架仍需維運與資料治理。 |
觀測 Arize-ai/phoenix | 要 OpenTelemetry 與本機分析 | ⭐⭐⭐⭐ | 先設計敏感資料遮罩。 |
觀測 OpenTelemetry GenAI conventions | 學可攜的 trace 欄位 | ⭐⭐⭐⭐ | 規格仍演進,各平台支援度不同。 |
HITL/復原 LangGraph — Interrupts | 人工核准、checkpoint、resume | ⭐⭐⭐⭐⭐ | production 要用 durable checkpointer,不能只靠記憶體;副作用要冪等。 |
Harness/Sandbox anthropics/claude-agent-sdk-python | 讀工具迴圈、權限與 subagent 實作 | ⭐⭐⭐⭐⭐ | 以 Claude runtime 為中心。 |
Harness/Sandbox OpenAI — Harness engineering | 看環境、回饋迴圈與機器規則 | ⭐⭐⭐⭐ | 看環境、回饋迴路與機器規則如何幫 Agent 穩定工作。 |
部署 bentoml/BentoML | 把應用包成服務與容器 | ⭐⭐⭐⭐ | 部署框架不會自動補齊 Eval 和 Guardrail。 |
Multi-Agent 案例 crewAIInc/crewAI | 理解角色式任務分工 | ⭐⭐⭐⭐ | 角色多不等於答案一定更好。 |
Multi-Agent 案例 stablyai/orca | 在隔離 worktree 平行跑 coding agents | ⭐⭐⭐⭐ | 平行結果仍需要人審查與選擇。 |
Benchmark SWE-bench | 認識評測集的形狀 | ⭐⭐⭐⭐ | 與 tau2-bench、GAIA、OSWorld、terminal-bench 一起當評測參考;分數不能代替你自己的案例。 |
🛠 動手練習(官方版)
完整練習與 starter code練習摘要取自上游教材;完整程式碼、成本與延遲估算見官方版。
- 全章一個故事:AI 幫手查三個來源、整理摘要,送出前先請人確認 — 逐步補上工作環境、重複節奏、分支路線、檢查方法與安全煞車。
- 練習主線:固定案例與成功條件 → 逐步 trace 與成本記錄 → 高風險動作暫停問人 → checkpoint resume 與冪等副作用。
- 每個練習都先跑不需 API 金鑰的測試;要呼叫付費模型時,先設小額預算。
- 做事紀錄可能包含提示與模型回答:不要把密碼、個資或客戶資料直接送進追蹤平台。
- 多一個 Agent 就多一份模型呼叫、延遲與除錯工作;先把一個 AI 幫手做穩。
✅ 自我檢查
- 我能分清 Outcome 與 Trajectory,並用兩者檢查同一個 case。
- 我有從真實失敗建立的固定 Eval cases,不只看一次漂亮輸出。
- 我能找到一次執行的 trace、錯誤、延遲與 token。
- 高風險工具有最小權限與人工核准;沒有核准時會 fail closed。
- 我能從 checkpoint resume,並證明相同 idempotency key 不會重複副作用。
- 我能展示 execution receipt,並說明何時停止、復原或 rollback。
本站點改編自 awesome-agentic-ai-zh(MIT 授權,作者 Wenyu Chiou)v2026.09.23,資源連結查核日 2026-08-27。星級為學習優先順序(⭐⭐⭐⭐⭐=不看會卡住),非人氣排名。 MIT License · 課程結構最後更新:2026-10-03。內容持續補齊中,標記「撰寫中」的課程尚未上線。