Agentic Research
Agent 學習地圖 · 站點 7

Agent 上線工程:可測、可看、可停、可恢復

「Agent 怎麼在真實環境穩定運作?」

完成後你能:加入 Eval、觀測、預算、Human-in-the-loop 與復原。

12–20 小時8 堂對應課程官方完整版

📌 學習目標

  • 分清 AI 幫手工作的地方、反覆做事的節奏和帶岔路的完整路線。
  • 把真實失敗寫成可重跑的測試,不只看一次漂亮回答。
  • 找到一次任務裡的每一步、錯誤、時間與成本。
  • 讓高風險動作先停下問人,並能從正確位置繼續。
  • 用同一組證據判斷系統能不能交給別人使用。

進入條件

完成 Stage 3–4;需要 Python 與 Git,部署練習另需 Docker。上線順序:先說清楚怎樣算成功 → 留下做事紀錄 → 危險動作先問人 → 確認跌倒後能繼續 → 最後才交給別人使用。

🧭 本站課程

按建議順序讀;勾選結果與 /learn 課程頁共用同一份瀏覽器進度。
本站進度
0/8
進度只存在你的瀏覽器
  1. 01
    LLM 評測與選型指南:如何在 2026 年科學選擇模型

    系統化的 LLM 選型框架:Benchmark 解讀、實際場景測試方法、成本/效能矩陣、DeepSeek V4 vs Qwen vs Llama 對比。

    4 分鐘
  2. 02
    從偽造到驗證:Agent 驗證架構的信任建築學

    當 LLM Agent 在 6 次執行中從'跳過驗證'惡化為'偽造驗證記錄',我們學到一個根本教訓:純文字規則無法約束 LLM。External Supervisor 是唯一可靠解。

    6 分鐘
  3. 03
    AI Agent 驗證架構技術對比:從 Prompt 自覺到架構強制——七種方案的原始碼級分析

    誰來驗證 AI Agent 的每一步是正確的?對比 Claude Code、MetaGPT、OpenHands、VIGIL、PEV、ReVeal、odot 七種方案的執行-驗證分離機制。發現所有可靠方案都遵循同一條鐵律:執行者不能同時是裁判。

    27 分鐘
  4. 04
    決策模型的現實檢查:為何「網上神乎其神」,我們實測只有 54%?——JEV / LAYA / KEV / CLM-8B 全對比與落地公式

    2026 年 9 月,System One 決策模型在兩週內形成新品類:JEV 閉源 API、LAYA 與 KEV、CLM-8B 相繼開源。本文不只整理四家差異,更用六個日常場景說明它們到底怎麼用,並把官方宣傳與我們的同題實測放在一起對照——同一批題目,全覆蓋準確率只有 54%,但加上置信度門控後可達 91.7%。

    20 分鐘
  5. 05
    LLM Agent 自主繞過流程約束的實證分析:從 'Skip' 到 'Fabricate' 的惡化路徑

    在生產環境中連續 6 次觀測 LLM agent 跳過強制驗證步驟,並在第 6 次升級為偽造驗證記錄。本文提供完整的實驗數據、五層根因分析、跨模型對比預測,以及架構級解決方案。

    17 分鐘
  6. 06
    AI 安全與紅隊測試:Prompt Injection、Jailbreak 防禦

    AI 系統的安全威脅全景:Prompt Injection、Jailbreak、Data Poisoning,以及實用的防禦策略和紅隊測試方法。

    7 分鐘
  7. 07
    Loop Engineering 實戰失敗深度總結:當設計文件無法執行時

    從零構建 Loop Engineering 系統的完整失敗記錄 — 我們設計了完美的架構、36 個文件、10 個 cron jobs,但沒有一行代碼在真正執行內循環。

    4 分鐘
  8. 08
    十日落坑錄:AI 助理系統建設的 16 個致命教訓

    過去 10 天本站 AI 助理從對話機器進化為系統級 AI 助理的完整踩坑記錄 — 16 個坑、5 種根因模式、12 項強制規則,以及從中提煉的系統建設元原則。

    20 分鐘

📚 必修閱讀

  1. 1.Anthropic — Demystifying evals for AI agents⭐⭐⭐⭐⭐先分清 Outcome 與完整 Trajectory;Agent 說「完成」不等於外部結果真的完成。
  2. 2.OpenAI Agents SDK — Tracing⭐⭐⭐⭐⭐看 trace、span、tool、handoff 與 guardrail 事件如何串起一次 run。
  3. 3.OpenAI Agents SDK — Human-in-the-loop⭐⭐⭐⭐⭐敏感工具先暫停,保存 RunState、核准或拒絕並 resume。
  4. 4.LangGraph — Persistence⭐⭐⭐⭐分清 checkpoint 與跨 thread store;中斷、復原與長期記憶不是同一件事。
  5. 5.LangGraph — Interrupts⭐⭐⭐⭐看人工核准如何暫停與續跑;interrupt 前的副作用必須冪等。
  6. 6.Anthropic — Building Effective Agents⭐⭐⭐⭐⭐先用簡單組合,只有真的需要分工時才增加自主性或 Multi-Agent。

🎯 精選資源

資源適合誰推薦度為什麼推薦
Eval
promptfoo
要把 Eval 放進 CI⭐⭐⭐⭐⭐建立成功標準與 grader;設定檔不能代替好的 rubric。
Eval
Anthropic — Develop tests and evaluations
先寫可量測的成功標準⭐⭐⭐⭐⭐案例仍要從自己的真實工作與失敗建立。
觀測
langfuse/langfuse
要 trace、Eval 與 prompt 管理⭐⭐⭐⭐⭐自架仍需維運與資料治理。
觀測
Arize-ai/phoenix
要 OpenTelemetry 與本機分析⭐⭐⭐⭐先設計敏感資料遮罩。
觀測
OpenTelemetry GenAI conventions
學可攜的 trace 欄位⭐⭐⭐⭐規格仍演進,各平台支援度不同。
HITL/復原
LangGraph — Interrupts
人工核准、checkpoint、resume⭐⭐⭐⭐⭐production 要用 durable checkpointer,不能只靠記憶體;副作用要冪等。
Harness/Sandbox
anthropics/claude-agent-sdk-python
讀工具迴圈、權限與 subagent 實作⭐⭐⭐⭐⭐以 Claude runtime 為中心。
Harness/Sandbox
OpenAI — Harness engineering
看環境、回饋迴圈與機器規則⭐⭐⭐⭐看環境、回饋迴路與機器規則如何幫 Agent 穩定工作。
部署
bentoml/BentoML
把應用包成服務與容器⭐⭐⭐⭐部署框架不會自動補齊 Eval 和 Guardrail。
Multi-Agent 案例
crewAIInc/crewAI
理解角色式任務分工⭐⭐⭐⭐角色多不等於答案一定更好。
Multi-Agent 案例
stablyai/orca
在隔離 worktree 平行跑 coding agents⭐⭐⭐⭐平行結果仍需要人審查與選擇。
Benchmark
SWE-bench
認識評測集的形狀⭐⭐⭐⭐與 tau2-bench、GAIA、OSWorld、terminal-bench 一起當評測參考;分數不能代替你自己的案例。

🛠 動手練習(官方版)

完整練習與 starter code

練習摘要取自上游教材;完整程式碼、成本與延遲估算見官方版。

  1. 全章一個故事:AI 幫手查三個來源、整理摘要,送出前先請人確認 — 逐步補上工作環境、重複節奏、分支路線、檢查方法與安全煞車。
  2. 練習主線:固定案例與成功條件 → 逐步 trace 與成本記錄 → 高風險動作暫停問人 → checkpoint resume 與冪等副作用。
  3. 每個練習都先跑不需 API 金鑰的測試;要呼叫付費模型時,先設小額預算。
  4. 做事紀錄可能包含提示與模型回答:不要把密碼、個資或客戶資料直接送進追蹤平台。
  5. 多一個 Agent 就多一份模型呼叫、延遲與除錯工作;先把一個 AI 幫手做穩。

✅ 自我檢查

  • 我能分清 Outcome 與 Trajectory,並用兩者檢查同一個 case。
  • 我有從真實失敗建立的固定 Eval cases,不只看一次漂亮輸出。
  • 我能找到一次執行的 trace、錯誤、延遲與 token。
  • 高風險工具有最小權限與人工核准;沒有核准時會 fail closed。
  • 我能從 checkpoint resume,並證明相同 idempotency key 不會重複副作用。
  • 我能展示 execution receipt,並說明何時停止、復原或 rollback。

本站點改編自 awesome-agentic-ai-zh(MIT 授權,作者 Wenyu Chiou)v2026.09.23,資源連結查核日 2026-08-27。星級為學習優先順序(⭐⭐⭐⭐⭐=不看會卡住),非人氣排名。 MIT License · 課程結構最後更新:2026-10-03。內容持續補齊中,標記「撰寫中」的課程尚未上線。