Agentic Research
Agent 學習地圖 · 站點 7.5

進階 Agentic 選擇

「還有哪些進階 Pattern 值得認得?」

完成後你能:從 12 個概念選讀 PAR loop、agent-as-judge 等需要的主題。

6–10 小時(選讀)7 堂對應課程官方完整版

📌 學習目標

  • 用白話說清楚四個進階概念,以及它們各自處理哪種失敗。
  • 從短選擇表挑出一個候選做法,不把所有模式一次裝上。
  • 用 baseline、同一組 Eval、成本與安全結果決定是否保留複雜度。
  • 對 Harness 元件做 Keep/Simplify/Remove 判斷,並保留回復方法。

進入條件

完成 Stage 7,已有一組能重跑的 Eval cases、停止條件與單一 Agent baseline。這一關不要求寫程式,也不要求購買 API。預設答案是「先不加」:先量 baseline,只有新做法在同一組 Eval 中帶來可重現改善才保留。

🧭 本站課程

按建議順序讀;勾選結果與 /learn 課程頁共用同一份瀏覽器進度。
本站進度
0/7
進度只存在你的瀏覽器
  1. 01
    事前驗屍——為什麼 AI Agent 需要在下手之前先想像自己失敗了

    Pre-mortem 事前驗屍方法論在 AI Agent 系統中的應用。探索 Agent Previsor 如何通過多情境發散式路徑預判,將「早知道就不要這樣做」的後悔從執行後提前到執行前——基於象棋算步、軍事推演、和四個預判維度的完整分析。

    19 分鐘
  2. 02
    三省六部 vs Loop Engineering:制度性流程強制的技術解剖

    對比兩個 GitHub 三省六部系統如何用 State Machine、Permission Matrix、Review Gate、4-layer Gateway 實現流程強制,以及對我們 Loop Engineering 系統重構的啟示。

    19 分鐘
  3. 03
    子代理隔離架構:AI 金融應用的可靠性教訓——從港股調研流水線數據污染事故到 Clean Context 設計模式的完整旅程

    在連續分析股票A與股票B時,股票A的物業基金持股(賬面值 HK$3.68億、減值 HK$1.54億,均為教學用假設值)被異常混入股票B的報告。股票B的業務是消費品貿易與放債,根本沒有這項基金。這不是幻覺——這是上下文污染的系統性問題。

    24 分鐘
  4. 04
    上下文壓縮的基建化:Headroom 如何將 Token 成本從戰術問題變為系統架構

    Headroom 25.8K⭐ · Agent 基礎設施新物種——不是省錢工具,而是讓長期運行的 AI Agent 在經濟上可行的基建層。6 層壓縮流水線 + CCR 可逆設計 + 16x 學術突破驗證路線正確。

    5 分鐘
  5. 05
    「不生成文字的模型」——Jev 與 System One 新品類:當 AI 只回答選擇題,Agent 架構會怎麼變?

    TypeSafe AI 以 $40M seed 走出 stealth,發布 Jev——一個不生成文字、只回答類型化問題(choice / score / noul)的 System One 模型。一次 forward pass 並行回答多條問題,回傳校準概率,延遲 ~100ms,定價 $0.042/MTok。

    28 分鐘
  6. 06
    200+ Skills、一個 Router:Agent 技能路由的工程學實戰

    安裝了 200+ 技能後,AI Agent 反而更笨了?類別×階段矩陣路由如何將技能發現率從 35% 提升至 90%,錯誤工具使用減少 80%,讓任何任務自動匹配正確技能組合。

    20 分鐘
  7. 07
    Skills Triggering 深度剖析:為什麼你的 AI Agent 有 200 個技能卻一個都用不上

    242 個技能的全面審計揭露:95% 開源技能 description 只有英文,非英語觸發成功率僅 20%。三層關鍵詞策略如何將技能發現率從 35% 提升至 90%——只改了一行字。

    23 分鐘

📚 必修閱讀

  1. 1.Anthropic — Building Effective Agents⭐⭐⭐⭐⭐先用最簡單的 workflow;只有能證明分工有價值時才增加 Agent。
  2. 2.Anthropic — Demystifying Evals for AI Agents⭐⭐⭐⭐⭐把失敗變成可重跑案例,再比較 Outcome、Trajectory、成本與穩定性。
  3. 3.OpenAI — Harness Engineering⭐⭐⭐⭐看真實 codebase 如何用清楚邊界、文件與機械 gate 幫 Agent 穩定工作;是案例,不是唯一架構。

🎯 精選資源

資源適合誰推薦度為什麼推薦
論文
Reflexion(arXiv 2303.11366)
想懂自我回饋的來源⭐⭐⭐⭐把失敗、回饋與下一次策略寫進可重用記錄的原始論文。
論文
Constitutional AI(arXiv 2212.08073)
研究 principle-based critique⭐⭐⭐⭐Principle-based critique 與 revision 的訓練方法;不能直接等同 Eval。
論文
More Agents Is All You Need(arXiv 2303.17760)
想驗證「多 Agent 一定更好」⭐⭐⭐特定 benchmark 實驗;不要外推精確幅度。
工程文章
Anthropic — Effective context engineering
Context 常爆掉的系統⭐⭐⭐⭐⭐官方對 context engineering 的系統性說法。
工程文章
Anthropic — Multi-agent research system
要做平行研究系統⭐⭐⭐⭐multi-agent 適合 breadth-first、可平行的研究;該系統約用一般 chat 的 15× tokens,不能套到所有任務。
工程文章
The Bitter Lesson(Rich Sutton)
想懂「搜尋與規模」的長期張力⭐⭐⭐⭐理解為什麼手工複雜度常輸給簡單方法+規模的歷史教訓。
評測
SWE-bench/SWE-bench
先從小而能重現的 failure set⭐⭐⭐⭐教可觀察行動,不要求公開私人 CoT;研究設定不等於每個 production loop。
評測
sierra-research/tau2-bench
要工具使用與政策遵循的評測⭐⭐⭐⭐工具呼叫+用戶互動的雙軌評測集。
中文/動手入口
datawhalechina/hello-agents
要中文完整 Agent 教材⭐⭐⭐⭐⭐中文完整 Agent 教材;篇幅長,按本章概念挑章節。
中文/動手入口
李宏毅生成式 AI 課程
要中文課程與研究背景⭐⭐⭐⭐⭐依年份挑主題;產品介面仍查官方 docs。
中文/動手入口
microsoft/ai-agents-for-beginners
要 18 課入門與多語教材⭐⭐⭐⭐供應商範例較多;先看概念再選 SDK。

🛠 動手練習(官方版)

完整練習與 starter code

練習摘要取自上游教材;完整程式碼、成本與延遲估算見官方版。

  1. 這一關不要求寫新程式:主要練習是「決策練習」— baseline → 挑一個候選 → 同一組 Eval 比較 → Keep/Simplify/Remove。
  2. 四個進階概念:Evaluator–Optimizer(Agent-as-Judge)、Failure Injection(Chaos Eval)、Autonomy Gradients(Trust Layers)、Model–Harness Fit。
  3. Judge 也會犯錯,不能單獨決定真相;故障注入只在隔離環境做;高風險動作不由模型自行升級權限。
  4. 閱讀路線:先讀三份必修,再依你遇到的失敗類型挑論文與案例。

✅ 自我檢查

  • 我能用白話解釋四個進階概念,並說出三個編輯/社群命名的邊界。
  • 我先有單一 Agent baseline 與可重跑失敗,才從選擇表增加一個模式。
  • 我會用同一組 Eval 比較品質、安全、成本與延遲,不只看一次漂亮回答。
  • 我能對一個 Harness 元件做 Keep/Simplify/Remove 決定,並指出證據與回復方法。
  • 我知道 Judge 也要被檢查,故障注入先在隔離環境做,高風險動作不由模型自行升級權限。

本站點改編自 awesome-agentic-ai-zh(MIT 授權,作者 Wenyu Chiou)v2026.09.23,資源連結查核日 2026-08-27。星級為學習優先順序(⭐⭐⭐⭐⭐=不看會卡住),非人氣排名。 MIT License · 課程結構最後更新:2026-10-03。內容持續補齊中,標記「撰寫中」的課程尚未上線。