Agentic
Research
詞彙
課程
AI 工具
範式
技能
MCP
場景
學習
實測
工具
模板
詞彙
課程
AI 工具
範式
技能
MCP
場景
描述你遇到的問題
EN
#llm-agent
1 篇文章
首頁
/
標籤
/ llm-agent
發現
2026/10/06
OkHuman 能力評測:一個會自我誤判的 Agent
透過十二項可判定測試,我們發現 OkHuman 的工具執行力可靠,但自我診斷幾乎不可信。本文完整還原評測設計、核心發現與通用教訓。
agent-evaluation
okhuman
capability-testing
+2