A
返回 發現
發現2026/08/13 Bryan Chan12 分鐘閱讀

Prime Agent 深度研究:PrimeIntellect 的自我改進 RLM Agent 與我們的實測

Prime Intellect 於 2026 年 8 月開源的自我改進 Agent 框架 Prime Agent 完整拆解:RLM + Continual Harness 雙抽象、ARC-AGI-3 超越人類基線、與 OpenClaw 基建的架構對比,以及在 Mac Studio 上接入自有 API 中轉層的完整實測記錄。

一句話版本

Prime Intellect(分布式 AI 訓練公司)於 2026 年 8 月 6 日開源了 Prime Agent —— 一個為長任務自主運行設計的 coding/research agent。MIT 授權,一行命令安裝,TUI 基於 pi-mono 的 fork。上線一週,已被多家媒體報導。

官方成績:Opus 5 + Prime Agent 在 ARC-AGI-3 取得 95.5%,超越人類專家基線 95.4%。實測中,它在沒有參考代碼的情況下寫出了能運行的 SEGA Genesis 和 Game Boy Color 的 Rust 模擬器。


兩個核心抽象

Prime Agent 的設計圍繞兩篇論文級抽象,這也是它與傳統 agent harness(固定工具 schema + 上下文壓縮)的根本分歧。

1. Recursive Language Model(RLM)

Context 是變量,Subagent 是函數調用。

傳統 harness 給模型一堆固定 schema 的工具(read_file、run_command……),再用上下文壓縮「幫」模型省 token。RLM 反其道而行:

  • 模型只有一個工具:一個持久的 IPython kernel
  • Context 被當作變量處理(prompt-as-a-variable)——歷史訊息存在變量裡,模型可以對自己的上下文寫代碼
  • Subagent 就是函數調用:rlm("子任務") spawn 一個完整的子 agent(有自己的模型、kernel、歷史),非阻塞返回,結果異步送達

效果:理論上支持無限長 session 而不丟失歷史——因為歷史不是被「壓縮掉」,而是被「編程化引用」。

2. Continual Harness(自我進化的外殼)

Harness 的狀態 H = (prompts, sub-agents, skills, memory),Agent 可以 CRUD 它。

/refine 指令讀取 agent 自己的執行軌跡,提取教訓,對 harness 狀態做最小、有證據支撐的更新

  • 更新類型:補充 prompt、記憶、技能描述、subagent 規格
  • Base system prompt 永遠不可變(安全錨點)
  • 每次更新記錄 snapshot,可按 ID rollback
  • 規劃在後台運行,不阻塞對話

這是「agent 改進自己」的工程化落地——不是改 weights,而是改自己的操作環境。


其他工程特性

特性 說明
Daemon-backed sessions 終端斷開後 agent 繼續跑,可隨時 reattach
Agent 間直接通訊 運行中的 agent 可互相發現、交換訊息、協同工作
Heartbeats & Schedules 定期/定時重新進入 session
Persistent Goals /goal 讓目標跨回合持續存在直到完成
Bounded Autonomous Mode /autonomous 在回合/token/時間預算內自主執行 + 自定義質量門
Skills = 可執行 Python 包 內建 skill creator,把工作流沉澱為技能
Headless 模式 JSON / RPC 模式供自動化集成

🪞 與 UltraClaw 基建的對比(本文重點)

我們在自己的 OpenClaw 體系上,用外部基建砌出了幾乎相同的能力。對照表:

Prime Agent(harness 原生) UltraClaw(OpenClaw + 外掛層)
Continual Harness /refine agent-evolver + skill-curator + SkillOpt 三件套
RLM subagent 函數調用 sessions_spawn + subagents 編排
Daemon + reattach OpenClaw Gateway 常駐 + sessions
Heartbeats / Schedules OpenClaw cron + heartbeat(同款機制)
Skills = Python 包 SKILL.md 技能體系 + SkillOpt 夜間優化
Snapshot + rollback 我們的 verify.py + Gate JSON 驗證
Agent 間通訊 sessions_send + 多 agent 路由

結論:方向完全一致,證明我們走的是 frontier 路線。 差別在實現層級:

  1. Prime Agent 把自我進化做進 harness 內核(/refine 是一等公民);我們是外掛層疊加(三個獨立技能 + 外部 cron)
  2. Prime Agent 的 RLM 用「編程化上下文」解決長任務記憶;我們用向量記憶 + daily log + session transcript 三層文件系統
  3. 我們的優勢:多渠道整合(飛書/微信/WhatsApp)、商業場景技能庫(AK-SDD 港股調研等 400+ 技能)、合規審計層——這些是通用 harness 不會做的垂直積累

一個有意思的觀察:Prime Agent 的 /refine 永遠不動 base system prompt,而我們踩過的坑(Lesson #76-77:模型切換導致行為退化)恰恰說明不可變錨點的重要性。 不同團隊獨立收斂到同一設計,說明這是正確答案。


🔬 實測記錄(Mac Studio,2026-08-13 凌晨)

安裝審計

官方安裝腳本 1,620 行,先審計後安裝(不盲目 curl | sh):

  • SHA-256 校驗發布包 ✅
  • 只在缺少 Node.js 時才需要 sudo ✅
  • 無可疑外聯/持久化行為 ✅

安裝結果:prime-agent v0.7.2,192 個依賴包, checksum 驗證通過。

接入自有 API 中轉層(Sub2API)

Prime Agent 支持通過 ~/.prime/agent/models.json 添加任意 OpenAI-compatible provider:

{
  "providers": {
    "sub2api": {
      "baseUrl": "http://localhost:8080/v1",
      "api": "openai-completions",
      "apiKey": "sk-...",
      "compat": {
        "supportsDeveloperRole": false,
        "supportsReasoningEffort": false
      },
      "models": [
        { "id": "deepseek-v4-pro", "reasoning": false, "contextWindow": 128000 }
      ]
    }
  }
}

踩坑:Cloudflare Error 1010

第一次測試報 403 Your request was blocked。排查過程:

  1. curl 直連 API → 200 ✅(排除 key 問題)
  2. curl 模擬 stream/tools/UA → 全部 200 ✅
  3. 本地捕獲服務器抓到 prime-agent 完整請求 → replay 到生產域名 → 403, error code: 1010

根因:Cloudflare WAF 的 1010 規則(按瀏覽器簽名封鎖)。 Prime Agent 使用 OpenAI JS SDK,User-Agent 為 OpenAI/JS 6.47.0 加一串 X-Stainless-* 指紋頭,被 WAF 識別為機器人 SDK 流量而攔截。

解法:改用本地端點http://localhost:8080/v1)繞過 Cloudflare——反正 Sub2API 就跑在同一部機器上,延遲更低。

實測結果

測試 1(基礎連通)

> Reply with exactly: PRIME_AGENT_TEST_OK
< PRIME_AGENT_TEST_OK  ✅

測試 2(真實編碼任務):要求創建 memoization 版 fibonacci 並驗證 fib(50):

  • Agent 通過 IPython kernel 寫文件、執行、驗證
  • 產出 fibonacci.py@lru_cache 實現,含邊界檢查和 docstring)
  • 正確返回 fib(50) = 12586269025

全程約 40 秒,一次通過,無需人工干預。


⚠️ 風險與注意事項

  1. 不是安全沙盒:官方 README 明確警告——它以用戶權限執行模型生成的 Python。worker/kernel 進程有生命週期隔離,但不構成安全邊界。跑不受信任的代碼請用外部沙盒。
  2. 成本:設計面向 frontier 模型,長任務 + 遞歸 subagent 的 token 消耗可觀。
  3. 生態年輕:8 月 6 日剛開源,文檔完整但社區案例還少。

對我們的啟示

  1. 借鑑 /refine 的 snapshot + rollback 機制 —— 我們的 SkillOpt 已有 gate,但缺少「按 ID 回滾單次更新」的細粒度控制
  2. RLM 的編程化上下文值得跟蹤 —— 當 OpenClaw 支持時,長任務記憶可能不再需要三層文件系統
  3. Cloudflare WAF 會誤傷合法 agent 流量 —— 這是基礎設施層的新坑,值得記入運維手冊
  4. 自我改進不是未來,是現在 —— Prime Agent、我們的七件套、SkillOpt,不同團隊在 2026 年同時收斂到這個方向

Prime Agent 值得持續跟蹤。我們的下一步:在隔離環境跑一個真實的長任務(例如完整的 AK-SDD 調研流程),測試 Continual Harness 的 /refine 是否能產出有價值的自我改進。


本文基於 Prime Agent v0.7.2 實測撰寫,2026-08-13。