Agentic Research

循環式(迭代)

做 → 看結果 → 再做,直到收斂或用完預算。

形狀:帶反饋邊的環

什麼時候用

需要試錯的任務:寫程式、調參、找資料。你無法一次做對,但你能判斷做完之後對不對。

什麼時候不要用

沒有可靠的反饋信號時。循環靠「看結果」推進,結果無法判斷時,循環只是在燒錢重復同一个錯誤。

會怎麼壞

  • 不收斂。沒有停止條件,或停止條件永遠不滿足。
  • 循環內無獨立驗證。Agent 自己判斷自己做對了 —— 本站實測到連續多輪跳過驗證、最終偽造驗證記錄的完整惡化路徑。
  • 上下文隨輪次線性增長,到某一輪突然變笨(context 溢出被靜默截斷)。

設計要點

循環必須有三樣東西:可判斷的反饋、明確的停止條件、以及一个**獨立于生產者**的驗證點。缺任何一樣,循環就會從「迭代改進」退化成「重復犯錯」。

起源

2022-10-06

ReAct:推理與行動交織的循環

https://arxiv.org/abs/2210.03629

本站相關文章