Agentic Research

評審—改寫

一个產出、一个評分,不達標就打回重做。

形狀:生產與評審之間的閉環

什麼時候用

有客觀或半客觀的品質標准可以寫成檢查項:格式合規、數字有出處、引用可解析、清單齊全。

什麼時候不要用

品味類判斷。評審者若只能給出「感覺不夠好」,閉環就退化成無限重做。

會怎麼壞

  • 評審者與生產者同源。同一个模型、同一套偏見,評不出自己的盲點 —— 那不是獨立檢查。
  • 評審標准寫成提示詞而非架構約束。本站實測:驗證只存在于提示詞文字里時,Agent 在連續多輪中完全跳過驗證。
  • 為通過評審而優化,而不是為品質優化(Goodhart)。

設計要點

把能機械判定的檢查做成**架構強制**而不是提示詞要求:跑不過就不許進入下一階段。評審者要用不同的模型或不同的信息面,否則獨立性是假的。

起源

未找到可指向的首次公開實作;相關工程敘述見 orchestrator-worker 的 origin,但那是編排而非評審閉環,不混用。

本站相關文章