Agentic Research

RLHF / RL

RLHF/RL 用人類或規則的回饋來訓練模型。

你會在什麼時候遇到它

回饋設計錯誤會教出鑽評分漏洞的模型——這也是 Stage 7 堅持 Eval 的原因之一。

相關詞條

下一步