Agentic Research

GRPO

GRPO 讓同一題的多個答案互相比較,再依相對表現更新模型。

你會在什麼時候遇到它

近一年模型卡常見的訓練法縮寫;認得即可,初學不需要實作。

相關詞條

下一步