Agentic Research

DPO(Direct Preference Optimization)

DPO 讓模型從「較好答案」與「較差答案」的配對中學習偏好。

你會在什麼時候遇到它

偏好學習的代表方法之一;與 RLHF 一起認得,就能讀懂多數模型卡的自述。

相關詞條

下一步