Agentic
Research
詞彙
課程
AI 工具
範式
技能
MCP
場景
學習
實測
工具
模板
詞彙
課程
AI 工具
範式
技能
MCP
場景
描述你遇到的問題
EN
詞彙表
/
模型與推理
DPO(Direct Preference Optimization)
DPO 讓模型從「較好答案」與「較差答案」的配對中學習偏好。
你會在什麼時候遇到它
偏好學習的代表方法之一;與 RLHF 一起認得,就能讀懂多數模型卡的自述。
相關詞條
Fine-tune(微調)
Pre-training(預訓練)
Post-training(後訓練)
下一步
Transformer 架構理解 — Attention Is All You Need
7 min