Agentic
Research
詞彙
課程
AI 工具
範式
技能
MCP
場景
學習
實測
工具
模板
詞彙
課程
AI 工具
範式
技能
MCP
場景
描述你遇到的問題
EN
詞彙表
/
模型與推理
RLHF / RL
RLHF/RL 用人類或規則的回饋來訓練模型。
你會在什麼時候遇到它
回饋設計錯誤會教出鑽評分漏洞的模型——這也是 Stage 7 堅持 Eval 的原因之一。
相關詞條
Fine-tune(微調)
Pre-training(預訓練)
Post-training(後訓練)
下一步
Transformer 架構理解 — Attention Is All You Need
7 min