Agentic Research

Fine-tune(微調)

又稱:微調 · fine-tuning · fine tuning · LoRA · 模型微調 · PEFT

拿一個現成模型,用你自己的資料繼續訓練,把新的行為或風格寫進權重裡。

你會在什麼時候遇到它

當「模型總是不照我要的格式回答」、而有人建議你「微調一個吧」的時候,你就站在這個決策點上。不懂微調的適用範圍,你會在改 prompt 就能解決的問題上花幾週蒐集資料、燒訓練費;或更糟 —— 期待微調教會模型它本來不知道的內部知識(那是 RAG 的工作),結果又貴又會過期。

打個比方

改造一個員工的三種手段:給他一份操作手冊(prompt —— 立即可用、隨時可改);給他一個可查的資料櫃(RAG —— 知識可更新);送他回爐重訓(fine-tune —— 改變的是直覺和習慣,效果深入,但慢、貴,而且公司制度一改就要重訓一次)。

最小範例

決策順序(幾乎永遠從上往下試):

1. 行為不對         → 改 prompt/系統提示      成本:幾分鐘
2. 缺你的文件知識   → 接 RAG                  成本:幾天
3. 風格、格式、領域腔調要穩定且規模化,
   提示詞已經壓不住 → 才考慮 fine-tune        成本:幾週起跳

隱藏成本:基座模型一換代,微調通常要重做;
每次上線前要有評測集,否則你不知道它把什麼改壞了。

微調擅長的是「行為」:固定的輸出格式、一致的語氣、領域的表達習慣。它不擅長注入「事實」—— 訓練資料裡的事實會被寫死進權重,一旦過期或記錯,你沒辦法像更新文件一樣更新它。

最常搞錯的地方

  • 用微調來灌知識,以為把公司文件拿去訓練,模型就「學會」了。它更可能學會文件的腔調,卻把細節記成四不像 —— 而且無法溯源、無法更新。知識用 RAG,行為用微調,這條線要劃清楚。
  • 以為微調是一次性專案。它是要長期養的東西:基座換代要重訓、資料要持續清洗、每次重訓都要跑評測確認沒有退化 —— 很多團隊微調完第一版就再也沒預算維護,模型慢慢爛在那裡。

相關詞條

下一步