Agentic Research

MoE(混合專家)

又稱:混合專家 · Mixture of Experts · 專家混合 · 稀疏模型 · sparse model · MoE 是什麼

一種模型架構:內部養很多「專家」子網路,但每個 token 只被交給其中少數幾個處理 —— 總參數量很大,每個 token 的計算量卻小得多。

你會在什麼時候遇到它

當你看到模型規格寫著「總參數量很大、每個 token 只啟用其中一小部分」,或聽到「這麼大的模型居然能在本機跑」的說法時,背後多半是 MoE。不懂它,你會用錯兩把尺:拿總參數量去估計算成本(高估速度瓶頸),或拿啟用參數量去估記憶體需求(低估到根本載不進去)。

打個比方

像一間大醫院:掛號台(router)看你的症狀,只把你轉給相關的兩三位專科醫師,而不是每位病患都全院會診。醫院聘了多少醫師(總參數)決定要租多大的樓(記憶體);但每位病患實際消耗的,只有值班那幾位的時間(計算量)。

最小範例

示意數字,只為講清比例關係:

  密集模型:  100 份參數,每個 token 都用到全部 100 份
  MoE 模型:  100 份參數分成很多組專家,
             每個 token 只經過其中 10 份

後果:
  · 每 token 的計算量 ≈ 密集模型的十分之一 → 生成快、成本低
  · 但所有專家都得常駐記憶體 → 記憶體需求仍按 100 份算
  · 「知識容量」大(參數多)而「每步算力」小(啟用少),
    正是 MoE 想兩邊都拿的設計

這個例子裡唯一要帶走的是那條不對稱:計算量看「啟用參數」,記憶體看「總參數」。規格表只給其中一個數字時,另一個要自己推出來 —— 任何一邊估錯方向,本機部署的成敗就完全判斷失準。

最常搞錯的地方

  • 看到「總參數量很大」就斷定跑不動、一定很貴。MoE 的每 token 計算量只跟啟用部分掛鉤,所以總量大的 MoE 常比相近總量的密集模型便宜、快得多 —— 「參數大=慢=貴」這條直覺在 MoE 上失靈。
  • 反過來,看到「啟用參數很少」就以為是小模型、隨便一台機器都跑得動。所有專家都得載入並常駐記憶體 —— 記憶體需求按總參數量算,一點也不小。MoE 是「算力輕、記憶體重」的架構。

相關詞條

下一步