Agentic Research

參數量(模型有多少個數字)

又稱:模型大小 · 7B · 70B · 參數量 · 參數數量 · billions of parameters

模型裡有多少個可調整的數字。它常被當成「模型多大、多聰明」的標籤,但這個標籤比你想的更容易誤導。

你會在什麼時候遇到它

挑模型時你第一個看到的數字通常就是它(7B、70B 這種)。直覺是「越大越強」,於是新手盲目追求最大參數量,結果撞上 VRAM 牆、或發現大模型在自己的簡單任務上又慢又沒比較好。理解「參數量不等於對你的任務更好」,你才不會選錯工具。

打個比方

參數量像一本書的「字數」。字數多的書通常內容更豐富,但當你只想查一個電話號碼時,一本厚百科全書反而比一張便條紙更難用 —— 重點不是字數,是有沒有你要的東西、好不好拿。

最小範例

參數量 → 記憶體(不是效能保證):
  參數量 × 每個參數的位元組 ≈ 權重大小
  · 量化位元越高 → 權重越大 → 越吃 VRAM
  · 同一個參數量,量化後大小可以差好幾倍

但「總參數量」對 MoE 模型會失真:
  總量很大,實際每次推理只激活其中一部分
  → 用總參數量會高估它的算力/記憶體需求(詳見 moe 詞條)

兩個重點:參數量主要預測「佔多少記憶體」,不直接預測「多聰明」或「多快」;而對 MoE 模型,總參數量是個會誤導的數字,請交叉參考 moe 詞條,不在這裡重述它的機制。

最常搞錯的地方

  • 以為參數量越大,對你的任務就越好。任務簡單時,大模型只是更慢、更吃記憶體,品質未必更好。
  • 把參數量當成速度或 VRAM 的直接保證。它要乘以「每個參數用幾個位元」(量化)才知道實際大小。
  • 用總參數量去理解 MoE 模型。MoE 每次只激活一部分參數,總數字會讓你高估它的算力與記憶體需求。

相關詞條

下一步