參數量(模型有多少個數字)
又稱:模型大小 · 7B · 70B · 參數量 · 參數數量 · billions of parameters
模型裡有多少個可調整的數字。它常被當成「模型多大、多聰明」的標籤,但這個標籤比你想的更容易誤導。
你會在什麼時候遇到它
挑模型時你第一個看到的數字通常就是它(7B、70B 這種)。直覺是「越大越強」,於是新手盲目追求最大參數量,結果撞上 VRAM 牆、或發現大模型在自己的簡單任務上又慢又沒比較好。理解「參數量不等於對你的任務更好」,你才不會選錯工具。
打個比方
參數量像一本書的「字數」。字數多的書通常內容更豐富,但當你只想查一個電話號碼時,一本厚百科全書反而比一張便條紙更難用 —— 重點不是字數,是有沒有你要的東西、好不好拿。
最小範例
參數量 → 記憶體(不是效能保證):
參數量 × 每個參數的位元組 ≈ 權重大小
· 量化位元越高 → 權重越大 → 越吃 VRAM
· 同一個參數量,量化後大小可以差好幾倍
但「總參數量」對 MoE 模型會失真:
總量很大,實際每次推理只激活其中一部分
→ 用總參數量會高估它的算力/記憶體需求(詳見 moe 詞條)兩個重點:參數量主要預測「佔多少記憶體」,不直接預測「多聰明」或「多快」;而對 MoE 模型,總參數量是個會誤導的數字,請交叉參考 moe 詞條,不在這裡重述它的機制。
最常搞錯的地方
- 以為參數量越大,對你的任務就越好。任務簡單時,大模型只是更慢、更吃記憶體,品質未必更好。
- 把參數量當成速度或 VRAM 的直接保證。它要乘以「每個參數用幾個位元」(量化)才知道實際大小。
- 用總參數量去理解 MoE 模型。MoE 每次只激活一部分參數,總數字會讓你高估它的算力與記憶體需求。