VRAM(顯存/GPU 記憶體)
又稱:顯存 · GPU 記憶體 · 視訊記憶體 · video memory · GPU RAM
GPU 自己的記憶體。模型權重與 KV cache 都得先放進這裡,放不下就無法運行。
你會在什麼時候遇到它
這是本地跑模型時你最先撞到、也最硬的一堵牆。它不是「效能指標」,是「能不能跑」的開關。不懂它,你會對著「明明有 GPU 卻載入失敗」的錯誤訊息束手無策 —— 因為問題不在算力,在記憶體裝不下。
打個比方
VRAM 像一張桌子,不是倉庫。要用的東西必須先放在桌面上才拿得到;桌子就這麼大,放不下就是放不下,溢出的部分堆到旁邊地上(系統記憶體)等於用不到,每次還要繞去地上拿,慢到不能用。
最小範例
載入一個模型時,VRAM 至少要吃下:
模型權重 ← 參數量 × 每個參數的位元組(量化越少越大)
KV cache ← 隨上下文長度成長,長對話越來越大
執行時開銷 ← 框架、暫存張量
─────────────
加總 > VRAM 容量 → 不是變慢,是直接報錯、載入失敗關鍵是最後一行:超過容量是「硬失敗」。很多新手以為會自動變慢,實際上多數框架會直接丟出 out-of-memory 錯誤然後中止。
最常搞錯的地方
- 以為 VRAM 不夠會「自動變慢」。它是一堵牆:裝不下就是 out-of-memory 直接失敗,不是優雅降速。
- 以為權重放得下就夠了。忘了 KV cache 會隨上下文長度成長,長對話或高並發時它可能比權重還吃 VRAM。
- 把「系統記憶體很大」當成「VRAM 很大」。兩者是不同的池子;離散顯卡上,模型放不進顯存時溢出到系統記憶體的部分,慢到幾乎不可用。