Agentic Research

VRAM(顯存/GPU 記憶體)

又稱:顯存 · GPU 記憶體 · 視訊記憶體 · video memory · GPU RAM

GPU 自己的記憶體。模型權重與 KV cache 都得先放進這裡,放不下就無法運行。

你會在什麼時候遇到它

這是本地跑模型時你最先撞到、也最硬的一堵牆。它不是「效能指標」,是「能不能跑」的開關。不懂它,你會對著「明明有 GPU 卻載入失敗」的錯誤訊息束手無策 —— 因為問題不在算力,在記憶體裝不下。

打個比方

VRAM 像一張桌子,不是倉庫。要用的東西必須先放在桌面上才拿得到;桌子就這麼大,放不下就是放不下,溢出的部分堆到旁邊地上(系統記憶體)等於用不到,每次還要繞去地上拿,慢到不能用。

最小範例

載入一個模型時,VRAM 至少要吃下:
  模型權重      ← 參數量 × 每個參數的位元組(量化越少越大)
  KV cache      ← 隨上下文長度成長,長對話越來越大
  執行時開銷    ← 框架、暫存張量
  ─────────────
  加總 > VRAM 容量  →  不是變慢,是直接報錯、載入失敗

關鍵是最後一行:超過容量是「硬失敗」。很多新手以為會自動變慢,實際上多數框架會直接丟出 out-of-memory 錯誤然後中止。

最常搞錯的地方

  • 以為 VRAM 不夠會「自動變慢」。它是一堵牆:裝不下就是 out-of-memory 直接失敗,不是優雅降速。
  • 以為權重放得下就夠了。忘了 KV cache 會隨上下文長度成長,長對話或高並發時它可能比權重還吃 VRAM。
  • 把「系統記憶體很大」當成「VRAM 很大」。兩者是不同的池子;離散顯卡上,模型放不進顯存時溢出到系統記憶體的部分,慢到幾乎不可用。

相關詞條

下一步