Agentic Research

CPU 推理(不用 GPU 跑模型)

又稱:CPU 推理 · 純 CPU 跑模型 · 沒有顯卡能跑嗎 · CPU only · 用處理器跑 AI

只用 CPU、沒有 GPU 來跑模型。對小模型、低用量、離線批次任務它其實堪用;對大模型或互動式使用,它基本無望。

你會在什麼時候遇到它

這是「我沒有顯卡,能不能玩本地 AI」的答案。不懂它的邊界,你會走兩個極端之一:要嘛以為沒 GPU 就完全不能跑(其實小模型可以),要嘛以為 CPU 也能跑大模型(結果慢到每個 token 都要等上許久,還以為是程式壞了)。知道分界線,你才不會白買硬體或白等。

打個比方

CPU 推理像用一台萬能但人手很少的機器去搬一座山的石頭:它什麼都能做,但一次只能搬一點。小石頭堆(小模型、短輸出)慢慢搬得完;一座山(大模型、長輸出)你會搬到天荒地老。

最小範例

CPU 推理「堪用」的場景:
  · 小模型 + 短輸出(分類、抽取、改寫幾句話)
  · 不趕時間的離線批次(半夜跑一批文件)
  · 只想驗證流程、對速度無所謂

CPU 推理「無望」的場景:
  · 大模型(權重遠超快取能容納的量,每步都要從慢速記憶體搬)
  · 互動式聊天(你不會想每句話都等上半天)
  · 長輸出(生成越長,CPU 的劣勢被放大得越厲害)

分水嶺是「decode 階段要不停把權重搬進計算單元」。CPU 的記憶體頻寬與並行度遠不如 GPU,模型越大、輸出越長,這個差距越致命。小任務能忍,大任務不能。

最常搞錯的地方

  • 以為「沒有 GPU 就完全不能跑本地模型」。小模型、量化後的模型在純 CPU 上是可以堪用的,只是慢。
  • 以為 CPU 只慢一點點、忍一下就過去。對大模型,差距不是「一點點」,是慢到讓人失去耐心,互動體驗直接歸零。
  • 用 CPU 跑長輸出或高並發,還期待跟 GPU 一樣的吞吐量。CPU 的弱項正好在生成階段與並行度,那正是這些場景最需要的。

相關詞條

下一步