本地 vs 雲端(自己跑還是呼叫 API)
又稱:本地部署 · 雲端 API · self-hosted · 本地跑還是用 API · on-premise
模型跑在你自己的機器上(本地),還是透過網路呼叫別人的機器(雲端 API)。真正的差異不是「免費 vs 付費」,而是隱私、規模成本、延遲、能力上限與維運負擔這幾條軸。
你會在什麼時候遇到它
這是每個 AI 專案早晚要做的第一個架構決定。把它簡化成「本地免費、雲端要錢」的人會在兩個方向都踩坑:本地忽略了硬體與維運成本,雲端忽略了資料外送與規模化後的帳單。認得這幾條軸,你才知道自己在拿什麼換什麼。
打個比方
像「自己買車」對上「叫計程車」。自己買車:前期貴、要保養、要停車位,但隨時能開、東西都放車上(隱私),長期高頻使用反而省。叫計程車:不用養車、上車就走(能力上限高、隨叫隨到),但每趟都付費、行程紀錄在別人手上,高峰期可能叫不到或變貴。
最小範例
別用「免費 vs 付費」思考,用這幾條軸:
隱私 敏感資料能不能離開你的機器?
規模成本 用量越大,雲端每 token 帳單越可觀;本地硬體是一次性
延遲 本地沒有網路往返;雲端要加上上行與服務端排隊
能力上限 最大的模型通常只在雲端;本地受你的 VRAM/記憶體限制
維運負擔 本地要你自己顧當機、更新、監控;雲端是別人的問題多數團隊的正確答案不是二選一,而是混用:敏感或高頻的走本地,要最強能力或爆量的走雲端。先想清楚這幾條軸各自的要求,再決定切在哪裡。
最常搞錯的地方
- 以為「本地=免費」。硬體折舊、電力、你的維運時間都是成本;高用量下雲端反而可能更便宜。
- 以為「雲端=資料安全」。你的提示與資料會送到別人的機器;對敏感內容這可能是合規紅線,跟安全不安全是兩回事。
- 把延遲當成同一件事。本地的延遲來自硬體,雲端的延遲還要加上網路往返與服務端排隊,兩者的瓶頸完全不同。