Agentic Research

This article is not yet available in English. You are reading the Traditional Chinese original. The English edition will appear here once it is translated.

Browse articles that do have an English edition

AI 是怎麼計費的:為什麼用一個月可能差十倍

2026/09/307 min readBryan Chan閱讀中文原文
Topics入門成本AI Agent

同一個工具,有人一個月花不到十塊錢,有人花掉幾百塊,做的事看起來差不多。

差別不在工具,在計費方式與幾個可控制的習慣。

這篇不會列任何具體金額。 本站的規則是:價格只在人工核實、且標明核實日期之後才寫;否則只寫定性描述與官方定價頁連結。原因是價格變動頻繁,而一個過期的數字比沒有數字更有害 —— 它看起來是事實。

一、計費單位是 token,不是字,也不是次數

token 是模型處理文字的最小單位,大致介於「一個字」與「一個詞」之間。中文通常一個字對映一到兩個 token,英文一個詞對映一到兩個 token。

關鍵是:輸入與輸出都算,而且輸出通常比輸入貴(常見是兩到五倍,依模型而定)。

見 Token(詞元) 與 Tokenization(分詞) 的完整說明。

二、為什麼長對話越來越貴

這是最多人踩的一個,而且完全看不見。

多數工具在每一輪對話時,會把整段歷史重新送給模型 —— 因為模型本身不記得上一句話,它每次都是從頭讀。

所以:

輪數這一輪送出的內容這一輪的輸入 token
1你的問題1×
5前 4 輪 + 你的問題約 5×
20前 19 輪 + 你的問題約 20×

第二十輪的一句話,成本可能是第一輪的二十倍。 而你在介面上看到的只是「又發了一句」。

怎麼辦:

  • 換任務就開新對話。 這是最有效的一個動作,而且完全免費。舊對話的內容對新任務通常沒用,但它照樣被送進去、照樣計費。
  • 不要把整個檔案貼進對話。 給路徑讓它自己讀(如果工具支援),或只貼相關的那一段。
  • 長文件要它總結時,先分段。 一次喂十萬 token 與分十次每次一萬,成本差很多。

關於「上下文視窗」這個限制的含義,見 Context Window(上下文視窗)。

三、免費額度通常限制什麼

各家不同,但限制的手段高度一致,通常是這幾個的組合:

  1. 每日或每月的次數/token 上限
  2. 只能用較弱的模型(前沿模型留給付費)
  3. 速率限制 —— 短時間內請求太多次會被擋,見 Rate Limit(速率限制)
  4. 功能閘門 —— 某些能力(更長的上下文、Agent 模式、併發)只給付費
  5. 資料使用條款不同 —— 免費方案有時允許拿你的內容訓練,付費方案則不允許。這一條比價格重要,見 Agent 到底看得到什麼

實務建議:先用免費額度把「我到底要不要用這類工具」弄清楚。免費額度不夠用的時候,通常意味著你已經有明確用途了 —— 那時候付費才是有依據的決定,而不是賭。

四、訂閱制 vs 按量計費

訂閱制(月費,含一定用量):

  • 適合:用量穩定、每天都會用
  • 好處:成本可預測,不會因為某天多用了就爆掉
  • 注意:通常有隱藏的公平使用上限,超過會被降速或降級到較弱模型,而不是直接收費

按量計費(用多少算多少):

  • 適合:用量不規律、或要跑批次任務
  • 好處:不用就不花錢
  • 注意:這是唯一可能產生意外大額帳單的模式

按量計費的三個必要防護:

  1. 設定花費上限。 幾乎所有平台都提供,但預設通常是關閉或很高的。裝好之後第一件事就是設它。
  2. 先小規模跑一次。 批次任務先用十分之一的資料跑,看實際花了多少,再決定要不要全量跑。
  3. 不要把 API key 交給你不控制的程式。 一個跑壞的迴圈可以在幾小時內花掉你一個月的預算,而它不會停下來問你。

關於 key 本身,見 API Key。

五、把第一個月的成本壓到接近零

五個具體做法,按效果排序:

  1. 換任務就開新對話 —— 這一條通常就能砍掉一半以上
  2. 用訂閱制的免費方案或試用期,不要一開始就接按量計費
  3. 給路徑而不是貼內容(工具支援的話)
  4. 簡單任務用便宜模型 —— 多數工具可以逐次選模型。總結一段文字、改錯字、格式化,不需要前沿模型
  5. 一次把話說清楚 —— 見 你的第一個 AI 任務。來回澄清五次的成本,是一次說清楚的五倍,而且你還得不到想要的結果

第 5 條最容易被低估:指令寫得含糊不只是浪費錢,是花錢買一個錯的東西,然後再花錢重做。

六、什麼時候成本不是該優化的東西

一個反直覺的結論:如果你用它省下的是你自己的時間,模型選型的影響通常小於任務設計的影響。

具體說:一個用便宜模型、但指令清楚、範圍收窄的任務,通常比一個用貴模型、但指令含糊的任務又快又便宜又準。

所以優化順序是:

  1. 任務設計(範圍、輸入、產出定義)—— 影響最大,成本為零
  2. 對話衛生(開新對話、不貼全文)—— 影響大,成本為零
  3. 模型選擇 —— 影響中等
  4. 換工具 —— 影響最小,成本最高(要重學)

大多數人從第 4 步開始,然後得出「這工具太貴」的結論。

七、本機方案的真實成本

跑本機模型(Ollama 等)不是免費的,只是成本從「每月帳單」變成「一次性硬體 + 電費 + 時間」。

需要考慮:

  • 記憶體是硬門檻。 模型大小直接決定你需要多少 RAM/VRAM,不夠就是跑不動,不是跑得慢。見 VRAM(顯存/GPU 記憶體)
  • 速度差距明顯。 本機推理的 token/秒 通常遠低於雲端,長任務的等待時間是真實成本
  • 能力差距也在。 本機能跑的模型規模,通常小於雲端前沿模型

什麼時候值得:資料不能出機器(見第三題)、或用量極高以至於訂閱費超過硬體折舊。 什麼時候不值得:只是想試試、或任務需要最強能力。

本站在自己機器上跑過這些對比,數字在 M3 Ultra 工作站實測 與 推理框架對比。

下一步