同一個工具,有人一個月花不到十塊錢,有人花掉幾百塊,做的事看起來差不多。
差別不在工具,在計費方式與幾個可控制的習慣。
這篇不會列任何具體金額。 本站的規則是:價格只在人工核實、且標明核實日期之後才寫;否則只寫定性描述與官方定價頁連結。原因是價格變動頻繁,而一個過期的數字比沒有數字更有害 —— 它看起來是事實。
一、計費單位是 token,不是字,也不是次數
token 是模型處理文字的最小單位,大致介於「一個字」與「一個詞」之間。中文通常一個字對映一到兩個 token,英文一個詞對映一到兩個 token。
關鍵是:輸入與輸出都算,而且輸出通常比輸入貴(常見是兩到五倍,依模型而定)。
見 Token(詞元) 與 Tokenization(分詞) 的完整說明。
二、為什麼長對話越來越貴
這是最多人踩的一個,而且完全看不見。
多數工具在每一輪對話時,會把整段歷史重新送給模型 —— 因為模型本身不記得上一句話,它每次都是從頭讀。
所以:
| 輪數 | 這一輪送出的內容 | 這一輪的輸入 token |
|---|---|---|
| 1 | 你的問題 | 1× |
| 5 | 前 4 輪 + 你的問題 | 約 5× |
| 20 | 前 19 輪 + 你的問題 | 約 20× |
第二十輪的一句話,成本可能是第一輪的二十倍。 而你在介面上看到的只是「又發了一句」。
怎麼辦:
- 換任務就開新對話。 這是最有效的一個動作,而且完全免費。舊對話的內容對新任務通常沒用,但它照樣被送進去、照樣計費。
- 不要把整個檔案貼進對話。 給路徑讓它自己讀(如果工具支援),或只貼相關的那一段。
- 長文件要它總結時,先分段。 一次喂十萬 token 與分十次每次一萬,成本差很多。
關於「上下文視窗」這個限制的含義,見 Context Window(上下文視窗)。
三、免費額度通常限制什麼
各家不同,但限制的手段高度一致,通常是這幾個的組合:
- 每日或每月的次數/token 上限
- 只能用較弱的模型(前沿模型留給付費)
- 速率限制 —— 短時間內請求太多次會被擋,見 Rate Limit(速率限制)
- 功能閘門 —— 某些能力(更長的上下文、Agent 模式、併發)只給付費
- 資料使用條款不同 —— 免費方案有時允許拿你的內容訓練,付費方案則不允許。這一條比價格重要,見 Agent 到底看得到什麼
實務建議:先用免費額度把「我到底要不要用這類工具」弄清楚。免費額度不夠用的時候,通常意味著你已經有明確用途了 —— 那時候付費才是有依據的決定,而不是賭。
四、訂閱制 vs 按量計費
訂閱制(月費,含一定用量):
- 適合:用量穩定、每天都會用
- 好處:成本可預測,不會因為某天多用了就爆掉
- 注意:通常有隱藏的公平使用上限,超過會被降速或降級到較弱模型,而不是直接收費
按量計費(用多少算多少):
- 適合:用量不規律、或要跑批次任務
- 好處:不用就不花錢
- 注意:這是唯一可能產生意外大額帳單的模式
按量計費的三個必要防護:
- 設定花費上限。 幾乎所有平台都提供,但預設通常是關閉或很高的。裝好之後第一件事就是設它。
- 先小規模跑一次。 批次任務先用十分之一的資料跑,看實際花了多少,再決定要不要全量跑。
- 不要把 API key 交給你不控制的程式。 一個跑壞的迴圈可以在幾小時內花掉你一個月的預算,而它不會停下來問你。
關於 key 本身,見 API Key。
五、把第一個月的成本壓到接近零
五個具體做法,按效果排序:
- 換任務就開新對話 —— 這一條通常就能砍掉一半以上
- 用訂閱制的免費方案或試用期,不要一開始就接按量計費
- 給路徑而不是貼內容(工具支援的話)
- 簡單任務用便宜模型 —— 多數工具可以逐次選模型。總結一段文字、改錯字、格式化,不需要前沿模型
- 一次把話說清楚 —— 見 你的第一個 AI 任務。來回澄清五次的成本,是一次說清楚的五倍,而且你還得不到想要的結果
第 5 條最容易被低估:指令寫得含糊不只是浪費錢,是花錢買一個錯的東西,然後再花錢重做。
六、什麼時候成本不是該優化的東西
一個反直覺的結論:如果你用它省下的是你自己的時間,模型選型的影響通常小於任務設計的影響。
具體說:一個用便宜模型、但指令清楚、範圍收窄的任務,通常比一個用貴模型、但指令含糊的任務又快又便宜又準。
所以優化順序是:
- 任務設計(範圍、輸入、產出定義)—— 影響最大,成本為零
- 對話衛生(開新對話、不貼全文)—— 影響大,成本為零
- 模型選擇 —— 影響中等
- 換工具 —— 影響最小,成本最高(要重學)
大多數人從第 4 步開始,然後得出「這工具太貴」的結論。
七、本機方案的真實成本
跑本機模型(Ollama 等)不是免費的,只是成本從「每月帳單」變成「一次性硬體 + 電費 + 時間」。
需要考慮:
- 記憶體是硬門檻。 模型大小直接決定你需要多少 RAM/VRAM,不夠就是跑不動,不是跑得慢。見 VRAM(顯存/GPU 記憶體)
- 速度差距明顯。 本機推理的 token/秒 通常遠低於雲端,長任務的等待時間是真實成本
- 能力差距也在。 本機能跑的模型規模,通常小於雲端前沿模型
什麼時候值得:資料不能出機器(見第三題)、或用量極高以至於訂閱費超過硬體折舊。 什麼時候不值得:只是想試試、或任務需要最強能力。
本站在自己機器上跑過這些對比,數字在 M3 Ultra 工作站實測 與 推理框架對比。
下一步
- 你的第一個 AI 任務 —— 第五條的完整版,任務設計怎麼影響成本
- AI Agent 到底看得到什麼 —— 免費方案的資料條款那一條
- 團隊 AI 成本估算 —— 如果是給團隊用
- LLM API 定價 —— 有核實日期的價格整理
- Token(詞元) / Context Window(上下文視窗) / Rate Limit(速率限制) / 本地 vs 雲端(自己跑還是呼叫 API)