Agentic Research

每 token 成本(API 是怎麼計費的)

又稱:token 計費 · API 定價 · 每 token 價格 · cost per token · 輸入輸出價格

API 對「輸入 token」與「輸出 token」分開計價,輸出通常更貴,命中快取的輸入常有折扣。而 Agent 的帳單之所以嚇人,是因為它每一輪都把越來越長的上下文重送一次。

你會在什麼時候遇到它

這是你的 AI 專案從「demo」走向「上線」時,第一個會讓你心跳加速的東西。不懂計費結構,你會犯一個代價高昂的錯:以為成本等於「答案的長度」,結果真正的帳單來自「每一輪重送的上下文」。Agent 越聊越長,成本是超線性成長的 —— 這個直覺錯誤會讓你的預算估算低得離譜。

打個比方

像影印店,但「你交給店家的稿子」和「店家印出來的成品」計價不同,成品每張更貴。Agent 的反直覺之處是:它每問一次,都要把之前整疊稿子連同新問題重新交一遍(重送上下文),所以第 50 輪那次「交付」,比第 1 輪貴得多 —— 即使問題本身只有一句話。

最小範例

一次 API 呼叫的帳單長這樣:
  輸入 token × 輸入單價     ← 你送進去的:系統提示 + 歷史 + 文件 + 這次問題
  輸出 token × 輸出單價     ← 模型吐出來的:通常單價比輸入高
  命中快取的輸入 × 折扣價   ← 重複的前綴(例如同一段系統提示)常有優惠

Agent 的成本陷阱(示意,非實際數字):
  第 1 輪送:系統提示 + 問題1
  第 2 輪送:系統提示 + 問題1 + 答1 + 問題2
  第 N 輪送:系統提示 + 前面所有問答 + 問題N
  → 每一輪都把「越來越長的歷史」重送一次
  → 成本隨對話長度「超線性」成長,不是線性

兩個實務結論:輸出通常比輸入貴,所以讓模型「少廢話、直接給結果」能省錢;而 Agent 的真正成本在重送的上下文,所以「上下文壓縮」「前綴快取」「適時開新對話」這些手段,省的才是大頭。

最常搞錯的地方

  • 以為成本主要來自「模型的回答」。對多輪 Agent,帳單大頭是每一輪重送的輸入上下文,不是輸出。
  • 以為成本隨對話長度「線性」成長。因為每輪都重送整個歷史,它其實是「超線性」(大約二次方)成長,長對話會突然變得很貴。
  • 只比「每 token 單價」就選定供應商。要算的是「你實際的輸入/輸出比例 + 快取命中率」下的總帳單;單價低但快取折扣差的方案,實際可能更貴。

相關詞條

下一步