Agentic Research

Token(詞元)

又稱:詞元 · tokens

模型處理文字的最小單位。不是字,也不是詞。

你會在什麼時候遇到它

上下文長度和帳單都是用 token 算的。用「字數」估算會低估,中文尤其低估得離譜。

打個比方

像樂高積木:模型不處理整棟房子,它處理一塊塊積木。同一棟房子,用大塊積木需要的塊數少,用小塊需要的多。

最小範例

"AI agents read files"
  → ["AI", " agents", " read", " files"]     4 個 token

"人工智能代理讀取檔案"
  → 通常 8~12 個 token(依 tokenizer 而異)

注意 " agents" 前面那個空格也算在 token 裡。同樣的意思,中文花的 token 通常比英文多。

最常搞錯的地方

  • 以為 token = 字。英文大約 1 token ≈ 0.75 個單詞;中文一個字往往就要 1 個以上 token。
  • 以為只有輸入要算錢。輸出通常比輸入貴,而 Agent 的輸出很長。

相關詞條

下一步