Token(詞元)
又稱:詞元 · tokens
模型處理文字的最小單位。不是字,也不是詞。
你會在什麼時候遇到它
上下文長度和帳單都是用 token 算的。用「字數」估算會低估,中文尤其低估得離譜。
打個比方
像樂高積木:模型不處理整棟房子,它處理一塊塊積木。同一棟房子,用大塊積木需要的塊數少,用小塊需要的多。
最小範例
"AI agents read files"
→ ["AI", " agents", " read", " files"] 4 個 token
"人工智能代理讀取檔案"
→ 通常 8~12 個 token(依 tokenizer 而異)注意 " agents" 前面那個空格也算在 token 裡。同樣的意思,中文花的 token 通常比英文多。
最常搞錯的地方
- 以為 token = 字。英文大約 1 token ≈ 0.75 個單詞;中文一個字往往就要 1 個以上 token。
- 以為只有輸入要算錢。輸出通常比輸入貴,而 Agent 的輸出很長。