Agentic Research

LLM(大型語言模型)

又稱:大模型 · 大型語言模型 · foundation model · 大語言模型

一個被訓練來預測「下一個 token」的神經網路。它只會輸出文字。

你會在什麼時候遇到它

所有 AI 工具的核心都是它。理解「它只是在預測下一個 token」,你就理解了一半的 AI 出錯原因。

打個比方

像一個讀過極多文字、接話能力極強的人:你說上半句,它能講出最像下半句的東西。它講得像不像,跟它知不知道,是兩件事。

最小範例

輸入:「臺灣最高峰是」
模型內部:對詞彙表裡每個 token 算一個機率
輸出:機率最高的那個 → 「玉山」

然後把「玉山」接回輸入,再算下一個 → 一直重複到結束

整個生成過程就是這個迴圈。它沒有「查資料」這個動作,除非外面有程式幫它查。

大模型運算:prefill 與 decode 兩個階段流程圖:生成其實分兩個階段。第一階段 prefill 把整段提示一次平行處理,把每個 token 的 K 與 V 存進 KV cache,這段是 compute-bound,決定了 TTFT(首字延遲)。第二階段 decode 一次只產一個 token:讀 cache、做一次 forward、把新 token 附回 cache,再重複,直到模型吐出 EOS 或撞到輸出上限;這段是 memory-bandwidth-bound,決定了 tokens/second。底部的時間軸說明兩段瓶頸不同,所以縮短提示救的是 TTFT,讓模型少廢話救的是總時間。階段一 · PREFILL(整段提示,一次平行處理)你幫我解釋這段… 共 N 個 token一次 forward pass,全部 token 同時算compute-bound:瓶頸在算力,所以提示越長這段越久KV cache每個 token 的 K 與 V,算過就存起來prefill 的結果存進 cache階段二 · DECODE(一次只產一個 token,重複到結束)讀 cache + 新 tokenmemory-bandwidth-bound產出 1 個 token並 append 回 cache剛產出的 token 變成下一步的輸入 —— 這就是 autoregressive停下來只有兩種原因:模型吐出 EOS,或撞到 max output 上限使用者實際感受到的時間TTFT ← 由提示長度決定tokens/second ← 由輸出長度決定兩段瓶頸不同,所以優化手段也不同:縮短提示(或做前綴快取)救 TTFT;讓模型少廢話救總時間。把兩者混成一個「速度」數字,就會優化錯地方。
1/8輸入:一整段提示
系統提示、歷史、文件、這次的問題,全部拼成一個 token 序列送進去。
第 1 步,共 8 步 輸入:一整段提示

最常搞錯的地方

  • 以為模型會「上網查」。原生 LLM 不會;能查是因為外面接了工具。
  • 以為它知道自己不確定。它輸出的是最像答案的文字,不是帶信心標記的答案。

相關詞條

下一步