首頁 / 標籤 / Latency
用一次真實的 API 呼叫拆解一個提問的完整鏈路:建立連線 35 毫秒、切詞微秒級、模型讀完整段問題 474 毫秒、逐字生成 380 毫秒——總計 854 毫秒。附完整可重現的量測方法,以及一個反直覺的結論:96% 的時間不在網絡,而在模型裡面。