Checkpoint(檢查點)
又稱:檢查點 · 狀態保存 · resume · 斷點恢復
把任務進行到一半的狀態存下來,讓工作在中斷後從這裡繼續,而不是從頭再來。
你會在什麼時候遇到它
任務一超過幾十分鐘 —— 深度調研、批次重構、部署流水線 —— 你就會遇到它:網路斷了、token 燒完了、你按了停止,或流程需要人來批准。沒有 checkpoint,任何中斷都等於全部重來:時間、token、已經做對的步驟,一起作廢。
打個比方
像電玩的存檔點:打 Boss 前先存檔,失敗就從存檔點重來,不必從第一關再打。沒有人覺得「每死一次都從頭玩一遍」合理,但很多人讓一個要燒幾小時 token 的 Agent 任務就這樣裸奔。
最小範例
一個調研任務的中斷與恢復(示意):
步驟 1 收集財報 ✅ 完成 → 結果寫入 work/step1.json
步驟 2 股權分析 ✅ 完成 → 結果寫入 work/step2.json
步驟 3 生成報告 ⛔ 中斷(API 超時)
恢復(resume): 讀 work/ 下已完成的步驟 → 只重跑步驟 3
重來(restart):三步全部從零開始,步驟 1、2 的 token 白燒關鍵是「狀態存在模型外面」:模型本身不會記住進度,checkpoint 必須落成檔案或資料庫記錄,恢復時重新組進上下文才有效。這跟 agent-memory 是同一個思路,只是存的東西不同 —— 一個存進度,一個存知識。
最常搞錯的地方
- 以為對話紀錄就是 checkpoint。紀錄保存的是「說過什麼」,不是「做到哪裡、中間產物在哪」。恢復需要的是可執行的狀態,不是聊天回放。
- 存得太稀疏。只在任務結尾存一次等於沒存 —— 中斷發生在兩個存檔點之間時,那一段照樣白做。存檔頻率要跟著「重跑的代價」走。