Model Format(模型檔案格式)
又稱:GGUF · safetensors · MLX · 模型格式 · 模型檔案格式
模型權重在硬碟上的封裝方式:GGUF、safetensors、MLX 等各是一種盒子,而每個執行環境只認得它支援的那幾種。
你會在什麼時候遇到它
你第一次從 Hugging Face 或社群下載模型、想在 Ollama、LM Studio 或自己的程式裡跑的時候會撞到它:下錯格式,輕則工具說「找不到模型」,重則噴出一堆形狀錯誤,你以為是自己程式寫爛了。認得「格式 ↔ 執行環境」的對應關係,是本機跑模型的第一道門檻。
打個比方
像影片檔的容器格式:同一部電影可以是 MKV、MP4、AVI。內容(權重)大致相同,但你的播放器只吃其中幾種 —— 電影沒有壞,是盒子不對。轉檔工具有時能救,但它們有支援範圍,而且已經量化過的檔案轉來轉去只會越轉越糟。
最小範例
同一個模型的三種常見包裝:
model.safetensors PyTorch 生態、vLLM 等伺服器框架
(通常未量化;權重與 metadata 分開存放)
model-Q4_K_M.gguf llama.cpp 系:Ollama、LM Studio
(單一檔案自帶 tokenizer,檔名就標了量化等級)
MLX 版本 Apple Silicon 的 MLX 生態
下載前先問一句:我要用的那個工具,吃哪一種?注意 GGUF 的檔名通常直接寫著量化等級(Q4、Q5、Q8 等)—— 格式與量化是綁在一起出現的,這也是為什麼「下錯檔案」和「下錯精度」常常是同一個錯誤。safetensors 的設計目標之一是安全載入:不像舊的 pickle 格式,載入時不會執行任意程式碼。
最常搞錯的地方
- 在 A 工具的下載頁拿連結,塞給 B 工具用,然後除錯半天。格式不對就是不對 —— 先確認你的執行環境支援什麼,再去找對應的檔案;順序反過來做,會浪費大量下載和除錯時間。
- 以為不同格式代表不同模型、或某種格式「本質比較好」。多數情況是同一份權重的不同封裝,差別在生態支援、量化選項和載入效率 —— 選格式要跟著你的執行環境走,不是跟著優劣排行榜走。