Multimodal(多模態)
又稱:多模態 · 多模態模型 · 視覺模型 · vision model · VLM · 圖片理解
模型能處理文字以外的輸入(圖像、音訊、影片)—— 這些內容會被轉成模型能讀的表示,和文字共用同一段上下文。
你會在什麼時候遇到它
當你第一次想「傳張截圖讓 AI 看」、或在模型清單上分辨哪些能收圖哪些不能時會遇到。不懂它,你會把兩件事搞混:以為所有聊天模型都能看圖(送出後才發現報錯,或更糟 —— 它假裝看見了);或以為「能看圖」的模型也「會畫圖」—— 理解與生成往往是兩套不同的機器。
打個比方
原生多模態像天生能看能聽的人:所有感官訊號進同一個大腦一起思考。外掛式則像一位看不見的人靠著同伴口述畫面:口述得好,日常夠用;但空間關係、圖上的小字這類細節,很容易在轉述中丟掉。
最小範例
// 一張圖+一句話的請求(OpenAI 風格 API,示意)
{
"role": "user",
"content": [
{ "type": "text", "text": "這張報表哪裡異常?" },
{ "type": "image_url", "image_url": { "url": "data:image/png;base64,..." } }
]
}
// 圖像會被編碼成一串「視覺 token」,
// 和文字一起佔用上下文視窗的額度,也一起計費。要看的是最後兩行:圖片不是「附在旁邊」的,它被換算成 token 併入同一段上下文 —— 一張高解析度的圖可能吃掉可觀的額度。這解釋了為什麼傳圖的請求又貴、又容易頂到上下文上限。
最常搞錯的地方
- 以為「支援多模態」是一個總開關。其實每種模態、每個方向(輸入/輸出)都是獨立能力:能讀圖不等於能生成圖,能聽語音不等於能用語音回答 —— 看規格要逐項確認,而不是看有沒有「多模態」三個字。
- 以為外掛一個視覺編碼器就和原生多模態一樣。外掛式的視覺資訊要經過一層「翻譯」才進到語言模型,跨模態的細粒度推理(精確讀小字、複雜空間關係、影片裡的連續動作)通常明顯較弱。
相關詞條
下一步
- 本站 Agent & 模型矩陣34 min