Agentic Research

Multimodal(多模態)

又稱:多模態 · 多模態模型 · 視覺模型 · vision model · VLM · 圖片理解

模型能處理文字以外的輸入(圖像、音訊、影片)—— 這些內容會被轉成模型能讀的表示,和文字共用同一段上下文。

你會在什麼時候遇到它

當你第一次想「傳張截圖讓 AI 看」、或在模型清單上分辨哪些能收圖哪些不能時會遇到。不懂它,你會把兩件事搞混:以為所有聊天模型都能看圖(送出後才發現報錯,或更糟 —— 它假裝看見了);或以為「能看圖」的模型也「會畫圖」—— 理解與生成往往是兩套不同的機器。

打個比方

原生多模態像天生能看能聽的人:所有感官訊號進同一個大腦一起思考。外掛式則像一位看不見的人靠著同伴口述畫面:口述得好,日常夠用;但空間關係、圖上的小字這類細節,很容易在轉述中丟掉。

最小範例

// 一張圖+一句話的請求(OpenAI 風格 API,示意)
{
  "role": "user",
  "content": [
    { "type": "text",      "text": "這張報表哪裡異常?" },
    { "type": "image_url", "image_url": { "url": "data:image/png;base64,..." } }
  ]
}
// 圖像會被編碼成一串「視覺 token」,
// 和文字一起佔用上下文視窗的額度,也一起計費。

要看的是最後兩行:圖片不是「附在旁邊」的,它被換算成 token 併入同一段上下文 —— 一張高解析度的圖可能吃掉可觀的額度。這解釋了為什麼傳圖的請求又貴、又容易頂到上下文上限。

最常搞錯的地方

  • 以為「支援多模態」是一個總開關。其實每種模態、每個方向(輸入/輸出)都是獨立能力:能讀圖不等於能生成圖,能聽語音不等於能用語音回答 —— 看規格要逐項確認,而不是看有沒有「多模態」三個字。
  • 以為外掛一個視覺編碼器就和原生多模態一樣。外掛式的視覺資訊要經過一層「翻譯」才進到語言模型,跨模態的細粒度推理(精確讀小字、複雜空間關係、影片裡的連續動作)通常明顯較弱。

相關詞條

下一步