Agentic Research

Embedding(向量表示)

又稱:向量 · 嵌入 · 向量化 · embedding model

把一段文字變成一串數字,讓「意思相近」變成「數字上距離近」。

你會在什麼時候遇到它

語義搜索、RAG、相似內容推薦全部建立在它上面。不懂它,就沒辦法判斷檢索為什麼失敗。

打個比方

像把每個詞句放到一張巨大的地圖上,意思接近的落在附近。「資料庫連線失敗」和「DB 連不上」字面幾乎沒重疊,但在地圖上是鄰居。

最小範例

vec = embed("資料庫連線逾時")
# → [0.021, -0.114, 0.873, ...]  幾百到幾千個浮點數

similarity(vec_a, vec_b)   # 餘弦相似度:1 = 幾乎同義,0 = 無關

向量的每一維單獨看沒有意義,有意義的是「兩段文字的向量之間的距離」。

最常搞錯的地方

  • 建索引和查詢用了不同的 embedding 模型。兩者的座標系不一樣,結果等於隨機。這是 RAG 最安靜也最致命的錯誤。
  • 假設相似度高就是對的。向量找的是「像」,不是「真」。

相關詞條

下一步