Embedding(向量表示)
又稱:向量 · 嵌入 · 向量化 · embedding model
把一段文字變成一串數字,讓「意思相近」變成「數字上距離近」。
你會在什麼時候遇到它
語義搜索、RAG、相似內容推薦全部建立在它上面。不懂它,就沒辦法判斷檢索為什麼失敗。
打個比方
像把每個詞句放到一張巨大的地圖上,意思接近的落在附近。「資料庫連線失敗」和「DB 連不上」字面幾乎沒重疊,但在地圖上是鄰居。
最小範例
vec = embed("資料庫連線逾時")
# → [0.021, -0.114, 0.873, ...] 幾百到幾千個浮點數
similarity(vec_a, vec_b) # 餘弦相似度:1 = 幾乎同義,0 = 無關向量的每一維單獨看沒有意義,有意義的是「兩段文字的向量之間的距離」。
最常搞錯的地方
- 建索引和查詢用了不同的 embedding 模型。兩者的座標系不一樣,結果等於隨機。這是 RAG 最安靜也最致命的錯誤。
- 假設相似度高就是對的。向量找的是「像」,不是「真」。