什麼是 embedding 向量?用一張語意地圖講清楚向量檢索的底層原理
員工搜「車禍第三人責任」,三千份文件一筆都跳不出來,因為文件裡寫的是「交通事故對造求償」。同一件事,兩種說法,關鍵字就這樣失效。Embedding 向量把每段文字變成語意地圖上的一個座標,讓「意思相近」取代「字面相同」——這也是企業 RAG 知識系統的地基。這篇用一張地圖,講清楚向量檢索為何比關鍵字更準。
Auteur
Tenten AI 研究團隊
AI 基礎設施
Publié le
25 janvier 2026
Temps de lecture
5 分鐘

一句話定義:embedding 向量是什麼
Embedding 向量,就是把一段文字(或圖片、聲音)壓成一串數字座標,讓「意思相近的東西,座標也靠在一起」的技術。你可以把它想成一張語意地圖:每個詞、每句話、每份文件,在這張地圖上都有自己的位置。「解僱」和「資遣」離得很近,「解僱」和「香蕉」離得很遠。
一句話講完了。接下來真正的問題是——這張地圖,為什麼比關鍵字更好用。
關鍵字搜尋的天花板
先講一個我們踩過的場景。一家保險公司內部有三千份理賠作業文件,員工用內部搜尋找「車禍第三人責任」,結果一筆都跳不出來。文件明明在,只是裡面寫的是「交通事故對造求償」。同一件事,兩種說法,關鍵字搜尋直接失效。
關鍵字比對的本質是字面比對:你打的字,要和文件裡的字一模一樣(或事先建好同義詞表)才找得到。它不懂「對造」約等於「第三人」。中文尤其吃虧——斷詞、簡繁、專業黑話、部門內部縮寫,任何一個對不上,結果就是一片空白。
語意地圖怎麼解這題
Embedding 換了一個思路。它不比對字,而是比對「意思的座標」。
把那三千份文件全部丟進 embedding 模型,每一份都會拿到一組座標,一起攤在同一張語意地圖上。使用者輸入「車禍第三人責任」,這句話也被轉成一個座標點。系統要做的事變得很單純:在地圖上找離這個點最近的鄰居。
「交通事故對造求償」雖然一個字都沒對上,但因為講的是同一件事,座標就落在旁邊,自然被撈出來。這就是向量檢索(vector search)的底層原理:先把所有東西放上語意座標,再用「距離近」取代「字面同」。
關鍵字 vs 向量檢索
| 面向 | 關鍵字搜尋 | 向量檢索(embedding) |
|---|---|---|
| 比對方式 | 字面是否相同 | 語意座標是否相近 |
| 不同說法、同義詞 | 找不到,除非手動維護同義詞表 | 天生就能對上 |
| 中文斷詞、縮寫、黑話 | 容易失效 | 影響小 |
| 建置成本 | 低,幾乎開箱即用 | 需選模型、切塊、建索引 |
| 最適場景 | 精確代號、料號、法條編號 | 概念型、自然語言的提問 |
值得誠實講一句:向量檢索不是萬靈丹。要找「料號 A-3271」或某條法規編號這種精確字串,老實的關鍵字反而更穩、更快。兩者是互補,不是取代。
座標其實有幾百個維度
地圖是二維的,方便想像;真正的 embedding 座標,動輒 768、1536 個維度。維度越多,能區分的語意層次越細:同樣講「蘋果」,財經語境會靠近「財報、iPhone」,食譜語境會靠近「削皮、甜度」。系統判斷「近不近」,通常用向量之間的夾角(常見的 cosine 相似度)——角度越小,意思越接近。
決策者不必背這些數字。你只需要記住一個判斷:當員工的問法和文件的寫法永遠不會一模一樣時,字面搜尋就是不夠用,你需要的是語意座標。
這和 RAG、企業知識系統的關係
Embedding 是 RAG(檢索增強生成)的地基。RAG 讓大型語言模型回答前,先去企業自己的知識庫撈出相關資料,再根據這些資料作答;而「撈出相關資料」這一步,靠的正是向量檢索。地基沒鋪好——文件切塊切得亂、embedding 模型選錯、中文與專業術語沒對齊——上層的 AI 助理講得再流暢,引用的也可能是錯的段落。
我們幫客戶導入知識系統時,花最多力氣的往往不是模型本身,而是這張語意地圖鋪得準不準:文件怎麼切、用哪個 embedding 模型、中文和內部術語有沒有對齊。Demo 上答得漂亮不算數,員工每天搜得到、願意採用,這張地圖才算真的鋪好了。

Des workflows IA,
intégrés à vos opérations
Nous déployons nos équipes (FDE et FDM) pour bâtir les agents et workflows IA que vos équipes utilisent au quotidien. En production en quelques semaines, pas en trimestres.