RAG 與知識系統

向量檢索與 embedding 是什麼?用企業語意搜尋的實例講清楚原理

員工搜尋「保單到期沒繳錢會怎樣」,系統回傳零筆——文件明明就在,只是標題寫「寬限期與契約停效」。這是關鍵字搜尋的天花板。這篇用一個真實踩過的場景,把向量檢索與 embedding 是什麼講清楚:它如何把「語意」壓成電腦能算的座標,又為何是決定整個 RAG 系統品質的第一道關卡。

作者

Tenten AI 研究團隊

AI 基礎設施

发布日期

2026年1月5日

阅读时间

6 分鐘

向量檢索embedding語意搜尋RAG企業知識系統AI檢索

一句話先講定義:向量檢索 (vector retrieval) 是把文字先用 embedding 模型轉成一串代表「語意座標」的數字向量,再靠計算向量之間的距離,找出「意思最接近」而非「字面最相同」的內容。 而 embedding,就是那個把一句話、一段文件、甚至一張圖翻譯成向量的過程。

這句話有點抽象。我們用一個真實踩過的場景把它攤開。

為什麼關鍵字搜尋會漏掉答案

去年一家保險客戶的內部知識庫,員工在搜尋框打「保單到期沒繳錢會怎樣」,系統回傳零筆。文件明明存在,標題叫「寬限期與契約停效處理原則」。

問題出在:傳統關鍵字搜尋 (keyword search) 比對的是「字」。使用者打的字裡沒有「寬限期」「停效」,文件裡也沒有「沒繳錢」,兩邊字面不重疊,引擎就認定不相關。它不懂「到期沒繳錢」和「寬限期停效」講的是同一件事。

這不是 bug,是關鍵字檢索的天花板。它靠 TF-IDF、BM25 這類演算法算「詞頻」,本質上是在數字面重合度。同義詞、口語、換句話說,它一律當陌生人。

向量檢索 embedding 是什麼:把語意變成可比對的座標

語意搜尋 (semantic search) 換了一條路。它不比字,比「意思」。

具體怎麼做?先讓 embedding 模型讀「保單到期沒繳錢會怎樣」,吐出一串向量,例如 1,536 個數字;再讓同一個模型讀那份「寬限期與契約停效」文件,也吐出一串向量。這兩串數字在一個高維空間裡的位置會非常接近,因為模型在海量語料裡學過:這些詞經常出現在相似的上下文,語意相關。

於是檢索就變成一道幾何題:算兩個向量的夾角 (餘弦相似度),角度越小、代表意思越近。使用者那句口語問題,即使一個關鍵字都沒對上,照樣能撈出正確文件。

這就是 embedding 的核心價值——它把「語意」這種模糊的東西,壓縮成電腦能直接做數學運算的座標。意思相近的內容,向量就靠得近;意思無關的,離得遠。搜尋從「找一樣的字」升級成「找一樣的意思」。

兩種檢索,並排看差異

面向關鍵字搜尋向量 / 語意搜尋
比對對象字面詞彙是否重合embedding 向量的語意距離
底層方法BM25、TF-IDF 詞頻統計神經網路 embedding + 相似度計算
同義詞 / 口語對不上就漏意思接近就能命中
「保單到期沒繳錢」→「寬限期停效」零筆正確命中
精確代號 (料號、法條號)強,一字不差反而可能失準
建置成本低,現成引擎即可需 embedding 模型與向量資料庫

看到最後兩列了嗎?向量檢索不是全面碾壓。查「料號 A-8837」或「勞基法第 84 條之 1」這種精確代號,關鍵字搜尋反而更穩,因為那本來就該一字不差。所以生產環境我們幾乎都跑混合檢索 (hybrid),語意向量負責理解意圖,關鍵字負責鎖定精確詞,再把兩邊分數融合排序。

為什麼這是 RAG 檢索品質的根本

講到這裡,得把 embedding 拉回 RAG (檢索增強生成) 的脈絡。

RAG 的運作是:使用者提問→系統從企業知識庫檢索相關片段→把片段連同問題塞給大型語言模型→模型根據這些真憑實據生成回答。很多人把注意力全放在後半段的模型多聰明,卻忽略一件事——模型只能根據「檢索階段撈給它的東西」作答。

檢索撈錯,模型再強也只是把錯的資料講得很通順。這就是所謂 garbage in, garbage out,在 RAG 裡尤其致命,因為它會生出一段自信、流暢、卻是錯的回答。

而檢索撈得準不準,第一道關卡就是 embedding 品質。用了不理解中文語意的模型、切文件 (chunking) 的方式把一個完整概念切兩半、或是沒針對產業術語微調,向量座標就會失真,語意相近的文件在空間裡反而離得老遠。前端問答再怎麼優化 prompt 都補不回來。所以我們常說:RAG 的天花板,在 embedding 這一層就先決定了大半。

實務上,我們接手一個知識系統,第一件事往往不是換更貴的生成模型,而是回頭盤 embedding 模型選型、重切 chunk、補上混合檢索,再用客戶真實的問句去量「該撈到的文件有沒有進前五名」。Demo 裡答對三題不算數,員工每天亂七八糟地問、系統還能穩定撈對,那條檢索管線才算真的上線。

AI 工作流,
长在你的运营里

我们以 FDE 与 FDM 进驻,打造你团队每天依赖的 AI Agent 与工作流——数周上线,而非数季。