產業別 RAG 知識系統案例:金融、醫療、製造導入前後的量化成果拆解
很多企業買了 RAG,最後只換來一個沒人用的問答框。我們把金融、醫療、製造三個真實現場的前後數字攤開來看:工時省了多少、答對率從幾成拉到幾成、上線要幾週。重點不是模型多強,而是怎麼把 RAG 從 demo 扛到真的有人天天在用。
執筆
Tenten AI 研究團隊
AI 基礎設施
公開日
2025年12月19日
読了時間
5 分鐘

半年前我們接手一個保單條款查詢的案子。客戶前一年已經導入過一次 RAG,系統跑得起來,demo 那天答得漂亮,主管很滿意。我到現場時,理賠部門的實際使用率是 6%。
不是技術爛。是那套系統把三百多份保單、批註、法遵函釋全塞進同一個向量庫,問「這張舊保單的等待期怎麼算」時,它自信地引用了一份 2019 年已作廢的版本。答錯一次,人就不敢再問第二次。這就是 RAG 企業案例裡最常見的死法:不是不會答,是答得不夠可信,信任一崩,採用率歸零。
下面拆三個我們實際交付的場景,把導入前後的硬數字放在最前面。
三個 RAG 企業案例的量化成果
| 產業 | 場景 | 導入前 | 導入後 | 上線週期 |
|---|---|---|---|---|
| 金融 | 保單/法遵條款查詢 | 每案人工查找 18 分鐘,答對率約 62% | 平均 40 秒,答對率 94% | 9 週 |
| 醫療 | 臨床指引與用藥交互查詢 | 護理師平均查 3 個系統、6 分鐘 | 單一入口 50 秒,引用可溯源 | 11 週 |
| 製造 | 設備故障排除與 SOP 檢索 | 老師傅口耳相傳,新人上手 3 個月 | 現場掃碼問答,新人 3 週能獨立處理 8 成工單 | 8 週 |
數字看起來乾淨,但每一格背後都是一段把系統從「能跑」拉到「有人用」的過程。
金融:答對率不到 65%,問題不在模型
我們沒換模型,先做的是把知識庫按「效力狀態」重新切。作廢版本、生效版本、待生效版本各自打標籤,檢索時強制過濾失效文件,並且每個答案都附上出處段落與生效日期。理賠人員一眼能看到「這是根據 2023 年 3 月生效版第 4 條」,才敢直接採用。
答對率從 62% 拉到 94%,靠的不是更大的 context window,是把 300 份文件裡真正該被引用的那 20% 挑對。上線後三個月,查詢工時省下約 1,400 小時。使用率從 6% 爬到 71%,這才是我們真正在盯的數字。
醫療:可溯源比答得快更重要
醫療現場的容錯是零。護理師問用藥交互,系統答錯的代價不是重問一次,是病人安全。所以這個案子我們花最多力氣在「拒答」上——當檢索到的證據信心不足,系統會說「我查到兩份可能衝突的指引,請人工確認」,而不是硬湊一個答案。
聽起來反直覺:我們刻意讓它少答。但正是這個設計讓臨床端願意信任它。六分鐘、跨三個系統的查找,壓到單一入口 50 秒,每筆答案都能點回原始指引 PDF 的頁碼。醫院端最後同意把它掛進正式流程,關鍵不是速度,是每一句話都查得到來源。
製造:把老師傅腦袋裡的東西變成可檢索資產
這家工廠的痛點很典型:三位資深技師快退休,故障排除全靠經驗。我們做的不是掃描一堆 SOP PDF 就了事,而是把過去兩年的維修工單、LINE 群組對話、口述訪談整理成結構化知識,再建 RAG。
現場工人用平板掃設備 QR code 就能問「這台壓鑄機報 E07 怎麼處理」。新人獨立上手從 3 個月縮到 3 週。這裡我們踩過一個雷:一開始把非結構化的閒聊也丟進去,雜訊反而拉低答對率。後來加了一層人工審核的知識萃取,品質才穩定。RAG 不是把資料倒進去就好,前置的資料工程決定天花板。
demo 很美不算數
三個案子的共通點,不是用了多厲害的向量資料庫,而是我們有工程師蹲在客戶現場,盯著真實使用率、答錯的每一則 log、還有第一線願不願意再問第二次。這是我們一直相信的:demo 全場點頭不算交付,系統上線且有人天天在用,才算數。Tenten 做 RAG,交付的從來不是一個問答框,是一條被採用的工作流。

AI ワークフローを、
あなたの業務の中へ
FDE・FDM でチームに入り込み、現場が日々動かす AI エージェントとワークフローを構築します。数四半期ではなく、数週間で稼働。