如何評估 AI Agent 供應商?企業採購前的 12 個 RFP 問題清單
半年前簽的 agentic 系統,Demo 那天全場鼓掌,半年後實際使用率是零。問題不在技術,在採購當天問錯了問題。這份可直接複製的 12 題 RFP 清單,專門用來戳破「Demo 很美但上不了線」的供應商話術——把能力、整合、可控、維運四道裂縫逼到檯面上。
작성자
Tenten AI 研究團隊
應用 AI
게시일
2026년 3월 3일
읽는 시간
5 分鐘

上季末,一家製造業客戶找我們去做「第二意見」。他們半年前簽了一套 agentic 自動化系統,供應商 Demo 那天,Agent 流暢地讀單、比價、開採購單,全場鼓掌。半年後我到現場,那個 Agent 真正被用在生產流程的比例是零。不是零附近,是零。系統躺在測試環境,沒人敢把它接上正式 ERP。
問題不在技術,在採購當天問錯了問題。大家都在問「它能做什麼」,沒人問「它上不了線的時候,是誰的責任」。
所以這篇我把我們替客戶做 AI Agent 供應商評估時,實際用的 RFP 問題整理出來。你可以直接複製進你的招標文件。這 12 題的設計邏輯只有一個:把「Demo 很美」和「能上生產」之間那道裂縫,逼到檯面上。
為什麼多數 AI Agent 供應商評估都問錯方向
一般的 RFP 長這樣:功能清單、模型參數、API 數量、報價。這些欄位供應商填起來得心應手,因為那正是他們準備好要秀給你看的東西。
但 agentic 系統真正的成本不在功能,在三個地方:它連不連得上你那套十年沒動過的舊系統、它出錯時你救不救得回來、以及上線後半年沒人維護時它會不會悄悄崩壞。這三件事,Demo 一律不會演給你看。
我們把 RFP 分成四個象限來戳破話術:
| 評估象限 | 供應商愛談的 | 你真正該問的 | 上不了線的訊號 |
|---|---|---|---|
| 能力 | 模型多強、功能多全 | 在你的真實資料上跑的準確率 | 只給通用 benchmark,不給你的資料試 |
| 整合 | 有幾百個 connector | 接你的舊系統要改多少 | 「這要另外評估」就閃避 |
| 可控 | AI 很聰明 | 出錯怎麼攔、誰負責 | 沒有人工介入設計 |
| 維運 | 上線很快 | 上線後誰顧、怎麼改 | 交付即結案,沒有採用指標 |
12 個 RFP 問題清單(可直接複製)
關於能力與真實表現
-
請用「我方提供的真實資料樣本」跑一次任務,並提供準確率與失敗案例,而非通用 benchmark 數字。
-
這個 Agent 在什麼情況下會做錯?請列出三種已知的失敗模式,以及你們如何偵測它們。
-
當任務超出 Agent 能力範圍時,系統的行為是什麼——是拒絕、是升級給人、還是硬著頭皮亂答?
關於整合與資料
-
要接上我方現有的 ERP/CRM/內部系統,具體需要哪些改動、由誰執行、預估多少工時?請寫進報價,不要列為「另計」。
-
我方的資料會流經哪些環節、儲存在哪、是否用於訓練你們的模型?請提供資料流向圖。
-
若我方三年後想更換底層模型或供應商,資料與流程的可攜性如何?會不會被鎖死?
關於可控與責任
-
系統在哪些決策點設有人工審核(human-in-the-loop)?請展示實際的介入介面,不是投影片。
-
Agent 執行的每一步是否可追溯、可稽核?出事後我方能否重建它當時的判斷依據?
-
當 Agent 造成實際損失(開錯單、回錯客戶),合約上的責任歸屬與賠償條款是什麼?
關於上線與採用
-
從簽約到「有真實使用者每天在用」,你們承諾的時程與里程碑是什麼?逾期如何處理?
-
上線後的採用率(實際使用人數/應使用人數)你們是否納入驗收標準?低於門檻時怎麼辦?
-
交付後的六個月,誰負責調整 prompt、更新流程、處理模型漂移?這是內含服務,還是要另簽維運合約?
怎麼用這份清單
不要當成問答題,當成篩子。
真正能上線的供應商,聽到第 1、第 4、第 11 題會眼睛一亮,因為那正是他們花力氣做的事;只會做 Demo 的,會開始閃、開始說「這要看情況」「上線後再評估」。第 9 和第 12 題最好用——願意把責任和維運寫進合約的,通常真的做過生產案;含糊帶過的,八成沒扛過上線。
一個提醒:這 12 題會嚇跑一部分供應商,這是好事。RFP 的目的不是收到最多回覆,是讓不敢承諾上線的人自己退場。
我們在 Tenten 幫客戶選型時,其實把自己也放進同一張篩子——因為我們做的就是 FDE 前線部署,工程師進場把 Agent 扛到上線、盯著採用率跑起來。對我們來說,第 11 題那個數字不是驗收欄位,是整個案子成不成的唯一標準。Demo 很美不算數,有人天天在用才算數。
