Agent 工程

從檢索到 RAG

Search 返回“可能相關的片段”,RAG 還要把它們變成有來源、有邊界、能被評測的回答依據。

本課在哪一層:向量檢索的入門在本主題前面的長期記憶:向量檢索,RAG 的產品視角在第一篇章的RAG 檢索增強生成與RAG 的代價與優化策略。本課不重複這些基礎,只講 Milvus 檢索如何進入可靠的 RAG 鏈路;把檢索封成 Agent 工具則在第四篇章的Milvus 作為 Agent 知識庫工具。
在綫鏈路
1

Embed Query

用寫入時同一個模型編碼問題。

2

Retrieve

租户/權限過濾 + Top-K 向量檢索。

3

Rerank

精排、去重,並控制上下文 Token。

4

Generate

要求模型只依據證據回答並給出來源。

離綫攝取決定了綫上上限

切分

按標題、段落和語義邊界切 chunk,保留少量 overlap。太大噪聲多,太小上下文斷裂。

元數據

保存 source_id、版本、章節、租户、ACL 與更新時間。引用、過濾和刪除都依賴它。

版本

內容或 Embedding 模型變化要重算;藍綠 collection 切換可避免新舊向量混用。

檢索質素工具箱
方法 解決什麼 注意
標量 Filter 租户、權限、時間、語言約束 權限必須在檢索階段執行,不能只靠 Prompt
向量 + 關鍵詞混合檢索 兼顧語義、產品型號、錯誤碼等精確詞 兩種分數尺度不同,不宜直接相加
RRF 融合 按排名融合多路結果 簡單穩健;再用 reranker 精排候選
Partition / TTL 隔離熱點或清理過期數據 屬於擴展能力,先用清晰的 collection 與 filter 設計
評測分兩層:先測檢索 Recall@K、MRR / nDCG 與過濾正確性,再測答案的忠實度、引用準確率和拒答率。只看“回答像不像”會掩蓋召回失敗。
收穫 RAG 不是“搜到就塞”。切分、元數據、權限過濾、融合與引用共同決定檢索增強是否可靠。