Agent 工程
從檢索到 RAG
Search 返回“可能相關的片段”,RAG 還要把它們變成有來源、有邊界、能被評測的回答依據。
本課在哪一層:向量檢索的入門在本主題前面的長期記憶:向量檢索,RAG 的產品視角在第一篇章的RAG 檢索增強生成與RAG 的代價與優化策略。本課不重複這些基礎,只講 Milvus 檢索如何進入可靠的 RAG 鏈路;把檢索封成 Agent 工具則在第四篇章的Milvus 作為 Agent 知識庫工具。
線上鏈路
1
Embed Query
用寫入時同一個模型編碼問題。
2
Retrieve
租戶/權限過濾 + Top-K 向量檢索。
3
Rerank
精排、去重,並控制上下文 Token。
4
Generate
要求模型只依據證據回答並給出來源。
離線攝取決定了線上上限
切分
按標題、段落和語義邊界切 chunk,保留少量 overlap。太大噪聲多,太小上下文斷裂。
中繼資料
儲存 source_id、版本、章節、租戶、ACL 與更新時間。引用、過濾和刪除都依賴它。
版本
內容或 Embedding 模型變化要重算;藍綠 collection 切換可避免新舊向量混用。
檢索品質工具箱
| 方法 | 解決什麼 | 注意 |
|---|---|---|
| 標量 Filter | 租戶、權限、時間、語言約束 | 權限必須在檢索階段執行,不能只靠 Prompt |
| 向量 + 關鍵詞混合檢索 | 兼顧語義、產品型號、錯誤碼等精確詞 | 兩種分數尺度不同,不宜直接相加 |
| RRF 融合 | 按排名融合多路結果 | 簡單穩健;再用 reranker 精排候選 |
| Partition / TTL | 隔離熱點或清理過期資料 | 屬於擴充能力,先用清晰的 collection 與 filter 設計 |
評測分兩層:先測檢索 Recall@K、MRR / nDCG 與過濾正確性,再測答案的忠實度、引用準確率和拒答率。只看“回答像不像”會掩蓋召回失敗。
收穫 RAG 不是“搜到就塞”。切分、中繼資料、權限過濾、融合與引用共同決定檢索增強是否可靠。