幻覺與應對
應對 4:評測 + 人工審核
PM 視角:如何量化幻覺風險、設計分級審核流程、讓「人在迴路中」成為產品安全網。手段 04 / 04 · 檢測 + 糾正。
PM 需要設計的三個環節
環節 1 · 上綫前
評測基綫:建立幻覺測試集
用一批已知正確答案的問題測試模型,量化幻覺率,設定準入門檻。
環節 2 · 上綫後
分級審核:高風險內容人工把關
按風險等級自動路由:低風險直接發出,高風險先人工審核再發送。
環節 3 · 持續優化
錯誤回饋閉環:用綫上數據迭代
把審核中發現的幻覺案例收集為 Bad Case,反哺模型優化和 Prompt 調整。
PM 核心認知
PM 核心認知
幻覺率 ≠ 0:所有 LLM 都有幻覺,PM 的目標是把它控制在業務可接受的閾值內,追求消滅並不現實。
高風險 = 人工兜底:醫療、法律、金融場景,AI 只做初稿,最終確認必須有人簽字。
指標要寫進 PRD:「幻覺率 < 3%」要像「載入時間 < 2s」一樣,成為可量化的驗收標準。