Agent 評測
三種 Grader:程式碼、模型、人工
Grader 是評測系統的裁判。選錯了 Grader,評測結果就不可信。生產環境的經驗表明,三種 Grader 組合使用,各取所長。沒有銀彈,但有最優組合。
Grader 1:程式碼評判器
程式碼 Grader
用程序邏輯自動判定對錯
| 維度 | 詳情 |
|---|---|
| 方法 | 字串匹配、正則表達式、靜態分析(AST)、單元測試 pass/fail、工具調用驗證(是否調用了正確的 API 和參數) |
| 優點 | 速度快(毫秒級)、成本幾乎為零、結果完全客觀可復現、適合 CI/CD 自動化 |
| 缺點 | 對合理變體過於嚴格(比如變數名不同就判錯)、缺乏語義理解、無法評判主觀質素 |
| 適用場景 | 有明確正確答案的任務:程式碼編譯是否通過、API 返回值是否正確、文件格式是否合規、數學計算是否準確 |
Grader 2:模型評判器(LLM-as-Judge)
模型 Grader(LLM-as-Judge)
讓另一個 LLM 按評分標準打分
| 維度 | 詳情 |
|---|---|
| 方法 | 將 Agent 的輸出和評分 Rubric 一起交給一個評委 LLM,讓它按預設標準給出分數和理由 |
| 優點 | 能評判主觀質素(文筆、邏輯性、創造力)、能理解意圖而超越字面匹配、靈活適應不同任務類型 |
| 缺點 | 成本較高(每次評判都消耗 token)、可能存在評分偏見、需要精心設計評分標準、結果不完全可復現 |
| 適用場景 | 開放式任務:研究報告的質素評判、程式碼風格評估、對話的自然度、摘要的完整性和準確性 |
關鍵技巧:Rubric 要具體到每一分
模糊的標準如「給輸出質素打 0-1 分」幾乎沒用。好的 Rubric 應該明確:
0 分 = 完全沒有回答問題,或包含嚴重事實錯誤
0.3 分 = 回答了問題但遺漏關鍵信息
0.7 分 = 回答完整準確,但組織混亂或有冗餘
1 分 = 完整、準確、簡潔、結構清晰
0 分 = 完全沒有回答問題,或包含嚴重事實錯誤
0.3 分 = 回答了問題但遺漏關鍵信息
0.7 分 = 回答完整準確,但組織混亂或有冗餘
1 分 = 完整、準確、簡潔、結構清晰
Grader 3:人工評判器
人工 Grader
由領域專家直接評判
| 維度 | 詳情 |
|---|---|
| 何時用 | 評測初期校準評分標準、LLM 評判出現明顯盲點時、需要領域專家判斷的高風險場景(醫療、法律、金融) |
| 優點 | 最高質素的回饋、能發現自動化方法的盲區、提供改進方向的深度洞察 |
| 缺點 | 不可擴展(人的時間有限)、速度慢(小時級到天級)、成本高、評判者之間也有分歧 |
| 適用場景 | 定期抽檢校準模型 Grader 的準確度、全新場景的評測標準建立、關鍵產品決策的最終驗證 |
混合策略:推薦流程
三層評判體系
1
程式碼 Grader 打底
先覆蓋所有確定性場景:編譯通過、格式正確、API 調用準確。快且便宜。
2
模型 Grader 擴展
覆蓋主觀場景:輸出質素、邏輯性、用戶體驗。設計好 Rubric 是關鍵。
3
人工定期校準
定期抽檢模型 Grader 的評分是否漂移,修正偏見,確保評測體系可信。
核心邏輯:程式碼 Grader 保證底綫(不出大錯),模型 Grader 提升上限(產出質素),人工 Grader 校準裁判(保證公正)。三者缺一不可。
真實案例
Descript
影片編輯 Agent
Descript 的評測體系圍繞三個維度展開,每個維度獨立打分,組合評估:
不破壞 -- 編輯後影片無損
做了該做的 -- 指令被正確執行
做得好 -- 剪輯質素專業
Bolt AI
程式碼生成 Agent
Bolt AI 組合了三類 Grader 形成完整評測鏈:
- 靜態分析(程式碼 Grader):檢查生成程式碼是否編譯通過、lint 無錯誤
- 瀏覽器 Agent 測試(程式碼 Grader):自動打開生成的頁面,驗證 UI 是否符合預期
- LLM Judge(模型 Grader):評判程式碼質素、可讀性、最佳實踐遵循度
沒有銀彈,三種 Grader 組合使用效果最好。程式碼 Grader 守底綫、模型 Grader 提上限、人工 Grader 做校準,這是經過多個頭部 Agent 團隊驗證的最佳實踐。