Agent 評測

三種 Grader:程式碼、模型、人工

Grader 是評測系統的裁判。選錯了 Grader,評測結果就不可信。生產環境的經驗表明,三種 Grader 組合使用,各取所長。沒有銀彈,但有最優組合。

Grader 1:程式碼評判器

程式碼 Grader

用程式邏輯自動判定對錯
維度 詳情
方法 字串匹配、正規表示式、靜態分析(AST)、單元測試 pass/fail、工具呼叫驗證(是否呼叫了正確的 API 和參數)
優點 速度快(毫秒級)、成本幾乎為零、結果完全客觀可復現、適合 CI/CD 自動化
缺點 對合理變體過於嚴格(比如變數名不同就判錯)、缺乏語義理解、無法評判主觀品質
適用場景 有明確正確答案的任務:程式碼編譯是否通過、API 回傳值是否正確、檔案格式是否合規、數學計算是否準確
Grader 2:模型評判器(LLM-as-Judge)

模型 Grader(LLM-as-Judge)

讓另一個 LLM 按評分標準打分
維度 詳情
方法 將 Agent 的輸出和評分 Rubric 一起交給一個評委 LLM,讓它按預設標準給出分數和理由
優點 能評判主觀品質(文筆、邏輯性、創造力)、能理解意圖而超越字面匹配、靈活適應不同任務類型
缺點 成本較高(每次評判都消耗 token)、可能存在評分偏見、需要精心設計評分標準、結果不完全可復現
適用場景 開放式任務:研究報告的品質評判、程式碼風格評估、對話的自然度、摘要的完整性和準確性
關鍵技巧:Rubric 要具體到每一分
模糊的標準如「給輸出品質打 0-1 分」幾乎沒用。好的 Rubric 應該明確:
0 分 = 完全沒有回答問題,或包含嚴重事實錯誤
0.3 分 = 回答了問題但遺漏關鍵資訊
0.7 分 = 回答完整準確,但組織混亂或有冗餘
1 分 = 完整、準確、簡潔、結構清晰
Grader 3:人工評判器

人工 Grader

由領域專家直接評判
維度 詳情
何時用 評測初期校準評分標準、LLM 評判出現明顯盲點時、需要領域專家判斷的高風險場景(醫療、法律、金融)
優點 最高品質的回饋、能發現自動化方法的盲區、提供改進方向的深度洞察
缺點 不可擴展(人的時間有限)、速度慢(小時級到天級)、成本高、評判者之間也有分歧
適用場景 定期抽檢校準模型 Grader 的準確度、全新場景的評測標準建立、關鍵產品決策的最終驗證
混合策略:推薦流程
三層評判體系
1
程式碼 Grader 打底
先覆蓋所有確定性場景:編譯通過、格式正確、API 呼叫準確。快且便宜。
2
模型 Grader 擴充
覆蓋主觀場景:輸出品質、邏輯性、使用者體驗。設計好 Rubric 是關鍵。
3
人工定期校準
定期抽檢模型 Grader 的評分是否漂移,修正偏見,確保評測體系可信。
核心邏輯:程式碼 Grader 保證底線(不出大錯),模型 Grader 提升上限(產出品質),人工 Grader 校準裁判(保證公正)。三者缺一不可。
真實案例
Descript
影片編輯 Agent
Descript 的評測體系圍繞三個維度展開,每個維度獨立打分,組合評估:
不破壞 -- 編輯後影片無損
做了該做的 -- 指令被正確執行
做得好 -- 剪輯品質專業
Bolt AI
程式碼生成 Agent
Bolt AI 組合了三類 Grader 形成完整評測鏈:

  • 靜態分析(程式碼 Grader):檢查生成程式碼是否編譯通過、lint 無錯誤
  • 瀏覽器 Agent 測試(程式碼 Grader):自動開啟生成的頁面,驗證 UI 是否符合預期
  • LLM Judge(模型 Grader):評判程式碼品質、可讀性、最佳實踐遵循度
沒有銀彈,三種 Grader 組合使用效果最好。程式碼 Grader 守底線、模型 Grader 提上限、人工 Grader 做校準,這是經過多個頭部 Agent 團隊驗證的最佳實踐。