工程進階 · 你現在能做什麼

別再「感覺變好了」:搭你的第一個評測集

前三格你都是靠眼睛驗收的,量小還行。但你馬上會遇到那個經典困境:改了一版提示詞,這三個用例變好了,那兩個悄悄變差了,你沒發現。Anthropic 説「不評測就是在裸奔」。這一格給你的 Agent 穿上衣服。

實戰主綫第四格:能幹活了,現在要讓每次改動都有據可依。
M0
想清楚它替你幹什麼
M1
能穩定説人話
M2
能動手幹活
M3
改好改壞能量化
M4
長跑不失憶
M5
過程可復現
先看清楚 · 同一次改動,五條用例各有各的命

評測集不神秘,就是一堆固定的輸入,各配一條「咩算過」的標準。神奇的地方在於跑分那一刻:你以為的全面提升,往往是三條升兩條降。沒有評測集,那兩條降的你永遠看不見。

改提示詞前後,跑同一套用例

#1
常規週報,三段結構正確
過
#2
帶數字的月報,數字全對
過
#3
超長文檔,漏掉了後半段的關鍵結論
掛
#4
短文檔,正常總結
過
#5
資訊缺失時編了一個數字
掛
3 / 5 條用例通過
第一版提示詞的基綫:3 / 5。長文檔和缺資訊這兩類用例掛了。記住這個數,它是後面所有改動的參照物。

評測的三個坑,這一章都講過

一是跑分時順手改用例。用例一改,前後分數就沒法比了,加用例可以,改用例要全量重跑基綫。

二是只看總分。4/5 比 3/5 好?先看掛的那條是不是原來能過的。

三是標準寫成「回答質素高」。這種標準沒法判定,要寫成「包含下週計劃」「數字與原文一致」這種一眼能裁決的句子。判不了的,才輪到 LLM-as-Judge 出場。

動手清單 · 挑一個開始,勾掉它

這一章的動手清單

0 / 3 已完成

攢 10 條真實用例

15 分鐘 所有人

從你真實用過的輸入裏挑 10 條存進一個檔案,一行一條。配比有講究:七條日常、三條刁鑽。刁鑽的就從 M1 五連跑和 M2 卡死記錄裏撈,那些讓它翻過車的輸入最值錢。

什麼算做完了
檔案存在、10 條都是真實輸入(不是你現編的),其中至少 2 條是它翻過車的。

給每條寫通過標準,跑出基綫分

1 小時 想讓改動有據可依

每條用例配一句「咩算過」,必須寫成一眼能裁決的形式:「輸出恰好三段」「結論裏包含 XX」「沒有編造原文以外的數字」。寫完把 10 條全跑一遍,記下第一個基綫分。

什麼算做完了
任何人拿着你的標準和輸出,判的結果都跟你一樣。基綫分記下來了,比如 6 / 10。

改一版提示詞,用分數説話

半天 要持續迭代

針對掛掉的用例改一版提示詞,用例一條不動,全量重跑對比。重點盯兩處:總分變了多少、有沒有原來過的用例反而掛了。有退化不丟人,把退化那條和原因記下來。你已經在做 Anthropic 説的那套正經工程了。

什麼算做完了
你能講出一句這樣的話:「呢版改動令分數從 6/10 到 8/10,代價係 #4 從過變掛,原因係新規則太保守。」説得出這句話,M3 就立住了。

把基綫分記進建造日誌

M3 要記的是:評測集放在哪、基綫分多少、第一次對比跑出了什麼結論。從這格開始,你説「變好了」的時候手裏是有數字的。

去填 M3