零基礎入門 · 小白三千問
『跑分第一』的模型,為什麼用起來不行?
刷到「新模型霸榜」的新聞,興沖沖換過去,結果寫個週報還沒原來的順手。你沒用錯,榜單也沒造假,只是榜單測的和你要的,從來就沒對齊過。
一句話回答
榜單測的是考試,你要的是幹活。題庫會被刷、考綱未必含你的場景,跑分當參考就好。選模型最可靠的辦法是拿自己的活兒去試。
反轉演示 · 高分選手輸給了誰
下面是兩個虛構的模型:A 跑分 95,B 跑分 88,按榜單選肯定選 A。但是別急,點下面三個真實任務,看看它們各自的表現。
模型 A
95 分榜單排名靠前,新聞裏的常客
模型 B
88 分榜單成績平平,無人報道
三個任務試完了。結論呼之欲出:95 分和 88 分的差距,在你的日常任務裏可能根本感覺不到,甚至反過來。分數排的是考場座次,幹活好壞還得上手試。
為什麼會這樣 · 三個原因
刷榜
榜單題庫在網上流傳久了,難免混進模型的訓練數據。相當於考前背了答案:分數很好看,能力沒那麼多。這在圈內有個體面的説法,叫「數據污染」。
過擬合考試
廠商知道大家看榜,就專門朝着考點優化。就像應試教育裏的做題家:卷面成績頂尖,日常交流和動手能力反而可能被犧牲掉。
考綱不含你的場景
榜單考數學、考程式碼、考知識問答,但不考「懂你們行業」,也不考「安慰人」。你最在意的那門課,考綱裏可能壓根沒有。
什麼榜相對可信 · 認準真人盲測
也有相對可信的榜:真人盲測投票類。做法是把兩個模型的回答擺在一起,隱藏名字,讓大量真實用戶投票選哪個更好。這種榜沒有固定題庫可背,考官是活人,刷起來難度大得多。
但它也只是「相對」可信:投票的人未必和你幹同一行,大眾覺得好的回答風格,未必適合你的場景。想看國產模型在各種真實場景裏的實際表現,可以移步國產模型怎麼選那一頁。
自己怎麼選 · 建一套私人題庫
最可靠的評測機構是你自己。方法很土,但極其有效:從自己的工作裏攢 10 個真實問題,存成一個文檔。每次想換模型,把 10 道題跑一遍,好不好用一目瞭然。
私人題庫的攢法(示例)
- 挑最常幹的活:週報、方案、郵件,選你每週都要做的 3 件
- 挑最專業的活:帶上行業黑話和內部語境的問題,考它懂不懂你這行
- 挑翻過車的活:以前 AI 答砸過的問題,最能試出新模型的成色
- 留一道送分題再留一道刁鑽題:送分題都答不好的直接淘汰,刁鑽題用來拉開差距
- 答案好壞你説了算:你比任何榜單都清楚,什麼樣的輸出算「能交差」
這套題庫還有個隱藏好處:它會逼你想清楚自己到底需要 AI 幹什麼。很多人換了三個月模型,最後發現真正的問題是提示詞沒寫好。題庫在手,換模型五分鐘出結論,再也不用追着新聞跑。
✅ 這一頁想和你分享的
- 跑分是入學考試,你要的是試用期表現:兩件事相關,但相關得有限
- 高分可能是背過題:題庫會泄漏進訓練數據,考點會被針對性優化
- 真人盲測投票的榜相對可信:沒有固定題庫,考官是活人
- 建一套自己的十題小考卷:換模型跑一遍,五分鐘出結論,比追新聞管用