零基礎入門 · 小白三千問

『跑分第一』的模型,為什麼用起來不行?

刷到「新模型霸榜」的新聞,興沖沖換過去,結果寫個週報還沒原來的順手。你沒用錯,榜單也沒造假,只是榜單測的和你要的,從來就沒對齊過。

一句話回答

榜單測的是考試,你要的是幹活。題庫會被刷、考綱未必含你的場景,跑分當參考就好。選模型最可靠的辦法是拿自己的活兒去試。

反轉演示 · 高分選手輸給了誰

下面是兩個虛構的模型:A 跑分 95,B 跑分 88,按榜單選肯定選 A。但是別急,點下面三個真實任務,看看它們各自的表現。

模型 A

95 分
榜單排名靠前,新聞裏的常客

模型 B

88 分
榜單成績平平,無人報道
三個任務試完了。結論呼之欲出:95 分和 88 分的差距,在你的日常任務裏可能根本感覺不到,甚至反過來。分數排的是考場座次,幹活好壞還得上手試。
為什麼會這樣 · 三個原因
📖

刷榜

榜單題庫在網上流傳久了,難免混進模型的訓練數據。相當於考前背了答案:分數很好看,能力沒那麼多。這在圈內有個體面的説法,叫「數據污染」。

🎯

過擬合考試

廠商知道大家看榜,就專門朝着考點優化。就像應試教育裏的做題家:卷面成績頂尖,日常交流和動手能力反而可能被犧牲掉。

🗺️

考綱不含你的場景

榜單考數學、考程式碼、考知識問答,但不考「懂你們行業」,也不考「安慰人」。你最在意的那門課,考綱裏可能壓根沒有。

什麼榜相對可信 · 認準真人盲測

也有相對可信的榜:真人盲測投票類。做法是把兩個模型的回答擺在一起,隱藏名字,讓大量真實用戶投票選哪個更好。這種榜沒有固定題庫可背,考官是活人,刷起來難度大得多。

但它也只是「相對」可信:投票的人未必和你幹同一行,大眾覺得好的回答風格,未必適合你的場景。想看國產模型在各種真實場景裏的實際表現,可以移步國產模型怎麼選那一頁。

自己怎麼選 · 建一套私人題庫

最可靠的評測機構是你自己。方法很土,但極其有效:從自己的工作裏攢 10 個真實問題,存成一個文檔。每次想換模型,把 10 道題跑一遍,好不好用一目瞭然。

私人題庫的攢法(示例)

這套題庫還有個隱藏好處:它會逼你想清楚自己到底需要 AI 幹什麼。很多人換了三個月模型,最後發現真正的問題是提示詞沒寫好。題庫在手,換模型五分鐘出結論,再也不用追着新聞跑。

✅ 這一頁想和你分享的