開源專題 · 大模型如何變小

湧現:能力為什麼會突然出現

模型越大越強,這句話聽起來很自然。真實情況要複雜一點。有些能力在模型小的時候接近零分,參數量跨過某個量級之後,短時間內就有了。這個現象叫湧現,它也是後面幾節所有矛盾的起點。

先説結論
能力隨參數量的增長,很多時候並不平滑。有一類任務,模型在很寬的規模區間裏成績一直貼着零,看上去毫無進展。等參數量跨過某個位置,成績在很短的區間內跳到可用水平。跳升之前,你從已有的數據點看不出後面會發生什麼。
兩條曲綫,形狀完全不同

把參數量放在橫軸,某項任務的成績放在縱軸,會看到兩種走勢。一種隨規模穩步抬升,每加一倍參數就多拿一點分。另一種在很長一段區間裏貼着地面,然後在某個位置突然抬頭。

閾值區間(示意) 100% 75% 50% 25% 0 1M 10M 100M 1B 10B 100B 1T 參數量(對數刻度) 任務成績
常規能力,隨規模穩步抬升 湧現能力,跨過閾值後跳升
上圖為示意,橫軸與縱軸的取值不對應任何具體模型或評測集。現象與曲綫形態參考 Wei et al., Emergent Abilities of Large Language Models, TMLR 2022(arXiv:2206.07682)。

麻煩的地方在左半段。跳升發生之前,這條曲綫和「這條路走不通」看起來一模一樣。手裏只有前半段數據的時候,沒有辦法外推出後面會不會抬頭,也沒有辦法預測抬頭的位置。目前也沒有一套理論能提前算出某項能力會在哪個規模出現。

這件事讀起來平淡,拖一遍才有感覺。下面把模型規模交給你,從 0.5B 一路往上推,看六項能力是怎麼一項一項亮起來的。

從最小拖到最大,注意燈不是一起亮的,是一項一項蹦出來的。
模型規模 0.5 B
0 / 6
上面的閾值為量級示意,取自公開研究與行業討論中被反覆引用的觀察,不是精確測量值。換架構、換訓練數據或換評測方式,這些位置都會明顯偏移。
六個被反覆提到的例子

下面這些能力都在公開研究和行業討論裏被當作湧現的例子。括號裏的規模只是量級參考。同一項能力換個架構、換批訓練數據、換種評測方式,位置就會明顯偏移。

多步數學推理
單步算術小模型也能做對一部分。要求它連着推好幾步再給答案,小模型的正確率長期貼着零。
約 10B 量級
多語言遷移
在英文語料上學會的推理方式,能用到訓練裏出現得很少的語種上。規模不夠的時候,換個語種成績就崩。
約 7B 量級
結構化輸出與工具調用
穩定吐出合法 JSON,按函式簽名填對參數類型。這項能力沒有被專門設計進去,是訓練完之後發現它有的。
約 7B 量級
思維鏈推理(CoT)
讓模型先寫出推理過程再給答案。這招在小模型上拿不到收益,有時還會把原本能答對的題帶偏。
約 100B 量級
理論心智(ToM)
判斷對話裏的另一個人掌握了哪些信息、會怎麼想。這一項的爭議最大,有研究把測試題改寫幾個字,能力就消失了。
爭議中
長對話角色一致性
幾十輪之後仍然守住設定好的身份、語氣和邊界,中途不跑偏,也不被用戶幾句話帶走。
約 13B 量級
思維鏈在約 100B 規模才出現明顯收益,見 Wei et al., Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, NeurIPS 2022(arXiv:2201.11903)。理論心智的相關報告見 Kosinski, arXiv:2302.02083(2023);同期 Ullman, arXiv:2302.08399 指出對任務做微小改寫後該表現即消失。其餘各項的參數量為量級參考,行業內沒有統一的權威閾值,請勿當作精確數字引用。核對日期 2026-08-07。
這件事在學術上還沒有定論
有一派研究認為,相當一部分「湧現」是評測指標造出來的假象。換一種打分方式,同一批模型在同一批題目上畫出來的曲綫會變成平滑上升。

論證是這樣的。多步數學題通常按「答案完全正確」判分,中間錯一步,整題算零。這種打分方式是離散的,它把模型的連續進步壓成了一個二值結果。模型從錯得離譜進步到只差最後一點,分數照樣是零。等它跨過最後那點門檻,分數才一次性從零跳起來。

把判分換成連續指標,比如逐個 token 看正確答案的對數概率,同一組實驗的曲綫就變成一條平滑上升的綫。跳變消失了,説明跳變來自尺子,模型本身一直在穩步變好。

離散指標

一次通過才算分。中間的進步全部記為零,最後集中兑現,看上去就是一次跳升。

連續指標

給部分正確也記分。同一批模型的進步被完整記錄下來,曲綫變成平滑上升。

Schaeffer, Miranda & Koyejo, Are Emergent Abilities of Large Language Models a Mirage?, NeurIPS 2023(arXiv:2304.15004)。該文主張湧現在很大程度上由研究者選擇的評測指標引發,採用非綫性或離散指標時出現跳變,改用綫性、連續指標後曲綫平滑。上面兩張迷你圖為原理示意,未取自原文數據。核對日期 2026-08-07。

這個反駁沒有把現象整個推翻。它説明的是一件更具體的事:看到一條階躍曲綫時,先確認階躍來自模型,還是來自你的尺子。對做產品的人來説,這個提醒比爭論本身有用。你的驗收標準如果是「一次跑通才算過」,那你在自己的數據上很大機會也會看到階躍。

對做產品的人意味着什麼
1

換更大的模型之前,先自己測一遍

跑分榜測的是通用任務,你的場景可能正好卡在某個閾值附近。換一檔規模也許立刻就通了,也許毫無變化。花半天做一個二三十條樣本的小測試集,用真實數據跑一遍,比讀十篇評測有用。

2

小模型做不到的事,別急着用提示詞硬湊

遇到怎麼改提示詞都做不對的任務,先換一檔規模試試。如果大一檔立刻就對了,那之前那些複雜提示詞只是在補規模的缺口。這類提示詞通常又長又脆,換個模型、換個版本就失效。

3

看到「突然會了」,也別急着下結論

上面那個爭議在自己的測試裏同樣成立。加一個寬鬆一點的判分口徑做交叉驗證,比如按步驟給分、按字段給分。兩把尺子都顯示跳升,這個結論才站得住。

一句話記住:規模是一個自變數,值得單獨測。它可能給你帶來沒預期過的能力,也可能什麼都不給。這件事只有在你自己的任務上才能問出答案。
接下來

湧現説明規模能換來能力。它同時留下一個問題:既然大模型更強,為什麼整個行業還在拼命把模型做小?把幾百 B 壓到幾 B,損失掉的正是這一節講的這部分東西。壓縮的收益是什麼,代價能不能接受,下一節從這個矛盾開始講。