先說結論
能力隨參數量的增長,很多時候並不平滑。 有一類任務,模型在很寬的規模區間裡成績一直貼著零,看上去毫無進展。等參數量跨過某個位置,成績在很短的區間內跳到可用水準。跳升之前,你從已有的資料點看不出後面會發生什麼。
兩條曲線,形狀完全不同
把參數量放在橫軸,某項任務的成績放在縱軸,會看到兩種走勢。一種隨規模穩步抬升,每加一倍參數就多拿一點分。另一種在很長一段區間裡貼著地面,然後在某個位置突然抬頭。
常規能力,隨規模穩步抬升
湧現能力,跨過閾值後跳升
上圖為示意,橫軸與縱軸的取值不對應任何具體模型或評測集。現象與曲線形態參考 Wei et al., Emergent Abilities of Large Language Models, TMLR 2022(arXiv:2206.07682)。
麻煩的地方在左半段。跳升發生之前,這條曲線和「這條路走不通」看起來一模一樣。手裡只有前半段資料的時候,沒有辦法外推出後面會不會抬頭,也沒有辦法預測抬頭的位置。目前也沒有一套理論能提前算出某項能力會在哪個規模出現。
這件事讀起來平淡,拖一遍才有感覺。下面把模型規模交給你,從 0.5B 一路往上推,看六項能力是怎麼一項一項亮起來的。
從最小拖到最大,注意燈不是一起亮的,是一項一項蹦出來的。
上面的閾值為量級示意,取自公開研究與行業討論中被反覆引用的觀察,不是精確測量值。換架構、換訓練資料或換評測方式,這些位置都會明顯偏移。
六個被反覆提到的例子
下面這些能力都在公開研究和行業討論裡被當作湧現的例子。括號裡的規模只是量級參考。同一項能力換個架構、換批訓練資料、換種評測方式,位置就會明顯偏移。
單步算術小模型也能做對一部分。要求它連著推好幾步再給答案,小模型的正確率長期貼著零。
約 10B 量級
在英文語料上學會的推理方式,能用到訓練裡出現得很少的語種上。規模不夠的時候,換個語種成績就崩。
約 7B 量級
穩定吐出合法 JSON,按函式簽名填對參數型別。這項能力沒有被專門設計進去,是訓練完之後發現它有的。
約 7B 量級
讓模型先寫出推理過程再給答案。這招在小模型上拿不到收益,有時還會把原本能答對的題帶偏。
約 100B 量級
判斷對話裡的另一個人掌握了哪些資訊、會怎麼想。這一項的爭議最大,有研究把測試題改寫幾個字,能力就消失了。
爭議中
幾十輪之後仍然守住設定好的身份、語氣和邊界,中途不跑偏,也不被使用者幾句話帶走。
約 13B 量級
思維鏈在約 100B 規模才出現明顯收益,見 Wei et al., Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, NeurIPS 2022(arXiv:2201.11903)。理論心智的相關報告見 Kosinski, arXiv:2302.02083(2023);同期 Ullman, arXiv:2302.08399 指出對任務做微小改寫後該表現即消失。其餘各項的參數量為量級參考,行業內沒有統一的權威閾值,請勿當作精確數字引用。核對日期 2026-08-07。
這件事在學術上還沒有定論
有一派研究認為,相當一部分「湧現」是評測指標造出來的假象。 換一種打分方式,同一批模型在同一批題目上畫出來的曲線會變成平滑上升。
論證是這樣的。多步數學題通常按「答案完全正確」判分,中間錯一步,整題算零。這種打分方式是離散的,它把模型的連續進步壓成了一個二值結果。模型從錯得離譜進步到只差最後一點,分數照樣是零。等它跨過最後那點門檻,分數才一次性從零跳起來。
把判分換成連續指標,比如逐個 token 看正確答案的對數機率,同一組實驗的曲線就變成一條平滑上升的線。跳變消失了,說明跳變來自尺子,模型本身一直在穩步變好。
離散指標
一次通過才算分。中間的進步全部記為零,最後集中兌現,看上去就是一次跳升。
連續指標
給部分正確也記分。同一批模型的進步被完整記錄下來,曲線變成平滑上升。
Schaeffer, Miranda & Koyejo, Are Emergent Abilities of Large Language Models a Mirage?, NeurIPS 2023(arXiv:2304.15004)。該文主張湧現在很大程度上由研究者選擇的評測指標引發,採用非線性或離散指標時出現跳變,改用線性、連續指標後曲線平滑。上面兩張迷你圖為原理示意,未取自原文資料。核對日期 2026-08-07。
這個反駁沒有把現象整個推翻。它說明的是一件更具體的事:看到一條階躍曲線時,先確認階躍來自模型,還是來自你的尺子。對做產品的人來說,這個提醒比爭論本身有用。你的驗收標準如果是「一次跑通才算過」,那你在自己的資料上大機率也會看到階躍。
對做產品的人意味著什麼
1
換更大的模型之前,先自己測一遍
跑分榜測的是通用任務,你的場景可能正好卡在某個閾值附近。換一檔規模也許立刻就通了,也許毫無變化。花半天做一個二三十條樣本的小測試集,用真實資料跑一遍,比讀十篇評測有用。
2
小模型做不到的事,別急著用提示詞硬湊
遇到怎麼改提示詞都做不對的任務,先換一檔規模試試。如果大一檔立刻就對了,那之前那些複雜提示詞只是在補規模的缺口。這類提示詞通常又長又脆,換個模型、換個版本就失效。
3
看到「突然會了」,也別急著下結論
上面那個爭議在自己的測試裡同樣成立。加一個寬鬆一點的判分口徑做交叉驗證,比如按步驟給分、按欄位給分。兩把尺子都顯示跳升,這個結論才站得住。
一句話記住: 規模是一個自變數,值得單獨測。它可能給你帶來沒預期過的能力,也可能什麼都不給。這件事只有在你自己的任務上才能問出答案。
接下來
湧現說明規模能換來能力。它同時留下一個問題:既然大模型更強,為什麼整個行業還在拼命把模型做小?把幾百 B 壓到幾 B,損失掉的正是這一節講的這部分東西。壓縮的收益是什麼,代價能不能接受,下一節從這個矛盾開始講。