開源專題 · 大模型如何變小

為什麼要把模型做小:蒸餾的動機

上一節剛講完,模型越大,能力越容易湧現。那為什麼整個行業還在拼命把模型做小?因為能力不是唯一的約束條件。成本、延遲、資料能不能出門,這三件事會在真實專案裡直接把旗艦模型擋在門外。

先說結論
把模型做小,是被現實逼出來的。旗艦模型能力最強,但它貴、它慢,而且必須把資料發到別人的伺服器上。很多場景裡,一個能力夠用的小模型才是唯一能實際採用的選項。蒸餾,就是把小模型的能力盡量補上來的那個手段。
三個把模型往小裡做的理由

成本差的是數量級,不是幾成

參數量小一個量級,一次推理要動用的算力通常也小一個量級。行業裡的常見口徑是,小模型的推理成本可以比旗艦模型低一到兩個數量級。具體差多少,取決於尺寸、量化檔位、批次大小和部署方式。別記死數字,記住這是量級上的差距,不是打個折。

速度本地跑省掉整段網路往返

呼叫遠端旗艦模型,要走一次網路往返,還要排隊,然後逐字生成。等上幾秒是常態。本地跑的小模型省掉了網路這一段,首字出來得快得多。對話類產品對這一段特別敏感,使用者等三秒和等零點三秒,是兩種體驗。

私有化與合規有些資料根本不允許出內網

病歷、卷宗、內部程式碼、未公開的財務資料,這類內容的合規要求是不出內網。這時候對面的模型能力再強也用不上,因為第一步就過不去。本地部署的小模型是唯一一條路。第一節講權重時說的那個控制權,在這裡變成了硬約束。

「差一到兩個數量級」這句話,換算成月底那張帳單是多少?把你產品的請求量拖進去看看。

先拖到你自己產品的量級,再看兩條帳單的差距。
每日請求
上述成本與延遲均為量級描述,不是基準測試結果。上面這個換算器用的單價與延遲同樣是量級示意,不構成任何廠商的報價。實際差距取決於模型尺寸、量化檔位、批次大小與部署方式,請以自己場景下的實測為準。核對日期 2026-08-07。
小到什麼程度,才裝得進自己的機器

「小」是個相對的說法,但判斷標準很具體:能不能塞進手上這塊顯示卡。本章後面有一頁互動工具專門算這件事,這裡先把公式給出來。

顯存(GB)≈ 參數量(B)× 精度係數
FP16 取 2.6,INT4 取 0.65。係數裡已經含了 KV Cache 這類執行時開銷,不要在外面再乘一次。

按這個口徑算幾個尺寸。最後一列是 INT4 量化之後,在一塊 24 GB 的消費級顯示卡上能不能跑。

Qwen3-0.6B
FP16 1.6 GB
INT4 0.4 GB
輕鬆,端側裝置也帶得動
Qwen3-8B
FP16 20.8 GB
INT4 5.2 GB
很寬裕,8 GB 卡也能跑
Qwen3-32B
FP16 83.2 GB
INT4 20.8 GB
勉強,上下文一長就會溢位
Qwen3-235B-A22B
FP16 611 GB
INT4 152.8 GB
跑不動,不是量化能解決的
換算係數與本章 oss-8 的顯存計算器一致:FP16 為 2.6,INT4 為 0.65,係數中已包含約三到五成的執行時開銷。這是經驗估算值,不是廠商標稱值。MoE 模型的顯存按總參數量算,啟用參數量只影響速度。判定時留了約 15% 餘量,所以 20.8 GB 在 24 GB 卡上算「勉強」而不算「可以」。核對日期 2026-08-07。

結論很直白。8B 這個尺寸量化之後,一塊幾年前的遊戲顯示卡就跑得動;旗艦尺寸不管怎麼量化都進不去。於是問題變成了另一個:小尺寸的能力,能不能補上來。

蒸餾:讓大模型去教小模型

補能力有兩條路。一條是讓小模型自己從頭學,資料、算力、試錯全部重來一遍。另一條是找一個已經學會的大模型來教它。後一條就是知識蒸餾。

大模型當老師,小模型當學生。老師把自己面對一個問題時的判斷方式演示出來,學生照著學。學生不用從零開始摸索,也不用長成老師那個身板。

這跟傳統訓練的差別,主要在一次能傳過去多少資訊。

傳統訓練:只知道對不對

訓練資料給的是標準答案。答對了加分,答錯了扣分。一道題傳回來的資訊基本就是一個「對」或者「錯」。至於錯得離譜還是只差一點,標籤裡看不出來。資訊很稀疏,所以要靠海量資料和海量算力去堆。

蒸餾:還知道老師怎麼想

老師給出的不只是最終那個答案,還有它在各個候選之間的傾向。同一道題,學生能看到老師覺得哪些選項接近、哪些完全不沾邊。同樣一條資料,攜帶的資訊量大得多,學生學起來也就快得多。

這份資訊具體怎麼傳過去、訓練的時候怎麼算,下一節 oss-6 會拆開講。這一節只要記住動機:蒸餾省的是錢和時間,它不創造新能力。

一個可以自己去查的案例

2025 年 1 月 20 日,DeepSeek 發布 R1,同時開源了一批蒸餾版小模型。做法是用 R1 生成推理資料,再拿這批資料去訓練更小的模型。這批蒸餾版裡,有的以 Llama 為底座,有的以 Qwen 為底座。

這件事值得記一下,因為它是一次公開可查的第三方選擇。一家公司做蒸餾時挑了哪些底座,比任何宣傳口徑都更能說明問題。R1 採用 MIT License,官方公告裡明確寫了允許透過蒸餾訓練其他模型。這句話白紙黑字寫出來,別人才敢把這條路走通。

來源:DeepSeek 官方公告,2025-01-20。R1 採用 MIT License,公告中明確允許使用者透過蒸餾訓練其他模型。同批發布的蒸餾模型覆蓋 1.5B 到 70B 多個尺寸,底座分別取自 Qwen 與 Llama 兩個系列,各版本仍需遵循其底座模型自身的許可條款。核對日期 2026-08-07。

這批模型的命名規則和具體做法,下一節展開。

先把醜話說在前面
蒸餾不是萬能的。在需要長鏈條推理、多步規劃、跨大量上下文做取捨的任務上,小模型仍然顯著弱於旗艦模型。這類差距不會因為換個更強的老師就消失。做選型時別指望一個 7B 模型接管所有場景,先把任務拆開,看清楚哪些環節真的用得上小模型。
學生會連老師的毛病一起學過去。老師的偏見、知識盲區、表達習慣,學生都會繼承,而且自己分辨不出來。當大量小模型都從同一批老師那裡學,整個生態會朝同一個方向漂。這個副作用是 oss-7 要專門講的。
這一節帶走什麼
一、把模型做小的動因是成本、延遲、資料合規這三條現實約束,跟追求能力上限無關。
二、能不能實際跑起來,先看顯存這個硬指標,公式是參數量乘精度係數。
三、蒸餾是讓大模型教小模型,目的是省掉從零訓練的成本。
四、小模型有能力天花板,也會繼承老師的缺陷。這兩點在選型時要先擺到檯面上。

下一節看蒸餾具體怎麼做:老師怎麼出題,學生怎麼對答案,中間有哪些工程上的坑。