為什麼要把模型做小:蒸餾的動機
上一節剛講完,模型越大,能力越容易湧現。那為什麼整個行業還在拼命把模型做小?因為能力不是唯一的約束條件。成本、延遲、資料能不能出門,這三件事會在真實專案裡直接把旗艦模型擋在門外。
成本差的是數量級,不是幾成
參數量小一個量級,一次推理要動用的算力通常也小一個量級。行業裡的常見口徑是,小模型的推理成本可以比旗艦模型低一到兩個數量級。具體差多少,取決於尺寸、量化檔位、批次大小和部署方式。別記死數字,記住這是量級上的差距,不是打個折。
速度本地跑省掉整段網路往返
呼叫遠端旗艦模型,要走一次網路往返,還要排隊,然後逐字生成。等上幾秒是常態。本地跑的小模型省掉了網路這一段,首字出來得快得多。對話類產品對這一段特別敏感,使用者等三秒和等零點三秒,是兩種體驗。
私有化與合規有些資料根本不允許出內網
病歷、卷宗、內部程式碼、未公開的財務資料,這類內容的合規要求是不出內網。這時候對面的模型能力再強也用不上,因為第一步就過不去。本地部署的小模型是唯一一條路。第一節講權重時說的那個控制權,在這裡變成了硬約束。
「差一到兩個數量級」這句話,換算成月底那張帳單是多少?把你產品的請求量拖進去看看。
「小」是個相對的說法,但判斷標準很具體:能不能塞進手上這塊顯示卡。本章後面有一頁互動工具專門算這件事,這裡先把公式給出來。
FP16 取 2.6,INT4 取 0.65。係數裡已經含了 KV Cache 這類執行時開銷,不要在外面再乘一次。
按這個口徑算幾個尺寸。最後一列是 INT4 量化之後,在一塊 24 GB 的消費級顯示卡上能不能跑。
結論很直白。8B 這個尺寸量化之後,一塊幾年前的遊戲顯示卡就跑得動;旗艦尺寸不管怎麼量化都進不去。於是問題變成了另一個:小尺寸的能力,能不能補上來。
補能力有兩條路。一條是讓小模型自己從頭學,資料、算力、試錯全部重來一遍。另一條是找一個已經學會的大模型來教它。後一條就是知識蒸餾。
這跟傳統訓練的差別,主要在一次能傳過去多少資訊。
訓練資料給的是標準答案。答對了加分,答錯了扣分。一道題傳回來的資訊基本就是一個「對」或者「錯」。至於錯得離譜還是只差一點,標籤裡看不出來。資訊很稀疏,所以要靠海量資料和海量算力去堆。
老師給出的不只是最終那個答案,還有它在各個候選之間的傾向。同一道題,學生能看到老師覺得哪些選項接近、哪些完全不沾邊。同樣一條資料,攜帶的資訊量大得多,學生學起來也就快得多。
這份資訊具體怎麼傳過去、訓練的時候怎麼算,下一節 oss-6 會拆開講。這一節只要記住動機:蒸餾省的是錢和時間,它不創造新能力。
2025 年 1 月 20 日,DeepSeek 發布 R1,同時開源了一批蒸餾版小模型。做法是用 R1 生成推理資料,再拿這批資料去訓練更小的模型。這批蒸餾版裡,有的以 Llama 為底座,有的以 Qwen 為底座。
這件事值得記一下,因為它是一次公開可查的第三方選擇。一家公司做蒸餾時挑了哪些底座,比任何宣傳口徑都更能說明問題。R1 採用 MIT License,官方公告裡明確寫了允許透過蒸餾訓練其他模型。這句話白紙黑字寫出來,別人才敢把這條路走通。
這批模型的命名規則和具體做法,下一節展開。
二、能不能實際跑起來,先看顯存這個硬指標,公式是參數量乘精度係數。
三、蒸餾是讓大模型教小模型,目的是省掉從零訓練的成本。
四、小模型有能力天花板,也會繼承老師的缺陷。這兩點在選型時要先擺到檯面上。
下一節看蒸餾具體怎麼做:老師怎麼出題,學生怎麼對答案,中間有哪些工程上的坑。