為什麼要把模型做小:蒸餾的動機
上一節剛講完,模型越大,能力越容易湧現。那為什麼整個行業還在拼命把模型做小?因為能力不是唯一的約束條件。成本、延遲、數據能不能出門,這三件事會在真實項目裏直接把旗艦模型擋在門外。
成本差的是數量級,不是幾成
參數量小一個量級,一次推理要動用的算力通常也小一個量級。行業裏的常見口徑是,小模型的推理成本可以比旗艦模型低一到兩個數量級。具體差多少,取決於尺寸、量化檔位、批量大小和部署方式。別記死數字,記住這是量級上的差距,不是打個折。
速度本地跑省掉整段網絡往返
調用遠端旗艦模型,要走一次網絡往返,還要排隊,然後逐字生成。等上幾秒是常態。本地跑的小模型省掉了網絡這一段,首字出來得快得多。對話類產品對這一段特別敏感,用戶等三秒和等零點三秒,是兩種體驗。
私有化與合規有些數據根本不允許出內網
病歷、卷宗、內部程式碼、未公開的財務數據,這類內容的合規要求是不出內網。這時候對面的模型能力再強也用不上,因為第一步就過不去。本地部署的小模型是唯一一條路。第一節講權重時説的那個控制權,在這裏變成了硬約束。
「差一到兩個數量級」這句話,換算成月底那張帳單是多少?把你產品的請求量拖進去看看。
「小」是個相對的説法,但判斷標準很具體:能不能塞進手上這塊顯卡。本章後面有一頁互動工具專門算這件事,這裏先把公式給出來。
FP16 取 2.6,INT4 取 0.65。係數裏已經含了 KV Cache 這類運行時開銷,不要在外面再乘一次。
按這個口徑算幾個尺寸。最後一列是 INT4 量化之後,在一塊 24 GB 的消費級顯卡上能不能跑。
結論很直白。8B 這個尺寸量化之後,一塊幾年前的遊戲顯卡就跑得動;旗艦尺寸不管怎麼量化都進不去。於是問題變成了另一個:小尺寸的能力,能不能補上來。
補能力有兩條路。一條是讓小模型自己從頭學,數據、算力、試錯全部重來一遍。另一條是找一個已經學會的大模型來教它。後一條就是知識蒸餾。
這跟傳統訓練的差別,主要在一次能傳過去多少信息。
訓練數據給的是標準答案。答對了加分,答錯了扣分。一道題傳回來的信息基本就是一個「對」或者「錯」。至於錯得離譜還是只差一點,標籤裏看不出來。信息很稀疏,所以要靠海量數據和海量算力去堆。
老師給出的不只是最終那個答案,還有它在各個候選之間的傾向。同一道題,學生能看到老師覺得哪些選項接近、哪些完全不沾邊。同樣一條數據,攜帶的信息量大得多,學生學起來也就快得多。
這份信息具體怎麼傳過去、訓練的時候怎麼算,下一節 oss-6 會拆開講。這一節只要記住動機:蒸餾省的是錢和時間,它不創造新能力。
2025 年 1 月 20 日,DeepSeek 發佈 R1,同時開源了一批蒸餾版小模型。做法是用 R1 生成推理數據,再拿這批數據去訓練更小的模型。這批蒸餾版裏,有的以 Llama 為底座,有的以 Qwen 為底座。
這件事值得記一下,因為它是一次公開可查的第三方選擇。一家公司做蒸餾時挑了哪些底座,比任何宣傳口徑都更能説明問題。R1 採用 MIT License,官方公告裏明確寫了允許通過蒸餾訓練其他模型。這句話白紙黑字寫出來,別人才敢把這條路走通。
這批模型的命名規則和具體做法,下一節展開。
二、能不能落地,先看顯存這個硬指標,公式是參數量乘精度係數。
三、蒸餾是讓大模型教小模型,目的是省掉從零訓練的成本。
四、小模型有能力天花板,也會繼承老師的缺陷。這兩點在選型時要先擺到枱面上。
下一節看蒸餾具體怎麼做:老師怎麼出題,學生怎麼對答案,中間有哪些工程上的坑。