開源專題 · 大模型如何變小

蒸餾的代價:模型正在變得越來越像

上一節說蒸餾是讓學生學老師。問題在於,學生學到的是老師的全部:本事、口癖、偏見、甚至對自己身份的認知。當整個行業都在向少數幾個老師學習,結果就是大家越來越像。

先看研究怎麼說
Generative Monoculture in Large Language Models
Wu & Black · arXiv:2407.02209 · 2024
研究發現,多個模型基於相同底座蒸餾之後,輸出的多樣性顯著下降。在書評撰寫、程式碼生成這類本該有很多種合理答案的任務上,不同模型給出的結果高度趨同。作者用「單一文化」形容這個狀態。
Measuring and Understanding LLM Identity Confusion
Xu et al. · arXiv:2411.10683 · 2024-11
研究覆蓋 27 個模型,發現其中 25.93% 存在身份混淆:被問到「你是誰」時,錯誤地聲稱自己是另一個模型。作者還指出,這類錯誤對使用者信任的傷害,比一般的邏輯錯誤更大。
兩篇論文均可在 arXiv 公開檢索,編號如上。核對日期 2026-08-07。
行業裡公開的爭議

蒸餾別人家的模型是否越界,目前沒有共識,但已經有公開的指控。

Anthropic 曾公開表示,發現有廠商對 Claude 做「工業級規模」的蒸餾。OpenAI 也曾指控 DeepSeek 透過蒸餾 GPT 系列取得能力。這些都是一方的指控,被指控方並未承認,也沒有第三方機構給出裁定。放在這裡是為了說明一件事:這個領域的邊界還在形成中,各家的服務條款大多禁止用自家輸出去訓練競品,但技術上很難取證。

依據 Anthropic 公開宣告及路透社等媒體報導。此處僅陳述爭議存在,不對指控本身作事實認定。核對日期 2026-08-07。
你自己就能觀察到的三個症狀
症狀 1

口癖被整批繼承

某些句式在一個頭部模型上高頻出現,之後就在大量模型裡同時冒出來,成了識別 AI 寫作的指紋。

典型句式 「這不僅僅是技術問題,更是一個產品問題」
「讓我們深入探討一下這個話題」
「值得注意的是,這裡有幾個關鍵點」
症狀 2

格式怪癖被繼承

有的模型習慣在中文裡給名詞補上英文標註,學它的模型也跟著這麼寫,哪怕場景完全不需要。

典型輸出 「這個概念(Concept)非常重要,我們需要關注效能(Performance)和安全性(Safety)」
症狀 3

連身份都學過去了

最直白的一種。問一個模型它是誰,它報出的可能是老師的名字。

對話 使用者:你是哪個模型?
模型:我是 ChatGPT,由 OpenAI 開發…(實際上它是另一家公司的產品)
這些不是 bug,是蒸餾的必然結果。訓練資料是老師的輸出,老師怎麼說話,學生就怎麼說話。你沒法只繼承能力而不繼承習慣,因為在訓練資料裡,這兩樣東西根本分不開。
生態越集中,這個問題越明顯

這一章前面提到過,某個開源系列的衍生模型數量已經超過 20 萬個。從生態角度看這是影響力的證明,但換個角度看,它同時意味著 20 萬個模型共享同一批底層假設。

底座模型裡的偏見、知識盲區、表達傾向,會沿著蒸餾鏈條一層層傳下去。上游改一個訓練策略,下游幾萬個模型跟著變。這種結構在軟體工程裡有個熟悉的名字:單點依賴。

對產品最直接的影響:多模型交叉驗證可能是假的。很多團隊會同時呼叫兩三個不同廠商的模型,讓它們互相校驗來降低出錯機率。這套做法成立的前提是它們會犯不同的錯。如果這幾個模型的血緣上溯到同一個老師,它們很可能在同一個地方一起錯,而且錯得一模一樣。此時交叉驗證給你的不是安全感,是虛假的安全感。

這話聽著像杞人憂天,直到你自己試一次。下面這六個產品是我編出來的——名字、公司、宣傳全是假的,別去搜,搜不到。編它們是為了讓你先按平時的思路挑一遍:真到了選型的時候,你面前也只有名字和宣傳,底座是什麼並不寫在產品頁上。

再說一次:上面六個產品和公司都是虛構的,現實中不存在,別去搜。虛構的只是名字,底座高度集中這件事是真的——20 萬衍生模型出自 Hugging Face 平臺統計,來源與核對日期標在第三節;DeepSeek-R1 的六個蒸餾版裡四個用 Qwen2.5 底座、兩個用 Llama3,是官方模型卡寫明的,第六節把六個都列了出來。真實產品用的是什麼底座,多數廠商並不寫在產品頁上,這正是這件事難查、也容易被忽略的原因。
能做什麼
1

選型時查一下血緣

模型卡裡通常會寫明底座是什麼。做多模型冗餘設計時,優先選底座不同的組合,而不是只看廠商名字不同。

2

產品差異化別建在模型層

如果你的競爭力來自「我們的回答品質更好」,而大家用的模型血緣相近,這個優勢不牢固。真正的差異通常來自資料、工作流和對場景的理解。

3

把口癖當成需要治理的問題

如果你的產品有品牌調性要求,預設輸出大機率會帶著上游的表達習慣。這要靠提示詞約束和後處理去改,指望換個模型解決通常沒用,因為它們都這樣。

這一章前半段講清楚了開源是什麼、模型怎麼變小、代價在哪裡。接下來兩節動手:先算清楚你的機器能跑多大的模型,再把它真正跑起來。