蒸餾的代價:模型正在變得越來越像
上一節說蒸餾是讓學生學老師。問題在於,學生學到的是老師的全部:本事、口癖、偏見、甚至對自己身份的認知。當整個行業都在向少數幾個老師學習,結果就是大家越來越像。
蒸餾別人家的模型是否越界,目前沒有共識,但已經有公開的指控。
Anthropic 曾公開表示,發現有廠商對 Claude 做「工業級規模」的蒸餾。OpenAI 也曾指控 DeepSeek 透過蒸餾 GPT 系列取得能力。這些都是一方的指控,被指控方並未承認,也沒有第三方機構給出裁定。放在這裡是為了說明一件事:這個領域的邊界還在形成中,各家的服務條款大多禁止用自家輸出去訓練競品,但技術上很難取證。
口癖被整批繼承
某些句式在一個頭部模型上高頻出現,之後就在大量模型裡同時冒出來,成了識別 AI 寫作的指紋。
「讓我們深入探討一下這個話題」
「值得注意的是,這裡有幾個關鍵點」
格式怪癖被繼承
有的模型習慣在中文裡給名詞補上英文標註,學它的模型也跟著這麼寫,哪怕場景完全不需要。
連身份都學過去了
最直白的一種。問一個模型它是誰,它報出的可能是老師的名字。
模型:我是 ChatGPT,由 OpenAI 開發…(實際上它是另一家公司的產品)
這一章前面提到過,某個開源系列的衍生模型數量已經超過 20 萬個。從生態角度看這是影響力的證明,但換個角度看,它同時意味著 20 萬個模型共享同一批底層假設。
底座模型裡的偏見、知識盲區、表達傾向,會沿著蒸餾鏈條一層層傳下去。上游改一個訓練策略,下游幾萬個模型跟著變。這種結構在軟體工程裡有個熟悉的名字:單點依賴。
這話聽著像杞人憂天,直到你自己試一次。下面這六個產品是我編出來的——名字、公司、宣傳全是假的,別去搜,搜不到。編它們是為了讓你先按平時的思路挑一遍:真到了選型的時候,你面前也只有名字和宣傳,底座是什麼並不寫在產品頁上。
選型時查一下血緣
模型卡裡通常會寫明底座是什麼。做多模型冗餘設計時,優先選底座不同的組合,而不是只看廠商名字不同。
產品差異化別建在模型層
如果你的競爭力來自「我們的回答品質更好」,而大家用的模型血緣相近,這個優勢不牢固。真正的差異通常來自資料、工作流和對場景的理解。
把口癖當成需要治理的問題
如果你的產品有品牌調性要求,預設輸出大機率會帶著上游的表達習慣。這要靠提示詞約束和後處理去改,指望換個模型解決通常沒用,因為它們都這樣。
這一章前半段講清楚了開源是什麼、模型怎麼變小、代價在哪裡。接下來兩節動手:先算清楚你的機器能跑多大的模型,再把它真正跑起來。