基礎原理

GPT 的躍進

PreTraining 為什麼改變了一切:從 CNN/RNN/BERT 到 GPT,大模型史上最重要的一步。

大模型發展史
在 GPT 之前,大家都在做任務專用模型。
GPT 的出現,是一次躍進
CNN、RNN、BERT,都是先確定任務再訓練模型。
GPT 反過來了:先用海量語料做預訓練,再適配任務。
之前
CNN / RNN / BERT
→
躍進
GPT(PreTraining)
PreTraining 的本質
用網路上幾乎所有的文字做 Token 預測訓練,
模型被迫學會了語法、常識、事實、邏輯、風格…
這一切都只是預測下一個詞的副產品。
為什麼這是躍進?
之前:每個任務從零訓練,換任務就換模型
GPT:預訓練一次,能力遷移到任意任務
這就是 Foundation Model(基礎模型)的核心思路
演算法互動體驗:親手感受四代模型的差異
視窗大小 3
CNN 的侷限:只能看視窗內的詞,視窗外的關係完全看不到。
「哥哥」和句首「紫霞」的關係?CNN 無法在一步內捕捉。
各詞殘留記憶強度(當 RNN 處理到當前詞時)
← 越早的詞,記憶越弱;當前處理詞 = 100%
RNN 的侷限:隱狀態每步被新詞覆蓋,越早的詞記憶越模糊。處理長文字時「梯度消失」:開頭的資訊到結尾幾乎消失殆盡。
點選任意詞 → 熱圖亮度 = 注意力權重,黃=左邊 綠=右邊 紫=自身
← 點選上方任意詞,查看雙向注意力熱圖
左邊的詞(BERT 能看) 右邊的詞(BERT 能看) 自身
BERT 的侷限:雙向注意力理解能力強,但預訓練目標是「填空」,不擅長生成,不能直接用來續寫文字。
GPT 單向因果生成 · 只看左邊,逐步續寫
下一詞機率
點選「開始生成」
GPT 的躍進:因果預訓練目標就是「預測下一詞」,和生成天然一致。不需要特殊任務資料,規模越大湧現的能力越驚人。