基礎原理
Base 模型:Token 推 Token 機器
訓練結束後得到的原始模型,它只做一件事。
訓練結束後
得到的就是一個
無情的 Token 推 Token 機器
它只知道一件事:
給定前面所有的 Token,預測下一個最可能的 Token。
給定前面所有的 Token,預測下一個最可能的 Token。
前文 Token
→
機率分佈
→
取樣
→
新 Token
→
迴圈
它不會
理解問題 · 思考答案 · 查閱知識
它只看機率,只吐 Token。
它只看機率,只吐 Token。
這就意味著
給它「紫霞捧著月光寶盒,輕聲問:哥哥」,
它會接著推出機率最高的下一個詞,
但它並不知道自己在寫什麼。
它會接著推出機率最高的下一個詞,
但它並不知道自己在寫什麼。
Token 推演演示
上下文(前文 Token)
紫霞
→
捧著
→
月光
→
寶盒
→
,
→
輕聲
→
問
→
:
→
哥哥
這就是 Base 模型的全部:不斷把最高機率詞追加到序列末尾,直到生成終止符。
它沒有意圖、沒有記憶、沒有常識判斷,只有機率,只有 Token。
但這個簡單的迴圈,是一切大模型能力的底層引擎。