基礎原理

Base 模型:Token 推 Token 機器

訓練結束後得到的原始模型,它只做一件事。

訓練結束後
得到的就是一個 無情的 Token 推 Token 機器
它只知道一件事:
給定前面所有的 Token,預測下一個最可能的 Token。
前文 Token → 概率分佈 → 採樣 → 新 Token → 循環
它不會
理解問題 · 思考答案 · 查閲知識
它只看概率,只吐 Token。
這就意味着
給它「紫霞捧着月光寶盒,輕聲問:哥哥」,
它會接着推出概率最高的下一個詞,
但它並不知道自己在寫什麼。
Token 推演演示
上下文(前文 Token)
紫霞 → 捧着 → 月光 → 寶盒 → , → 輕聲 → 問 → : → 哥哥
模型正在預測下一個 Token…

這就是 Base 模型的全部:不斷把最高概率詞追加到序列末尾,直到生成終止符。
它沒有意圖、沒有記憶、沒有常識判斷,只有概率,只有 Token。
但這個簡單的循環,是一切大模型能力的底層引擎。