篇章彙總

彙總(上)· 大模型是什麼 + 幻覺

大模型原理 · 總結回顧 · 上半頁:大模型基礎:它是什麼,為何會幻覺。

一 · 大模型是什麼
🧠
大模型是什麼
三個必須掌握的底層認知
訓練本質
LLM = 超大型概率預測機器
訓練 = 在海量文本上反覆預測下一個 Token,參數記住的是統計規律,不是理解。推理時參數凍結,只做條件概率計算。
P( 下一個 Token | 所有已知 Token )
Token & 上下文窗口
Token ≠ 字 · Context Window 是「桌面」
中文每字約 1 Token,常用詞更省,生僻字會多佔幾個;英文每詞約 1 Token。Context Window 決定模型能看到多少。超出就截斷,永久消失。

當前主流窗口:Qwen 3.6(1M)、Kimi K2.5(200K)、Claude 4.6(200K)、GPT-5.4(128K)
演進路徑
Base → SFT → Chat 三階段
Base Model(續寫文字)→ SFT 指令微調(學會對話格式)→ Chat API(模擬多輪對話)。

你每次調用 API,本質是在構造一個精心設計的 Message List,讓模型續寫出你想要的內容。
[system] + [user/assistant …] + [user_now]
二 · 幻覺:LLM 的先天侷限
👻
幻覺:LLM 的先天侷限
不可消除,只能緩解
事實性幻覺
捏造不存在的事實、數據、引用
來源幻覺
引用了不存在的論文/連結/作者
推理幻覺
前提正確但推理步驟出錯
程式碼幻覺
調用不存在的 API / 函式
根因一
參數知識有誤
訓練數據裏本來就有錯誤信息;知識截止日期後的內容一無所知。
根因二
上下文理解偏差
Prompt 不清晰,模型只能猜意圖;上下文矛盾時總是選最可能的續寫,最可能不等於最準確。
關鍵認知
→ 幻覺不可完全消除,因為它是概率預測的必然產物
→ PreTraining 後參數凍結,無法自動更新知識,這是幻覺的根本原因
→ 正確做法:用工程手段緩解,不要指望模型更聰明後幻覺自己消失