大模型原理 · 你現在能做什麼

別停在「我懂了」,先把那件事定下來

原理講完,最容易發生的事是:你覺得學到了很多,但合上電腦,手上什麼都沒多。
所以從這裏開始,每章結尾都有這麼一頁,只回答一個問題:學完這章,你今天能動手做什麼

全課有一條實戰主綫:做出一個真能幹活的 Agent。六個里程碑各推進一格,你現在在第一格。
M0
想清楚它替你幹什麼
M1
能穩定説人話
M2
能動手幹活
M3
改好改壞能量化
M4
長跑不失憶
M5
過程可復現
先看清楚 · 需求要收斂到什麼程度才算數

大多數人給 AI 佈置任務,停在第一段就交卷了:「幫我處理吓週報」。這句話沒錯,只是它沒法驗收。你不知道什麼樣的輸出算成功,自然也不知道該不該改提示詞。往下推三段,它才變成一個真需求。

從一句願望到一個能驗收的需求

01
一句願望

「幫我處理吓週報」,想法有了,但也只是想法

02
定輸入輸出

進:一週的零碎記錄;出:三段結論加一份下週計劃

03
定咩算啱

三段都能直接發給老闆,一個字不用改

04
挑壓幻覺的方案

要引具體數字,那就走 RAG,別讓它憑記憶編

卡在第二段,這個需求還沒法驗收
停在「幫我處理吓週報」,第二段就卡住:輸入是什麼、輸出長什麼樣,你自己都沒想清楚。後面兩段根本沒機會跑。「試了一下感覺不行」,原因通常就在這兒。

第四段為什麼要單拎出來

這一章你學了四種壓幻覺的辦法:改提示詞、RAG、調 Temperature、加評測。選哪個,看你的活兒會在哪兒出錯。這不是四選一的偏好題。要引具體數字和條款,走 RAG;格式老是飄,改提示詞再把 Temperature 調低;要長期跑、怕它悄悄變差,那就得有評測。選錯了不要緊,但一開始就不選,等於把幻覺留給用戶去發現

調不了 Temperature,不代表少了一條路。它是 API 上的參數,ChatGPT、豆包這類對話產品裏壓根沒這個開關。四種辦法本來就彼此獨立,缺這一個,另外三個照樣單獨成立。想把格式釘死,就在提示詞裏給一份模板加一個完整例子,寫明「只輸出這幾個字段,不要解釋」;同一句話連跑三遍看它穩不穩,比擰參數更能暴露問題。真到了非精確控制不可的程度,那本身就是該走 API 的信號。

動手清單 · 挑一個開始,勾掉它

這一章的動手清單

0 / 3 已完成

把那件事寫成四行

15 分鐘 所有人

照着上面四段,寫下你最想交給 AI 的那件事:一句願望、輸入是什麼、輸出長什麼樣、什麼算對。寫在便籤、備忘錄、隨便哪兒都行,但必須是寫下來的字,不能只是腦子裏的想法。

什麼算做完了
把這四行念給一個不了解你工作的人聽,佢能複述出「AI 要交出啲咩」。做不到,説明第二、三段還太虛。

用 5 個真實輸入試它一遍

1 小時 想先驗證可行性

別用編的例子。翻出五份真實材料丟給它,一次一份,提示詞保持一模一樣。重點是看它在哪一類輸入上開始胡説,答得好不好先放一邊。材料太長?資訊缺失?有內部專有名詞?把出錯的那一類記下來。

什麼算做完了
你能説出一句具體的話:「輸入裏一旦出現某某,它就開始編。」籠統的「有時候不太準」不算。

劃一條人機分界綫

半天 準備真做一個

把這件事拆成「AI 做」和「你做」兩半,寫清交接點長什麼樣。比如:AI 出初稿並標出所有它不確定的數字,你只核對被標出來的那幾處。分界綫劃在哪兒不重要,重要的是它必須能被檢查

什麼算做完了
你能回答:如果 AI 那一半出錯了,你喺邊一步、用咩方式會發現?答不上來,説明這條綫劃得太靠後了。

寫完了就存進建造日誌

建造日誌會一路陪你到協作方法論篇。六個里程碑填滿,你手上就是一份完整的 Agent 設計説明。內容存在你自己的瀏覽器裏,隨時能導出成 Markdown。

去填 M0