他們會這樣考你
大模型基礎 · 30 道靈魂拷問
大模型原理篇學完了,懂了和能講出來之間還差一場實戰。這 30 個問題來自三個真實場景,先自己開口回答,再看框架。
怎麼用這一頁
每道題都標註了提問者。他們問同一塊知識,想聽的東西卻不一樣。
🎙 面試官想驗證你是真懂,還是在背名詞
👔 老闆要的是解釋和承諾
🛠 技術同事在試探你值不值得信任
每題給出三層:對方在考察什麼 → 答題框架 → 加分點。答不上來的環節,點末尾的課程頁回去補。
Q1面試官
「用你自己嘅說話講吓,ChatGPT 呢類大模型係點樣生成回答嘅?佢係咪喺度思考?」
🎯 對方在考察什麼
開場必問題,決定後面所有問題的深度。考的是你能不能把概率預測下一個 Token 這件事講成人話。背名詞的人會堆砌 Transformer、注意力機制,真懂的人會用一個例子把機制説清楚。
🧭 答題框架
- 先給本質:大模型是超大型概率預測機器,每次只做一件事,根據已有的所有 Token 預測下一個 Token 出現的概率,逐個生成。
- 區分訓練和推理:訓練是在海量文本上學統計規律;你和它對話時參數已經凍結,它沒有在學習,只是在計算。
- 正面回答思考問題:它沒有人類意義上的思考,規模夠大後又確實表現出類似推理的能力。所以既不要神化,也不要貶低成復讀機。
- 落一個例子:輸入「今天天氣真」,模型給出好 62% / 差 18% / 冷 9% 這樣的分佈,按概率採樣。整段回答就是這個動作重複幾百次。
⭐ 加分點主動指出對話不等於學習、參數是凍結的。很多 PM 以為模型會從用戶對話裏持續學習,能糾正這個誤區,説明你理解到位了。
Q2面試官
「明明係聊天產品,點解 OpenAI 嘅接口叫 chat/completions(補全)?多輪對話係點樣實現嘅?」
🎯 對方在考察什麼
這是判斷你有沒有真正碰過 API 的分水嶺題。只用過 ChatGPT 網頁版的人答不出來;理解 message list 機制的人,後面聊上下文、成本、Agent 都能接得住。
🧭 答題框架
- 點破本質:模型底層是續寫機器。所謂對話,是把歷史包裝成聊天記錄格式,讓模型續寫出助手的下一句。
- 多輪的真相:模型沒有記憶。每一輪都是把完整的 message list(system + 歷史 user/assistant + 當前提問)重新發一遍。
- 補上工程環節:模型能聽懂對話格式,靠的是 Chat Template + SFT 指令微調,這是 Base 模型學會説話的關鍵一步。
- 拔高一層:所有 AI Harness 操作(RAG、記憶、Agent)本質都是對這個 message list 的處理。理解它,就找到了所有方案的入口。
⭐ 加分點能順勢説出成本含義:歷史每輪重發,意味着多輪對話越聊越貴。後面的成本優化方案都是衝這個來的。
Q3老闆
「我哋嘅 AI 客服尋日又編咗一條唔存在嘅退款政策。你同我解釋下點解,幾時先可以徹底修好?」
🎯 對方在考察什麼
這題不考知識,考期望管理。你敢不敢説「徹底修不好」?説完之後,能不能馬上給出讓老闆放心的方案和量化承諾?答「我讓技術看看」是最差答案。
🧭 答題框架
- 先給結論、不迴避:幻覺是概率預測機制的必然產物,無法徹底消除,但可以用工程手段壓到業務可接受的水平。
- 再解釋根因:兩個來源:參數知識有誤(訓練數據錯誤或過期),以及上下文理解偏差(模型總是選最可能的續寫,最可能不等於最準確)。
- 給方案組合拳:RAG 注入真實退款政策文檔 + Prompt 約束「只依據文檔回答」 + 調低 Temperature + 上綫評測與人工審核兜底。
- 給量化承諾方式:定義幻覺率指標(抽樣審核),按周彙報收斂情況,把「什麼時候修好」轉化成「指標降到多少」。
⭐ 加分點補一句「任何承諾能徹底消除幻覺的供應商都在誇大」,幫老闆建立對整個行業的正確預期,這是 AI PM 的核心價值之一。
Q4面試官
「緩解幻覺嘅手段你知邊啲?如果資源有限只能先上一個,你揀邊個,點解?」
🎯 對方在考察什麼
前半句考知識廣度,後半句才是重點:考決策能力和成本意識。這題沒有標準答案。直接給答案的人不及格,先反問一句「什麼場景」的人才及格。
🧭 答題框架
- 列全四種手段:Prompt 約束(最便宜)、RAG(對知識型幻覺最有效但有成本)、Temperature 調低(只降隨機性、不補知識)、評測 + 人工審核(外部兜底)。
- 先反問場景:幻覺主要是編造事實,還是表達不穩定?知識庫變不變?預算多少?
- 給條件化答案:知識型幻覺(編政策、編數據)→ RAG;表達不穩定 → Prompt 約束 + 低 Temperature,幾乎零成本先上。
- 補一個原則:無論選哪個,評測先行。沒有評測就無法驗證效果,等於白做。
⭐ 加分點指出實際項目裏這四種要組合使用、分階段上,單選題只存在於面試裏。能説出先用 Prompt 和 Temperature 止血、再上 RAG 治本這種節奏的人很少。
Q5技術同事
「產品要接入我哋內部最新嘅產品手冊,你唔會係打算叫我哋重新訓練一個模型啩?」
🎯 對方在考察什麼
技術同事半開玩笑的挑戰,實際在試探你懂不懂訓練和推理的邊界。答錯這題(比如回一句「對啊,訓練一下不行嗎」),技術團隊對你的信任會立刻打折;答對了,後面的合作會順暢得多。
🧭 答題框架
- 先接住梗:不用重訓。參數凍結不代表知識進不去,上下文窗口就是知識的入口。
- 給方案:上 RAG。手冊切塊、建向量索引,用戶提問時檢索相關段落注入上下文。手冊更新只需重建索引,天級生效,成本和重訓差幾個數量級。
- 説清微調的正確用途:微調改的是行為風格(語氣、格式、領域話術),不適合注入時效性知識。知識一旦進權重,每次更新都要再訓一次。
- 展示成本意識:RAG 也有代價:每次請求 token 變多、延遲上升,需要配合緩存、路由、精準切塊做優化。
⭐ 加分點能説出 RAG 的代價和優化策略(語義緩存、關鍵詞觸發、模型路由),説明你真的算過賬。「用 RAG」三個字誰都會背。
Q6面試官
「Temperature 同 Top-P 係咩?你哋嘅產品裏會點樣設?」
🎯 對方在考察什麼
考你有沒有真的動手調過參數。後半句「你們的產品」是在等一個場景化答案。張口報一個固定數值(「設 0.7 就行」)的人,基本沒實際調過。
🧭 答題框架
- 説清機制:Temperature 控制概率分佈的陡峭程度,越低越確定、越高越發散;Top-P 控制採樣的候選池範圍,兩者配合決定輸出的隨機性。
- 給場景化設定:客服 / 事實問答 / 數據提取 → 調低(0~0.3);創意文案 / 頭腦風暴 → 調高(0.7 以上)。
- 説清邊界:這只能緩解表達上的隨機性,解決不了知識缺失。低 Temperature 下模型依然會自信地胡説。
- 給驗證方法:參數值要用評測集 A/B 驗證出來。拍腦袋定一個全產品共用的值,不可取。
⭐ 加分點主動區分隨機性幻覺和知識性幻覺,Temperature 只治前者。這個邊界很多人説不清。
用這些課程頁組織答案 →
Temperature & Top-P 交互演示
Q7面試官
「上下文窗口係咩?而家模型都到 1M Token 喇,係咪窗口越大越好?」
🎯 對方在考察什麼
前半句是概念題,後半句是陷阱題。順着説「當然越大越好」就掉進去了。考的是成本意識,以及你知不知道長上下文的真實侷限。
🧭 答題框架
- 説清概念:窗口 = 模型一次能看到的 Token 總量(輸入 + 輸出),超出部分被截斷,對模型來説等於從未存在。
- 戳破陷阱:更大的窗口意味着更貴的帳單。Token 按量計費,把資料全塞進去,成本跟着綫性上漲。
- 給技術侷限:長上下文存在中間遺忘(lost in the middle)問題:信息越多,注意力越稀釋,中段內容的召回率明顯下降。
- 給正確姿勢:大窗口只是能力上限。正確做法是上下文工程:檢索、壓縮、篩選,讓窗口裏只放該放的東西。
⭐ 加分點能報出主流模型的窗口規格(Qwen 1M / Claude 200K / GPT 128K),再點一句窗口大小會影響架構選型,會顯得對行業很熟。
Q8面試官
「Token 到底係咩?同字有咩分別?你哋做產品嘅時候點解要在意呢樣嘢?」
🎯 對方在考察什麼
基礎概念題,實際考的是成本敏感度。很多 PM 説得出 Token 這個詞,算不清一段 Prompt 要花多少錢。後半句在等一個跟錢和窗口掛鈎的回答。
🧭 答題框架
- 先給定義:Token 是模型處理文本的基本單元,訓練第一步就是 Tokenization,把連續文本切成詞表裏的單元。中文一個字約對應 1 到 3 個 Token,英文一個詞約 1 個 Token。
- 連到成本:推理按 Token 計費,輸入輸出都算錢。一個看着只有 500 字的 Prompt 模板,實際可能吃掉 1500 Token,多輪對話每輪重發,費用跟着累積。
- 連到窗口:上下文窗口的額度也按 Token 算,超出就截斷。模板越臃腫,留給正文和歷史的空間越少。
- 落一個動作:上綫前用 Tokenizer 實測關鍵 Prompt 的真實 Token 數,別按字數拍腦袋估。
⭐ 加分點點出 Token 數同時是成本和質素的關鍵:System Prompt、歷史消息、檢索內容最終全拼成一段文本送給模型,窗口裏每一個 Token 都在跟別的內容搶位置。
Q9面試官
「大模型嘅訓練數據都係啲咩?數據同模型能力之間到底係咩關係?」
🎯 對方在考察什麼
考你是否理解「讀了多少,就能説多少」。答得出語料構成和數量級的人很少,能把數據覆蓋和幻覺聯繫起來的人更少。
🧭 答題框架
- 給構成:預訓練語料大頭是網頁文本約 70%,書籍約 12%,程式碼約 8%,學術論文和對話數據各約 5%。
- 給量級直覺:約 1B Token 的小模型訓練量相當於 75 萬本小説,一座小型圖書館;15T Token 量級相當於把整個互聯網讀了兩三遍。
- 給結論:訓練數據的質素和多樣性決定模型世界觀的上限。數據沒覆蓋的領域,模型要麼拒答,要麼編造。
- 落一個實測:同一個小眾人物問題,270M 模型直接捏造身份,1.8B 只能拒絕回答,30B 以上才答對。數據和參數夠了,知識才被正確覆蓋。
⭐ 加分點補一句大參數量不等於不幻覺:課程實測裏 70B 的 Llama 在小眾人物上照樣答錯,30B 的 Qwen 反而答對,覆蓋比規模更關鍵。
用這些課程頁組織答案 →
AI 的食物:訓練數據
Q10技術同事
「老闆想直接換最大參數嘅模型嚟解決幻覺,你都咁覺得?反正 API 一改就得。」
🎯 對方在考察什麼
試探你會順着老闆説,還是有自己的技術判斷。參數量等於能力,這是最常見的外行直覺,答錯這題會被技術同事歸進「不懂裝懂」那一類。
🧭 答題框架
- 先給反例:課程實測裏,70B 的 Llama-3.3 把歌手李知恩認成了同名女演員,出生年份差 6 年、代表作全錯;30B 的 Qwen 反而答對了。參數量大不代表不幻覺。
- 説清根因:知識邊界由訓練數據覆蓋決定。數據沒覆蓋到的小眾事實,多大的參數也只能編。
- 給正確思路:知識型錯誤靠 RAG 注入真實資料。換模型解決不了「參數裏沒有」的問題。
- 補成本賬:更大的模型意味着每個 Token 更貴、延遲更高。先歸因錯誤類型,再定方案。
⭐ 加分點説出「模型沒有不知道的概念,置信度不因信息不準確而下降」,這説明你理解幻覺的本性:換多大的模型都換不掉這一點。
Q11面試官
「Base 模型同 Chat 模型有咩分別?直接攞一個 Base 模型做客服,會發生咩事?」
🎯 對方在考察什麼
考你懂不懂模型的出廠形態。碰過開源模型的人立刻能答;只用過 ChatGPT 網頁版的人,會卡在「Base 模型是什麼」這一步。
🧭 答題框架
- 定義 Base:預訓練結束得到的是一台 Token 推 Token 機器,只會根據前文預測下一個最可能的 Token。它不會理解問題、思考答案、查閲知識。
- 給後果:直接問 Base 模型「紫霞仙子是誰」,它會按語料風格續寫出「紫霞仙子是哥哥,哥哥你喜歡我」這類文字,完全沒有在回答問題。
- 説清跨越:從 Base 到 Chat 靠兩步:先約定 Chat Template 對話格式,再用海量格式化對話數據做 SFT 指令微調,模型才學會以助理身份作答。
- 點破本質:SFT 之後模型做的仍然是 Token 預測,變的只是訓練數據,換成了格式化對話加高質素回答。
⭐ 加分點講出那段歷史:最初的思路就是偽造一段聊天記錄、助理那欄留空,讓補全機器把它續寫完整。知道對話能力是被構造出來的,面試官會眼前一亮。
Q12面試官
「GPT 之前都有 CNN、RNN、BERT,點解最後係 GPT 跑出嚟?」
🎯 對方在考察什麼
考技術演進的理解深度。背時間綫沒用,面試官想聽的是每代架構卡在哪裏,以及 PreTraining 範式為什麼是質變。
🧭 答題框架
- 説清舊路綫:GPT 之前都是任務專用模型,先確定任務再訓練,換任務就要換模型。
- 逐個點侷限:CNN 只能看滑動窗口內的詞,窗口外的關係一步捕捉不到;RNN 的記憶逐步衰減,長文本開頭的信息到結尾幾乎消失;BERT 雙向注意力理解強,但預訓練目標是填空,不擅長生成。
- 給 GPT 的答案:因果預訓練目標就是預測下一詞,和生成天然一致,不需要特殊任務數據,規模越大涌現的能力越驚人。
- 拔高到範式:PreTraining 用幾乎所有文字做 Token 預測,語法、常識、事實、邏輯全是副產品。預訓練一次,能力遷移到任意任務,這就是 Foundation Model 的核心思路。
⭐ 加分點補一句「換任務從重新訓練變成了改提示詞」,把架構演進和上下文窗口那頁連成同一條綫索,説明你看到的是全局。
Q13老闆
「用戶投訴 AI 客服傾住傾住就唔記得前面講過嘅說話。你哋日日話佢幾聰明,點解連記性都冇?」
🎯 對方在考察什麼
考你能不能把「模型沒有記憶」翻譯成老闆能接受的解釋,並馬上給出產品層面的補救動作。答一句「模型就是這樣的」等於沒答。
🧭 答題框架
- 先解釋機制:模型參數在對話時完全凍結,它本身沒有記憶。所謂多輪對話,是系統每次把完整歷史重發一遍讓它續寫。
- 定位這次的問題:歷史超過上下文窗口就會被截斷,截掉的內容對模型等於從未存在,用戶的感受就是「它忘了」。
- 給產品方案:控制歷史長度、把關鍵信息保留在上下文裏、避免臃腫的 System Prompt 和歷史互相擠佔窗口。
- 給承諾方式:量化觸發截斷的對話輪數和字數邊界,針對超長對話單獨設計,別承諾「以後不會忘」。
⭐ 加分點順手糾正一個更深的誤解:用戶説過的話不會被學進模型。今天告訴它「你叫小明」,明天重開對話它照樣不記得,對話只存在於上下文。
Q14面試官
「SFT 同預訓練有咩分別?Chat Template 裏嗰啲 <|im_start|> 標記係做乜用?」
🎯 對方在考察什麼
典型的追問題,通常出現在你提到 SFT 之後。考你是真看過對話格式,還是只會説「微調一下就行」。
🧭 答題框架
- 分清兩個階段:預訓練在海量通用語料上學統計規律;SFT 用格式化對話數據繼續訓練,讓模型學會在對話格式下做助理。
- 説清 Template:借鑑 Jinja 模板語言,用 <|im_start|> 和 <|im_end|> 這類 special token 包裹每條消息,區分 system、user、assistant 三種角色。
- 講生成起點:所有消息按格式拼成一段文本,模型從 <|im_start|>assistant 之後開始補全。SFT 訓練的就是它在這個位置輸出像樣的回答。
- 點破本質:SFT 本質上還是 Token 預測,只是訓練數據換成了格式化對話加高質素回答。
⭐ 加分點説出「你調 API 時傳的 messages 陣列,最終會按 Chat Template 組裝成一整段帶 special token 的文本送給模型」,把 API 層和訓練格式串起來,很少有 PM 能講到這層。
Q15面試官
「點解而家做 AI 產品,大部分需求靠寫提示詞就搞得掂?呢件事嘅邊界喺邊?」
🎯 對方在考察什麼
前半句考原理,後半句考邊界感。只會喊「Prompt 工程很重要」的人,説不出為什麼有效,更説不出什麼時候失效。
🧭 答題框架
- 給原理鏈條:模型按前文推後文,提示詞就是高質素前文,前文好後文就好。PreTraining 之後換任務無需重新訓練,把任務描述餵進去就行。
- 説清載體:這一切靠大上下文窗口撐着:任務説明、規則、Few-Shot 樣例全塞進前文,效果等同於專門訓練。
- 給邊界:Prompt 夠用的前提是知識在訓練數據裏,適合格式、風格、語氣類問題。私有知識、即時數據、知識截止後的內容要 RAG;固定領域風格和推理範式要微調。
- 給排查習慣:Prompt 改了沒用時,先查是不是 System Prompt 被截斷、歷史佔滿窗口。問題常出在上下文管理,跟 Prompt 寫得好不好沒關係。
⭐ 加分點引用決策矩陣那條「重訓修復錯誤是誤區,Prompt 先試,成本低 100 倍」,展示你有按成本排序的決策習慣。
Q16老闆
「競品發佈會上話佢哋嘅新模型已經解決咗幻覺問題。人哋都解決咗,點解我哋仲日日出錯?」
🎯 對方在考察什麼
考行業判斷力和向上管理。你要在不貶低自家團隊的前提下幫老闆識破誇大宣傳,還要給出「我們怎麼自證水平」的方案。
🧭 答題框架
- 先給判斷:幻覺是概率預測機制的必然產物,不可完全消除。宣稱徹底解決幻覺的説法都值得懷疑,這是行業共識,所有廠商都面對同一條邊界。
- 給拆穿方法:追問對方的評測口徑:幻覺率多少、測試集覆蓋什麼場景。沒有數字的「解決了」只是宣傳話術。
- 給自證方案:拿出我們自己的評測基綫,用已知答案的測試集量化幻覺率,和競品放在同一口徑下比。
- 給行動承諾:把幻覺率當可量化指標按周彙報收斂,寫進 PRD 做驗收標準,像「加載時間小於 2 秒」一樣管理它。
⭐ 加分點補上本章的關鍵認知:正確做法是用工程手段緩解,別指望模型更聰明後幻覺自己消失。幫老闆建立長期預期,就是 AI PM 的價值。
Q17面試官
「幻覺都有邊啲類型?唔好背定義,同我講一個你印象最深嘅具體例子。」
🎯 對方在考察什麼
考知識的顆粒度。四種類型很多人背得出,能落到具體例子的很少。後半句就是在篩掉背書的人。
🧭 答題框架
- 列全四類:事實性幻覺捏造不存在的事實和數據;來源幻覺引用不存在的論文、連結、作者;推理幻覺前提正確但推理步驟出錯;程式碼幻覺調用不存在的 API 或函式。
- 給一個狠例子:讓模型寫 pandas 多列排序,它會把 numpy.sort 的 stable 參數錯用到 sort_values 上。語法看着沒問題,一運行直接拋 TypeError。
- 説清為什麼危險:程式碼幻覺的殺傷力在於像真的:邏輯錯了,測試數據小的時候看不出來,上了生產才爆。
- 收在根因:模型對 API 只有大致印象,按概率拼出最像的寫法。概率上合理,事實上錯誤。
⭐ 加分點再補一層邊界:幻覺並非必然發生,prompt 和訓練數據完全對應時輸出是準確的,問題出在混搭不同來源。這個認知能把你和只會喊「AI 會胡説」的人區分開。
Q18技術同事
「你 PRD 裏寫『讓模型學習我們的知識庫』。我實現嘅時候,模型到底學咗未?你自己講吓。」
🎯 對方在考察什麼
摳字眼背後是摳認知。「學習」兩個字暴露你以為運行時能改模型。這題答不好,技術同事以後看你的每份 PRD 都會先打個問號。
🧭 答題框架
- 承認措辭問題:推理時參數完全凍結,模型學不進任何東西。RAG 是運行時把檢索到的文檔臨時注入上下文,用完就丟。
- 給準確類比:參數是寫完就封存的百科全書,上下文是放在桌上的參考資料。知識庫內容進的是後者。
- 説清工程含義:正因為是臨時注入,知識庫更新只要重建索引就生效,不用動模型,這恰恰是 RAG 的優點。
- 給修正動作:PRD 改成「檢索注入」,並寫清每次請求注入多少 Token、檢索失敗時怎麼兜底。
⭐ 加分點主動引用課程那句「RAG 是開卷考試,模型沒有變聰明,只是有了一個更好的起點」,技術同事聽到這句就知道你真懂了。
Q19面試官
「講吓 RAG 嘅完整流程。文檔切塊嘅粒度,你打算點樣定?」
🎯 對方在考察什麼
流程題考完整性,切塊追問考實操經驗。能分清構建階段和查詢階段的人不多,説得出切塊 Token 數的更少。
🧭 答題框架
- 先分兩個階段:知識庫構建是一次性離綫動作,文檔切塊後經 Embedding 模型轉成向量存入向量數據庫;查詢階段每次對話即時執行。
- 走完查詢鏈路:用戶問題用同一個 Embedding 模型向量化,按餘弦相似度檢索 Top-K 相關塊,拼進 Prompt 當參考資料,模型基於注入文檔生成帶來源的回答。
- 答切塊問題:粒度直接影響檢索質素:太大注入冗餘 Token 浪費錢,太小丟失上下文。最佳實踐約 512 到 800 Token 一塊,以標題、段落為邊界保留語義完整。
- 補關鍵細節:問題向量和文檔向量必須出自同一個 Embedding 模型,才能在同一語義空間裏比相似度。
⭐ 加分點點出向量檢索按語義匹配:「怎麼申請退貨」和「退款政策」關鍵詞不同也能對上,這是它比關鍵詞搜索強的根本原因。
Q20老闆
「你哋唔係話上咗 RAG 就得咩?呢個月 API 帳單點解反而貴咗一截?」
🎯 對方在考察什麼
考成本結構的理解。RAG 換來的是準確性,代價就是花錢。答不出帳單為什麼漲,説明當初上 RAG 時根本沒算過賬。
🧭 答題框架
- 講清成本大頭:漲在 Prompt 增大:每次查詢多注入 500 到 2000 Token,LLM 費用跟着倍增。向量化和檢索本身反倒便宜,問題向量化約 0.1 元每百萬 Token。
- 給最關鍵的優化:先做意圖識別判斷要不要檢索。約 70% 的對話其實不需要查文檔,直接回答更快更便宜。
- 給組合拳:關鍵詞觸發能跳過 30% 到 70% 的查詢;簡單問題路由到小模型,整體 LLM 費用降 60% 到 80%;相似問題走語義緩存,向量相似度 0.95 以上直接複用結果。
- 給管理動作:把 RAG 觸發率和單次對話成本做成看板,按周看優化收斂。
⭐ 加分點一句話點透:生產級 RAG 的核心是「什麼情況下不用 RAG」,做好過濾和路由才是省錢的關鍵。這句能讓老闆對你的成本意識放心。
Q21技術同事
「你日日話 RAG 效果差要優化。真係叫你排查,你知唔知應該睇邊幾個環節?」
🎯 對方在考察什麼
試探你對 RAG 鏈路的掌握是真是假。説得出具體環節和指標的人,技術才願意帶着一起排查;説不出的人只配在旁邊催進度。
🧭 答題框架
- 先查檢索環節:Chunking 粒度、Embedding 模型、相似度閾值,三個最常見的壞點。盯檢索命中率這個指標,課程案例裏 78% 對目標 85%,就是明確的未達標信號。
- 再查知識庫本身:RAG 的質素上限就是知識庫質素。文檔過期、內容互相矛盾,檢索再準也答錯。
- 再看生成環節:注入的內容有限,模型會用訓練記憶腦補文檔外的部分,形成 RAG 加幻覺的混合輸出,比純幻覺更難識別。
- 給排查抓手:強制顯示引用來源,每個回答可回溯到具體文檔塊,壞 case 一眼能定位是檢索錯了還是生成飄了。
⭐ 加分點提醒一個反直覺的風險:檢索召回了錯誤文檔時,幻覺不但沒減少,還多披了一層權威出處的外衣,用戶反而更容易信。
Q22面試官
「將 Temperature 調到 0,輸出每次都一樣。呢個係咪就等於答案係啱?」
🎯 對方在考察什麼
陷阱題,考確定性和正確性的區別。順着點頭的人,對採樣機制的理解只停在「調低更穩」這個表面。
🧭 答題框架
- 先拆機制:Temperature 在 softmax 之前對 logits 做等比縮放。T 越小分佈越尖鋭,調到 0 相當於每步都鎖定概率最高的詞。
- 點破陷阱:低温鎖定的是「最可能」,最可能不等於最正確。訓練數據裏那個答案本身是錯的,模型就會極其穩定地錯。
- 給邊界:Temperature 只影響每步怎麼採樣,不影響知識邊界。模型不知道的事,低温下照樣編,只是編得更一致。
- 給結論:參數調優是成本最低的第一道防綫,解決的是表達穩定問題。事實準確性要求高的場景,必須搭配 RAG 或人工審核。
⭐ 加分點指出穩定地錯比隨機地錯更危險:輸出可復現,容易讓團隊誤以為答案可靠,反而放鬆了警惕。
Q23技術同事
「產品要求每個問題都先查一遍知識庫,延遲直接多咗兩秒。真係每條都要查嗎?」
🎯 對方在考察什麼
一半是抱怨,一半是給你遞台階。他想聽你主動砍掉不必要的檢索,這也在檢驗你把 RAG 當銀彈還是當工具。
🧭 答題框架
- 先接住:確實不該全量檢索。約 70% 的對話不需要查文檔,「今天幾號」這類問題直接答就行。
- 給過濾方案:上意圖分類器或簡單規則做關鍵詞觸發,「我們的退款政策」這類才走 RAG,能跳過 30% 到 70% 的查詢。
- 給緩存方案:高頻相似問題走語義緩存,問題向量相似度 0.95 以上直接返回緩存結果,跳過整條檢索鏈路,延遲和費用都能降一半左右。
- 給場景邊界:閒聊、創意場景本來就不適合 RAG,檢索注入反而讓回答死板。
⭐ 加分點把決策框架説全:知識時效性強、私有知識庫、答錯代價高,滿足這些才值得為檢索付出延遲。這個判斷本來就該 PM 來做,而且要寫進方案。
Q24老闆
「AI 寫嘅季度報告裏引咗一份根本唔存在嘅行業報告,差啲直接上董事會。呢啲事以後點樣杜絕?」
🎯 對方在考察什麼
事故複盤題。重點聽你敢不敢説「杜絕不了,但能攔住」,以及你的攔截網設計得夠不夠具體。
🧭 答題框架
- 先定性:這是典型的來源幻覺。模型編數據和編報告名,用的是同一套概率續寫能力,單靠叮囑它「別編」解決不了。
- 給第一道防綫:System Prompt 約束:具體數字、報告名、機構名如非用戶提供,必須標註「需核實」,寧可留空白讓人填。
- 給第二道防綫:分級審核:對外材料屬於高風險內容,AI 只做初稿,發出前必須有人簽字確認。
- 給閉環:這條 bad case 進評測集,走歸因、Prompt 迭代、迴歸驗證的流程,同類問題的複發率才會真正降下來。
⭐ 加分點給老闆一個可落地的制度句:AI 輔助生成的對外內容,一律帶「需核實」清單,核對人簽字後才算完成。高風險場景裏人工兜底本身就是產品設計的一部分。
Q25面試官
「System Prompt 裏寫一句『不確定就説不知道』,呢個到底有冇用?原理係咩?」
🎯 對方在考察什麼
考你對 Prompt 約束的理解深度。答「有用」或「沒用」都不及格,面試官要的是機制層面的解釋和失效條件。
🧭 答題框架
- 給機制:模型推每個 Token 時,上下文裏的每個 Token 都在影響概率分佈。約束詞就是高質素前文,拉高「承認不知道」這個序列的概率,壓低編造序列的概率。
- 給有效條件:模型對問題本身有不確定感時最有效,適合超出知識範圍的問題、模糊查詢、時效性信息。
- 給失效條件:模型對某個錯誤答案高度自信時,第一候選詞就是錯的,約束詞幹預不了。訓練數據裏的系統性錯誤、被當成事實的過時知識,都屬於這類。
- 給搭配:對「高度自信但可能錯」的領域,Prompt 約束不夠,要配 RAG 注入真實知識,或人工審核兜底。
⭐ 加分點一句話點破根源:模型不知道自己不知道。約束指令改變的是概率分佈,給不了它自知之明,這就是 Prompt 手段的天花板。
用這些課程頁組織答案 →
Prompt 約束為什麼有效
Q26面試官
「叫你負責一個 AI 問答產品,你點樣量化佢嘅幻覺水平?上綫前後分別做咩?」
🎯 對方在考察什麼
考體系化能力。零散地説「多測測」不行,面試官想看到上綫前基綫、上綫後審核、長期閉環這個完整結構,還要有具體指標。
🧭 答題框架
- 上綫前建基綫:用一批已知正確答案的問題做幻覺測試集,量化幻覺率、設准入門檻。課程案例的口徑:事實準確率 94.2%,幻覺率 5.8% 對目標小於 3%,未達標就不上綫。
- 上綫後分級審核:按風險自動路由:低風險直接發出,高風險先人工審核再發送。金融、醫療這類領域 AI 只出初稿。
- 長期做反饋閉環:審核發現的幻覺標成 bad case,走歸因、Prompt 迭代、迴歸驗證的循環。案例裏發現到修復平均 3.2 天。
- 指標進 PRD:「幻覺率小於 3%」要像「加載時間小於 2 秒」一樣,成為可量化的驗收標準。
⭐ 加分點主動説出評測的盲區:測試集覆蓋的是已知風險點,評測通過不等於全面可靠,長尾問題要靠綫上審核持續回補進測試集。
用這些課程頁組織答案 →
評測 + 人工審核
Q27技術同事
「評測集全綠咗先上嘅綫,結果呢個禮拜又冒出十幾條 bad case。你嗰個評測係咪白做咗?」
🎯 對方在考察什麼
帶情緒的挑戰題。考你能不能解釋評測的天然侷限,同時把 bad case 變成流程資產,別被一句「白做了」帶進防禦姿態。
🧭 答題框架
- 先正面回應:評測保證的是已知風險點不復發。測試集之外的長尾問題,模型照樣可能幻覺,評測通過從來不等於全面可靠。
- 給數據視角:看閉環速度,別只看單週新增。課程案例的節奏:本週新增 12 條 bad case,已修復歸檔 47 條,迴歸通過率 96.8%。
- 給流程:每條 bad case 走四步:發現、歸因分析、Prompt 迭代、迴歸驗證。修完加入測試集,評測集就這樣越滾越厚。
- 給根因解釋:模型沒有自我檢查機制,推錯一個 Token 會以它為基礎繼續推,誤差累積。評測加審核是架在輸出端的外部糾錯層,它攔結果,管不住生成過程本身。
⭐ 加分點説出「前三個手段改變概率,這一手段攔截結果」這個分層,技術同事立刻明白你對四種手段的定位是清楚的。
用這些課程頁組織答案 →
錯誤反饋閉環
Q28面試官
「模型答錯咗一個問題,你點樣判斷應該改 Prompt,定係應該做微調?」
🎯 對方在考察什麼
經典排查題,考歸因能力。兩條修復路綫成本差兩個數量級,搞錯方向的團隊會白燒幾周時間。面試官在看你有沒有排查順序。
🧭 答題框架
- 先分錯誤類型:是上下文沒給對,還是參數裏壓根沒這個知識?兩件事的修復方式完全不同,搞錯方向浪費大量時間。
- 給排查順序:先試 Prompt:把任務描述、規則、示例補全再測。知識在訓練數據裏、問題出在格式風格語氣的,Prompt 就能修,成本比重訓低 100 倍。
- 判斷要不要 RAG:私有知識、即時數據、知識截止日期之後的內容,參數裏沒有,Prompt 寫再多也沒用,要檢索注入。
- 最後才是微調:固定專業領域的風格、需要改變推理範式,這類才值得微調。微調改的是行為風格,不適合注入時效性知識。
⭐ 加分點補一個常見坑:很多「Prompt 改了沒用」的 case,真相是 System Prompt 被截斷或歷史佔滿窗口。問題在上下文管理,兩條修復路綫都不用動。
Q29老闆
「用戶問 AI 晚飯食咗咩,佢話自己煮咗番茄雞蛋麪,截圖都傳到網上。佢一個程式,點解要撒謊?」
🎯 對方在考察什麼
看似吐槽,實際在問幻覺的本質。答好了能幫老闆建立對生成式 AI 的正確心智;答成「這是 bug 我們修」,就把自己埋了。
🧭 答題框架
- 先解釋機制:它沒有撒謊的動機,只是在做概率續寫。「吃了嗎」後面接「吃了」是訓練語料裏最高頻的應答模式,被追問時它又按語境概率編出了具體細節。
- 説清對齊的邊界:只有被用戶明確質疑時,RLHF 對齊訓練才讓它承認自己沒有身體。用戶不追問,它會一直演下去,置信度不因內容虛假而下降。
- 給關鍵認知:幻覺和創意同源。它能編出番茄雞蛋麪這種生動細節,和它能寫文案用的是完全相同的能力,消滅幻覺的同時創意也會沒了。
- 給產品動作:分場景定策略:閒聊場景的角色扮演無傷大雅,事實場景才需要 RAG 和審核壓制。全局一刀切,兩頭都做不好。
⭐ 加分點用「兩本書」幫老闆建立心智:參數是封存的百科全書,上下文是桌上的參考資料。它永遠在這兩本書裏找最像的續寫,找不到也不會説不知道。
用這些課程頁組織答案 →
日常對話幻覺案例
Q30面試官
「學咗咁多大模型知識,你觀察落嚟,AI 產品經理最容易踩嘅認知誤區有邊啲?」
🎯 對方在考察什麼
收尾開放題,考知識內化程度。列舉誤區人人都會,面試官在聽你能不能把誤區和底層機制連起來,順便看你的自我認知。
🧭 答題框架
- 列高頻誤區:調高 Temperature 更聰明,實際只是更隨機;RAG 讓模型學習了文檔,實際只是運行時臨時注入;模型在調用 API,實際它只是輸出了格式化文字;答錯就重新訓練,實際 Prompt 先試成本低 100 倍。
- 挖共同根源:這四個誤區都源於沒分清訓練和推理的邊界。參數凍結之後,一切運行時手段都是在操作上下文。
- 上升到方法:所有工程化操作本質都是對 message list 的處理。拿這個視角看任何新方案,都能判斷它在哪一層起作用、侷限在哪。
- 給自我定位:用鄧寧-克魯格曲綫收尾:剛學會名詞時最危險,覺得什麼都懂。持續動手、持續被打臉,才能從愚昧之巔走到平穩高原。
⭐ 加分點收一句課程的原話:弱小和無知從來都不是生存的障礙,傲慢才是。面試裏能自然引出認知層的話,比多背十個術語更加分。
最後一個建議
這 30 題的正確用法是開口講一遍,對着同事、朋友或者錄音講。看懂不算數。講不順的地方,就是你以為懂了但還沒懂的地方,點關聯課程頁回去補上。