他們會這樣考你
大模型基礎 · 30 道靈魂拷問
大模型原理篇學完了,懂了和能講出來之間還差一場實戰。這 30 個問題來自三個真實場景,先自己開口回答,再看框架。
怎麼用這一頁
每道題都標註了提問者。他們問同一塊知識,想聽的東西卻不一樣。
🎙 面試官想驗證你是真懂,還是在背名詞
👔 老闆要的是解釋和承諾
🛠 技術同事在試探你值不值得信任
每題給出三層:對方在考察什麼 → 答題框架 → 加分點。答不上來的環節,點末尾的課程頁回去補。
Q1面試官
「用你自己的話說說,ChatGPT 這類大模型是怎麼生成回答的?它是在思考嗎?」
🎯 對方在考察什麼
開場必問題,決定後面所有問題的深度。考的是你能不能把機率預測下一個 Token 這件事講成人話。背名詞的人會堆砌 Transformer、注意力機制,真懂的人會用一個例子把機制說清楚。
🧭 答題框架
- 先給本質:大模型是超大型機率預測機器,每次只做一件事,根據已有的所有 Token 預測下一個 Token 出現的機率,逐個生成。
- 區分訓練和推理:訓練是在海量文字上學統計規律;你和它對話時參數已經凍結,它沒有在學習,只是在計算。
- 正面回答思考問題:它沒有人類意義上的思考,規模夠大後又確實表現出類似推理的能力。所以既不要神化,也不要貶低成復讀機。
- 落一個例子:輸入「今天天氣真」,模型給出好 62% / 差 18% / 冷 9% 這樣的分佈,按機率取樣。整段回答就是這個動作重複幾百次。
⭐ 加分點主動指出對話不等於學習、參數是凍結的。很多 PM 以為模型會從使用者對話裡持續學習,能糾正這個誤區,說明你理解到位了。
Q2面試官
「明明是聊天產品,為什麼 OpenAI 的介面叫 chat/completions(補全)?多輪對話是怎麼實現的?」
🎯 對方在考察什麼
這是判斷你有沒有真正碰過 API 的分水嶺題。只用過 ChatGPT 網頁版的人答不出來;理解 message list 機制的人,後面聊上下文、成本、Agent 都能接得住。
🧭 答題框架
- 點破本質:模型底層是續寫機器。所謂對話,是把歷史包裝成聊天記錄格式,讓模型續寫出助手的下一句。
- 多輪的真相:模型沒有記憶。每一輪都是把完整的 message list(system + 歷史 user/assistant + 當前提問)重新發一遍。
- 補上工程環節:模型能聽懂對話格式,靠的是 Chat Template + SFT 指令微調,這是 Base 模型學會說話的關鍵一步。
- 拔高一層:所有 AI Harness 操作(RAG、記憶、Agent)本質都是對這個 message list 的處理。理解它,就找到了所有方案的入口。
⭐ 加分點能順勢說出成本含義:歷史每輪重發,意味著多輪對話越聊越貴。後面的成本優化方案都是衝這個來的。
Q3老闆
「我們的 AI 客服昨天又編了一條不存在的退款政策。你跟我解釋一下為什麼,什麼時候才能徹底修好?」
🎯 對方在考察什麼
這題不考知識,考期望管理。你敢不敢說「徹底修不好」?說完之後,能不能馬上給出讓老闆放心的方案和量化承諾?答「我讓技術看看」是最差答案。
🧭 答題框架
- 先給結論、不迴避:幻覺是機率預測機制的必然產物,無法徹底消除,但可以用工程手段壓到業務可接受的水平。
- 再解釋根因:兩個來源:參數知識有誤(訓練資料錯誤或過期),以及上下文理解偏差(模型總是選最可能的續寫,最可能不等於最準確)。
- 給方案組合拳:RAG 注入真實退款政策文件 + Prompt 約束「只依據文件回答」 + 調低 Temperature + 上線評測與人工審核兜底。
- 給量化承諾方式:定義幻覺率指標(抽樣審核),按周彙報收斂情況,把「什麼時候修好」轉化成「指標降到多少」。
⭐ 加分點補一句「任何承諾能徹底消除幻覺的供應商都在誇大」,幫老闆建立對整個行業的正確預期,這是 AI PM 的核心價值之一。
Q4面試官
「緩解幻覺的手段你知道哪些?如果資源有限只能先上一個,你選哪個,為什麼?」
🎯 對方在考察什麼
前半句考知識廣度,後半句才是重點:考決策能力和成本意識。這題沒有標準答案。直接給答案的人不及格,先反問一句「什麼場景」的人才及格。
🧭 答題框架
- 列全四種手段:Prompt 約束(最便宜)、RAG(對知識型幻覺最有效但有成本)、Temperature 調低(只降隨機性、不補知識)、評測 + 人工審核(外部兜底)。
- 先反問場景:幻覺主要是編造事實,還是表達不穩定?知識庫變不變?預算多少?
- 給條件化答案:知識型幻覺(編政策、編資料)→ RAG;表達不穩定 → Prompt 約束 + 低 Temperature,幾乎零成本先上。
- 補一個原則:無論選哪個,評測先行。沒有評測就無法驗證效果,等於白做。
⭐ 加分點指出實際專案裡這四種要組合使用、分階段上,單選題只存在於面試裡。能說出先用 Prompt 和 Temperature 止血、再上 RAG 治本這種節奏的人很少。
Q5技術同事
「產品要接入我們內部最新的產品手冊,你該不會是打算讓我們重新訓練一個模型吧?」
🎯 對方在考察什麼
技術同事半開玩笑的挑戰,實際在試探你懂不懂訓練和推理的邊界。答錯這題(比如回一句「對啊,訓練一下不行嗎」),技術團隊對你的信任會立刻打折;答對了,後面的合作會順暢得多。
🧭 答題框架
- 先接住梗:不用重訓。參數凍結不代表知識進不去,上下文視窗就是知識的入口。
- 給方案:上 RAG。手冊切塊、建向量索引,使用者提問時檢索相關段落注入上下文。手冊更新只需重建索引,天級生效,成本和重訓差幾個數量級。
- 說清微調的正確用途:微調改的是行為風格(語氣、格式、領域話術),不適合注入時效性知識。知識一旦進權重,每次更新都要再訓一次。
- 展示成本意識:RAG 也有代價:每次請求 token 變多、延遲上升,需要配合快取、路由、精準切塊做優化。
⭐ 加分點能說出 RAG 的代價和優化策略(語義快取、關鍵詞觸發、模型路由),說明你真的算過帳。「用 RAG」三個字誰都會背。
Q6面試官
「Temperature 和 Top-P 是什麼?你們的產品裡會怎麼設?」
🎯 對方在考察什麼
考你有沒有真的動手調過參數。後半句「你們的產品」是在等一個場景化答案。張口報一個固定數值(「設 0.7 就行」)的人,基本沒實際調過。
🧭 答題框架
- 說清機制:Temperature 控制機率分佈的陡峭程度,越低越確定、越高越發散;Top-P 控制取樣的候選池範圍,兩者配合決定輸出的隨機性。
- 給場景化設定:客服 / 事實問答 / 資料提取 → 調低(0~0.3);創意文案 / 頭腦風暴 → 調高(0.7 以上)。
- 說清邊界:這只能緩解表達上的隨機性,解決不了知識缺失。低 Temperature 下模型依然會自信地胡說。
- 給驗證方法:參數值要用評測集 A/B 驗證出來。拍腦袋定一個全產品共用的值,不可取。
⭐ 加分點主動區分隨機性幻覺和知識性幻覺,Temperature 只治前者。這個邊界很多人說不清。
用這些課程頁組織答案 →
Temperature & Top-P 互動演示
Q7面試官
「上下文視窗是什麼?現在模型都到 1M Token 了,是不是視窗越大越好?」
🎯 對方在考察什麼
前半句是概念題,後半句是陷阱題。順著說「當然越大越好」就掉進去了。考的是成本意識,以及你知不知道長上下文的真實侷限。
🧭 答題框架
- 說清概念:視窗 = 模型一次能看到的 Token 總量(輸入 + 輸出),超出部分被截斷,對模型來說等於從未存在。
- 戳破陷阱:更大的視窗意味著更貴的帳單。Token 按量計費,把資料全塞進去,成本跟著線性上漲。
- 給技術侷限:長上下文存在中間遺忘(lost in the middle)問題:資訊越多,注意力越稀釋,中段內容的召回率明顯下降。
- 給正確姿勢:大視窗只是能力上限。正確做法是上下文工程:檢索、壓縮、篩選,讓視窗裡只放該放的東西。
⭐ 加分點能報出主流模型的視窗規格(Qwen 1M / Claude 200K / GPT 128K),再點一句視窗大小會影響架構選型,會顯得對行業很熟。
Q8面試官
「Token 到底是什麼?跟字有什麼區別?你們做產品的時候為什麼要在意這個東西?」
🎯 對方在考察什麼
基礎概念題,實際考的是成本敏感度。很多 PM 說得出 Token 這個詞,算不清一段 Prompt 要花多少錢。後半句在等一個跟錢和視窗掛鉤的回答。
🧭 答題框架
- 先給定義:Token 是模型處理文字的基本單元,訓練第一步就是 Tokenization,把連續文字切成詞表裡的單元。中文一個字約對應 1 到 3 個 Token,英文一個詞約 1 個 Token。
- 連到成本:推理按 Token 計費,輸入輸出都算錢。一個看著只有 500 字的 Prompt 模板,實際可能吃掉 1500 Token,多輪對話每輪重發,費用跟著累積。
- 連到視窗:上下文視窗的額度也按 Token 算,超出就截斷。模板越臃腫,留給正文和歷史的空間越少。
- 落一個動作:上線前用 Tokenizer 實測關鍵 Prompt 的真實 Token 數,別按字數拍腦袋估。
⭐ 加分點點出 Token 數同時是成本和品質的關鍵:System Prompt、歷史訊息、檢索內容最終全拼成一段文字送給模型,視窗裡每一個 Token 都在跟別的內容搶位置。
Q9面試官
「大模型的訓練資料都是些什麼?資料和模型能力之間到底是什麼關係?」
🎯 對方在考察什麼
考你是否理解「讀了多少,就能說多少」。答得出語料構成和數量級的人很少,能把資料覆蓋和幻覺聯絡起來的人更少。
🧭 答題框架
- 給構成:預訓練語料大頭是網頁文字約 70%,書籍約 12%,程式碼約 8%,學術論文和對話資料各約 5%。
- 給量級直覺:約 1B Token 的小模型訓練量相當於 75 萬本小說,一座小型圖書館;15T Token 量級相當於把整個網際網路讀了兩三遍。
- 給結論:訓練資料的品質和多樣性決定模型世界觀的上限。資料沒覆蓋的領域,模型要麼拒答,要麼編造。
- 落一個實測:同一個小眾人物問題,270M 模型直接捏造身份,1.8B 只能拒絕回答,30B 以上才答對。資料和參數夠了,知識才被正確覆蓋。
⭐ 加分點補一句大參數量不等於不幻覺:課程實測裡 70B 的 Llama 在小眾人物上照樣答錯,30B 的 Qwen 反而答對,覆蓋比規模更關鍵。
用這些課程頁組織答案 →
AI 的食物:訓練資料
Q10技術同事
「老闆想直接換最大參數的模型來解決幻覺,你也這麼覺得?反正 API 一改就行。」
🎯 對方在考察什麼
試探你會順著老闆說,還是有自己的技術判斷。參數量等於能力,這是最常見的外行直覺,答錯這題會被技術同事歸進「不懂裝懂」那一類。
🧭 答題框架
- 先給反例:課程實測裡,70B 的 Llama-3.3 把歌手李知恩認成了同名女演員,出生年份差 6 年、代表作全錯;30B 的 Qwen 反而答對了。參數量大不代表不幻覺。
- 說清根因:知識邊界由訓練資料覆蓋決定。資料沒覆蓋到的小眾事實,多大的參數也只能編。
- 給正確思路:知識型錯誤靠 RAG 注入真實資料。換模型解決不了「參數裡沒有」的問題。
- 補成本帳:更大的模型意味著每個 Token 更貴、延遲更高。先歸因錯誤類型,再定方案。
⭐ 加分點說出「模型沒有不知道的概念,置信度不因資訊不準確而下降」,這說明你理解幻覺的本性:換多大的模型都換不掉這一點。
Q11面試官
「Base 模型和 Chat 模型有什麼區別?直接拿一個 Base 模型做客服,會發生什麼?」
🎯 對方在考察什麼
考你懂不懂模型的出廠形態。碰過開源模型的人立刻能答;只用過 ChatGPT 網頁版的人,會卡在「Base 模型是什麼」這一步。
🧭 答題框架
- 定義 Base:預訓練結束得到的是一臺 Token 推 Token 機器,只會根據前文預測下一個最可能的 Token。它不會理解問題、思考答案、查閱知識。
- 給後果:直接問 Base 模型「紫霞仙子是誰」,它會按語料風格續寫出「紫霞仙子是哥哥,哥哥你喜歡我」這類文字,完全沒有在回答問題。
- 說清跨越:從 Base 到 Chat 靠兩步:先約定 Chat Template 對話格式,再用海量格式化對話資料做 SFT 指令微調,模型才學會以助理身份作答。
- 點破本質:SFT 之後模型做的仍然是 Token 預測,變的只是訓練資料,換成了格式化對話加高品質回答。
⭐ 加分點講出那段歷史:最初的思路就是偽造一段聊天記錄、助理那欄留空,讓補全機器把它續寫完整。知道對話能力是被構造出來的,面試官會眼前一亮。
Q12面試官
「GPT 之前也有 CNN、RNN、BERT,為什麼最後是 GPT 跑出來了?」
🎯 對方在考察什麼
考技術演進的理解深度。背時間線沒用,面試官想聽的是每代架構卡在哪裡,以及 PreTraining 典範為什麼是質變。
🧭 答題框架
- 說清舊路線:GPT 之前都是任務專用模型,先確定任務再訓練,換任務就要換模型。
- 逐個點侷限:CNN 只能看滑動視窗內的詞,視窗外的關係一步捕捉不到;RNN 的記憶逐步衰減,長文字開頭的資訊到結尾幾乎消失;BERT 雙向注意力理解強,但預訓練目標是填空,不擅長生成。
- 給 GPT 的答案:因果預訓練目標就是預測下一詞,和生成天然一致,不需要特殊任務資料,規模越大涌現的能力越驚人。
- 拔高到典範:PreTraining 用幾乎所有文字做 Token 預測,語法、常識、事實、邏輯全是副產品。預訓練一次,能力遷移到任意任務,這就是 Foundation Model 的核心思路。
⭐ 加分點補一句「換任務從重新訓練變成了改提示詞」,把架構演進和上下文視窗那頁連成同一條線索,說明你看到的是全域。
Q13老闆
「使用者投訴 AI 客服聊著聊著就忘了前面說的話。你們天天說它多聰明,怎麼連記性都沒有?」
🎯 對方在考察什麼
考你能不能把「模型沒有記憶」翻譯成老闆能接受的解釋,並馬上給出產品層面的補救動作。答一句「模型就是這樣的」等於沒答。
🧭 答題框架
- 先解釋機制:模型參數在對話時完全凍結,它本身沒有記憶。所謂多輪對話,是系統每次把完整歷史重發一遍讓它續寫。
- 定位這次的問題:歷史超過上下文視窗就會被截斷,截掉的內容對模型等於從未存在,使用者的感受就是「它忘了」。
- 給產品方案:控制歷史長度、把關鍵資訊保留在上下文裡、避免臃腫的 System Prompt 和歷史互相擠佔視窗。
- 給承諾方式:量化觸發截斷的對話輪數和字數邊界,針對超長對話單獨設計,別承諾「以後不會忘」。
⭐ 加分點順手糾正一個更深的誤解:使用者說過的話不會被學進模型。今天告訴它「你叫小明」,明天重開對話它照樣不記得,對話只存在於上下文。
Q14面試官
「SFT 和預訓練有什麼區別?Chat Template 裡那些 <|im_start|> 標記是做什麼用的?」
🎯 對方在考察什麼
典型的追問題,通常出現在你提到 SFT 之後。考你是真看過對話格式,還是只會說「微調一下就行」。
🧭 答題框架
- 分清兩個階段:預訓練在海量通用語料上學統計規律;SFT 用格式化對話資料繼續訓練,讓模型學會在對話格式下做助理。
- 說清 Template:借鑑 Jinja 模板語言,用 <|im_start|> 和 <|im_end|> 這類 special token 包裹每條訊息,區分 system、user、assistant 三種角色。
- 講生成起點:所有訊息按格式拼成一段文字,模型從 <|im_start|>assistant 之後開始補全。SFT 訓練的就是它在這個位置輸出像樣的回答。
- 點破本質:SFT 本質上還是 Token 預測,只是訓練資料換成了格式化對話加高品質回答。
⭐ 加分點說出「你調 API 時傳的 messages 陣列,最終會按 Chat Template 組裝成一整段帶 special token 的文字送給模型」,把 API 層和訓練格式串起來,很少有 PM 能講到這層。
Q15面試官
「為什麼現在做 AI 產品,大部分需求靠寫提示詞就能滿足?這件事的邊界在哪?」
🎯 對方在考察什麼
前半句考原理,後半句考邊界感。只會喊「Prompt 工程很重要」的人,說不出為什麼有效,更說不出什麼時候失效。
🧭 答題框架
- 給原理鏈條:模型按前文推後文,提示詞就是高品質前文,前文好後文就好。PreTraining 之後換任務無需重新訓練,把任務描述餵進去就行。
- 說清載體:這一切靠大上下文視窗撐著:任務說明、規則、Few-Shot 樣例全塞進前文,效果等同於專門訓練。
- 給邊界:Prompt 夠用的前提是知識在訓練資料裡,適合格式、風格、語氣類問題。私有知識、即時資料、知識截止後的內容要 RAG;固定領域風格和推理典範要微調。
- 給排查習慣:Prompt 改了沒用時,先查是不是 System Prompt 被截斷、歷史佔滿視窗。問題常出在上下文管理,跟 Prompt 寫得好不好沒關係。
⭐ 加分點引用決策矩陣那條「重訓修復錯誤是誤區,Prompt 先試,成本低 100 倍」,展示你有按成本排序的決策習慣。
Q16老闆
「競品發表會上說他們的新模型已經解決了幻覺問題。人家都解決了,我們怎麼還天天出錯?」
🎯 對方在考察什麼
考行業判斷力和向上管理。你要在不貶低自家團隊的前提下幫老闆識破誇大宣傳,還要給出「我們怎麼自證水平」的方案。
🧭 答題框架
- 先給判斷:幻覺是機率預測機制的必然產物,不可完全消除。宣稱徹底解決幻覺的說法都值得懷疑,這是行業共識,所有廠商都面對同一條邊界。
- 給拆穿方法:追問對方的評測口徑:幻覺率多少、測試集覆蓋什麼場景。沒有數字的「解決了」只是宣傳話術。
- 給自證方案:拿出我們自己的評測基線,用已知答案的測試集量化幻覺率,和競品放在同一口徑下比。
- 給行動承諾:把幻覺率當可量化指標按周彙報收斂,寫進 PRD 做驗收標準,像「載入時間小於 2 秒」一樣管理它。
⭐ 加分點補上本章的關鍵認知:正確做法是用工程手段緩解,別指望模型更聰明後幻覺自己消失。幫老闆建立長期預期,就是 AI PM 的價值。
Q17面試官
「幻覺都有哪些類型?別背定義,跟我講一個你印象最深的具體例子。」
🎯 對方在考察什麼
考知識切得多細。四種類型很多人背得出,能落到具體例子的很少。後半句就是在篩掉背書的人。
🧭 答題框架
- 列全四類:事實性幻覺捏造不存在的事實和資料;來源幻覺引用不存在的論文、連結、作者;推理幻覺前提正確但推理步驟出錯;程式碼幻覺呼叫不存在的 API 或函式。
- 給一個狠例子:讓模型寫 pandas 多列排序,它會把 numpy.sort 的 stable 參數錯用到 sort_values 上。語法看著沒問題,一執行直接拋 TypeError。
- 說清為什麼危險:程式碼幻覺的殺傷力在於像真的:邏輯錯了,測試資料小的時候看不出來,上了生產才爆。
- 收在根因:模型對 API 只有大致印象,按機率拼出最像的寫法。機率上合理,事實上錯誤。
⭐ 加分點再補一層邊界:幻覺並非必然發生,prompt 和訓練資料完全對應時輸出是準確的,問題出在混搭不同來源。這個認知能把你和只會喊「AI 會胡說」的人區分開。
Q18技術同事
「你 PRD 裡寫『讓模型學習我們的知識庫』。我實現的時候,模型到底學沒學?你自己說說。」
🎯 對方在考察什麼
摳字眼背後是摳認知。「學習」兩個字暴露你以為執行時能改模型。這題答不好,技術同事以後看你的每份 PRD 都會先打個問號。
🧭 答題框架
- 承認措辭問題:推理時參數完全凍結,模型學不進任何東西。RAG 是執行時把檢索到的文件臨時注入上下文,用完就丟。
- 給準確類比:參數是寫完就封存的百科全書,上下文是放在桌上的參考資料。知識庫內容進的是後者。
- 說清工程含義:正因為是臨時注入,知識庫更新只要重建索引就生效,不用動模型,這恰恰是 RAG 的優點。
- 給修正動作:PRD 改成「檢索注入」,並寫清每次請求注入多少 Token、檢索失敗時怎麼兜底。
⭐ 加分點主動引用課程那句「RAG 是開卷考試,模型沒有變聰明,只是有了一個更好的起點」,技術同事聽到這句就知道你真懂了。
Q19面試官
「說說 RAG 的完整流程。文件切塊的粒度,你打算怎麼定?」
🎯 對方在考察什麼
流程題考完整性,切塊追問考實操經驗。能分清構建階段和查詢階段的人不多,說得出切塊 Token 數的更少。
🧭 答題框架
- 先分兩個階段:知識庫構建是一次性離線動作,文件切塊後經 Embedding 模型轉成向量存入向量資料庫;查詢階段每次對話即時執行。
- 走完查詢鏈路:使用者問題用同一個 Embedding 模型向量化,按餘弦相似度檢索 Top-K 相關塊,拼進 Prompt 當參考資料,模型基於注入文件生成帶來源的回答。
- 答切塊問題:粒度直接影響檢索品質:太大注入冗餘 Token 浪費錢,太小丟失上下文。最佳實踐約 512 到 800 Token 一塊,以標題、段落為邊界保留語義完整。
- 補關鍵細節:問題向量和文件向量必須出自同一個 Embedding 模型,才能在同一語義空間裡比相似度。
⭐ 加分點點出向量檢索按語義匹配:「怎麼申請退貨」和「退款政策」關鍵詞不同也能對上,這是它比關鍵詞搜尋強的根本原因。
Q20老闆
「你們不是說上了 RAG 就好了嗎?這個月 API 帳單怎麼反而漲了一截?」
🎯 對方在考察什麼
考成本結構的理解。RAG 換來的是準確性,代價就是花錢。答不出帳單為什麼漲,說明當初上 RAG 時根本沒算過帳。
🧭 答題框架
- 講清成本大頭:漲在 Prompt 增大:每次查詢多注入 500 到 2000 Token,LLM 費用跟著倍增。向量化和檢索本身反倒便宜,問題向量化約 0.1 元每百萬 Token。
- 給最關鍵的優化:先做意圖識別判斷要不要檢索。約 70% 的對話其實不需要查文件,直接回答更快更便宜。
- 給組合拳:關鍵詞觸發能跳過 30% 到 70% 的查詢;簡單問題路由到小模型,整體 LLM 費用降 60% 到 80%;相似問題走語義快取,向量相似度 0.95 以上直接複用結果。
- 給管理動作:把 RAG 觸發率和單次對話成本做成看板,按周看優化收斂。
⭐ 加分點一句話點透:生產級 RAG 的核心是「什麼情況下不用 RAG」,做好過濾和路由才是省錢的關鍵。這句能讓老闆對你的成本意識放心。
Q21技術同事
「你天天說 RAG 效果差要優化。真讓你排查,你知道該看哪幾個環節嗎?」
🎯 對方在考察什麼
試探你對 RAG 鏈路的掌握是真是假。說得出具體環節和指標的人,技術才願意帶著一起排查;說不出的人只配在旁邊催進度。
🧭 答題框架
- 先查檢索環節:Chunking 粒度、Embedding 模型、相似度閾值,三個最常見的壞點。盯檢索命中率這個指標,課程案例裡 78% 對目標 85%,就是明確的未達標訊號。
- 再查知識庫本身:RAG 的品質上限就是知識庫品質。文件過期、內容互相矛盾,檢索再準也答錯。
- 再看生成環節:注入的內容有限,模型會用訓練記憶腦補文件外的部分,形成 RAG 加幻覺的混合輸出,比純幻覺更難識別。
- 給排查切入點:強制顯示引用來源,每個回答可回溯到具體文件塊,壞 case 一眼能定位是檢索錯了還是生成飄了。
⭐ 加分點提醒一個反直覺的風險:檢索召回了錯誤文件時,幻覺不但沒減少,還多披了一層權威出處的外衣,使用者反而更容易信。
Q22面試官
「把 Temperature 調到 0,輸出每次都一樣了。這是不是就等於答案是對的?」
🎯 對方在考察什麼
陷阱題,考確定性和正確性的區別。順著點頭的人,對取樣機制的理解只停在「調低更穩」這個表面。
🧭 答題框架
- 先拆機制:Temperature 在 softmax 之前對 logits 做等比縮放。T 越小分佈越尖銳,調到 0 相當於每步都鎖定機率最高的詞。
- 點破陷阱:低溫鎖定的是「最可能」,最可能不等於最正確。訓練資料裡那個答案本身是錯的,模型就會極其穩定地錯。
- 給邊界:Temperature 只影響每步怎麼取樣,不影響知識邊界。模型不知道的事,低溫下照樣編,只是編得更一致。
- 給結論:參數調優是成本最低的第一道防線,解決的是表達穩定問題。事實準確性要求高的場景,必須搭配 RAG 或人工審核。
⭐ 加分點指出穩定地錯比隨機地錯更危險:輸出可復現,容易讓團隊誤以為答案可靠,反而放鬆了警惕。
Q23技術同事
「產品要求每個問題都先查一遍知識庫,延遲直接多了兩秒。真的每條都要查嗎?」
🎯 對方在考察什麼
一半是抱怨,一半是給你遞臺階。他想聽你主動砍掉不必要的檢索,這也在檢驗你把 RAG 當銀彈還是當工具。
🧭 答題框架
- 先接住:確實不該全量檢索。約 70% 的對話不需要查文件,「今天幾號」這類問題直接答就行。
- 給過濾方案:上意圖分類器或簡單規則做關鍵詞觸發,「我們的退款政策」這類才走 RAG,能跳過 30% 到 70% 的查詢。
- 給快取方案:高頻相似問題走語義快取,問題向量相似度 0.95 以上直接返回快取結果,跳過整條檢索鏈路,延遲和費用都能降一半左右。
- 給場景邊界:閒聊、創意場景本來就不適合 RAG,檢索注入反而讓回答死板。
⭐ 加分點把決策框架說全:知識時效性強、私有知識庫、答錯代價高,滿足這些才值得為檢索付出延遲。這個判斷本來就該 PM 來做,而且要寫進方案。
Q24老闆
「AI 寫的季度報告裡引了一份根本不存在的行業報告,差點直接上董事會。這種事以後怎麼杜絕?」
🎯 對方在考察什麼
事故檢討題。重點聽你敢不敢說「杜絕不了,但能攔住」,以及你的攔截網設計得夠不夠具體。
🧭 答題框架
- 先定性:這是典型的來源幻覺。模型編資料和編報告名,用的是同一套機率續寫能力,單靠叮囑它「別編」解決不了。
- 給第一道防線:System Prompt 約束:具體數字、報告名、機構名如非使用者提供,必須標註「需核實」,寧可留空白讓人填。
- 給第二道防線:分級審核:對外材料屬於高風險內容,AI 只做初稿,發出前必須有人簽字確認。
- 把迴圈補上:這條 bad case 進評測集,走歸因、Prompt 迭代、迴歸驗證的流程,同類問題的複發率才會真正降下來。
⭐ 加分點給老闆一句做得到的制度說法:AI 輔助生成的對外內容,一律帶「需核實」清單,核對人簽字後才算完成。高風險場景裡人工兜底本身就是產品設計的一部分。
Q25面試官
「System Prompt 裡寫一句『不確定就說不知道』,這到底有沒有用?原理是什麼?」
🎯 對方在考察什麼
考你對 Prompt 約束的理解深度。答「有用」或「沒用」都不及格,面試官要的是機制層面的解釋和失效條件。
🧭 答題框架
- 給機制:模型推每個 Token 時,上下文裡的每個 Token 都在影響機率分佈。約束詞就是高品質前文,拉高「承認不知道」這個序列的機率,壓低編造序列的機率。
- 給有效條件:模型對問題本身有不確定感時最有效,適合超出知識範圍的問題、模糊查詢、時效性資訊。
- 給失效條件:模型對某個錯誤答案高度自信時,第一候選詞就是錯的,約束詞幹預不了。訓練資料裡的系統性錯誤、被當成事實的過時知識,都屬於這類。
- 給搭配:對「高度自信但可能錯」的領域,Prompt 約束不夠,要配 RAG 注入真實知識,或人工審核兜底。
⭐ 加分點一句話點破根源:模型不知道自己不知道。約束指令改變的是機率分佈,給不了它自知之明,這就是 Prompt 手段的天花板。
用這些課程頁組織答案 →
Prompt 約束為什麼有效
Q26面試官
「讓你負責一個 AI 問答產品,你怎麼量化它的幻覺水平?上線前後分別做什麼?」
🎯 對方在考察什麼
考體系化能力。零散地說「多測測」不行,面試官想看到上線前基線、上線後審核、長期循環這個完整結構,還要有具體指標。
🧭 答題框架
- 上線前建基線:用一批已知正確答案的問題做幻覺測試集,量化幻覺率、設准入門檻。課程案例的口徑:事實準確率 94.2%,幻覺率 5.8% 對目標小於 3%,未達標就不上線。
- 上線後分級審核:按風險自動路由:低風險直接發出,高風險先人工審核再傳送。金融、醫療這類領域 AI 只出初稿。
- 長期做回饋循環:審核發現的幻覺標成 bad case,走歸因、Prompt 迭代、迴歸驗證的迴圈。案例裡發現到修復平均 3.2 天。
- 指標進 PRD:「幻覺率小於 3%」要像「載入時間小於 2 秒」一樣,成為可量化的驗收標準。
⭐ 加分點主動說出評測的盲區:測試集覆蓋的是已知風險點,評測通過不等於全面可靠,長尾問題要靠線上審核持續回補進測試集。
用這些課程頁組織答案 →
評測 + 人工審核
Q27技術同事
「評測集全綠了才上的線,結果這周又冒出十幾條 bad case。你那個評測是不是白做了?」
🎯 對方在考察什麼
帶情緒的挑戰題。考你能不能解釋評測的天然侷限,同時把 bad case 變成流程資產,別被一句「白做了」帶進防禦姿態。
🧭 答題框架
- 先正面回應:評測保證的是已知風險點不復發。測試集之外的長尾問題,模型照樣可能幻覺,評測通過從來不等於全面可靠。
- 給資料視角:看循環速度,別只看單週新增。課程案例的節奏:本週新增 12 條 bad case,已修復歸檔 47 條,迴歸通過率 96.8%。
- 給流程:每條 bad case 走四步:發現、歸因分析、Prompt 迭代、迴歸驗證。修完加入測試集,評測集就這樣越滾越厚。
- 給根因解釋:模型沒有自我檢查機制,推錯一個 Token 會以它為基礎繼續推,誤差累積。評測加審核是架在輸出端的外部糾錯層,它攔結果,管不住生成過程本身。
⭐ 加分點說出「前三個手段改變機率,這一手段攔截結果」這個分層,技術同事立刻明白你對四種手段的定位是清楚的。
用這些課程頁組織答案 →
錯誤回饋循環
Q28面試官
「模型答錯了一個問題,你怎麼判斷該改 Prompt,還是該做微調?」
🎯 對方在考察什麼
經典排查題,考歸因能力。兩條修復路線成本差兩個數量級,搞錯方向的團隊會白燒幾周時間。面試官在看你有沒有排查順序。
🧭 答題框架
- 先分錯誤類型:是上下文沒給對,還是參數裡根本沒有這份知識?兩件事的修復方式完全不同,搞錯方向浪費大量時間。
- 給排查順序:先試 Prompt:把任務描述、規則、示例補全再測。知識在訓練資料裡、問題出在格式風格語氣的,Prompt 就能修,成本比重訓低 100 倍。
- 判斷要不要 RAG:私有知識、即時資料、知識截止日期之後的內容,參數裡沒有,Prompt 寫再多也沒用,要檢索注入。
- 最後才是微調:固定專業領域的風格、需要改變推理典範,這類才值得微調。微調改的是行為風格,不適合注入時效性知識。
⭐ 加分點補一個常見坑:很多「Prompt 改了沒用」的 case,真相是 System Prompt 被截斷或歷史佔滿視窗。問題在上下文管理,兩條修復路線都不用動。
Q29老闆
「使用者問 AI 晚飯吃了什麼,它說自己煮了番茄炒蛋麵,截圖都傳到網上了。它一個程式,為什麼要撒謊?」
🎯 對方在考察什麼
看似吐槽,實際在問幻覺的本質。答好了能幫老闆建立對生成式 AI 的正確心智;答成「這是 bug 我們修」,就把自己埋了。
🧭 答題框架
- 先解釋機制:它沒有撒謊的動機,只是在做機率續寫。「吃了嗎」後面接「吃了」是訓練語料裡最高頻的應答模式,被追問時它又按語境機率編出了具體細節。
- 說清對齊的邊界:只有被使用者明確質疑時,RLHF 對齊訓練才讓它承認自己沒有身體。使用者不追問,它會一直演下去,置信度不因內容虛假而下降。
- 給關鍵認知:幻覺和創意同源。它能編出番茄炒蛋麵這種生動細節,和它能寫文案用的是完全相同的能力,消滅幻覺的同時創意也會沒了。
- 給產品動作:分場景定策略:閒聊場景的角色扮演無傷大雅,事實場景才需要 RAG 和審核壓制。全域一刀切,兩頭都做不好。
⭐ 加分點用「兩本書」幫老闆建立心智:參數是封存的百科全書,上下文是桌上的參考資料。它永遠在這兩本書裡找最像的續寫,找不到也不會說不知道。
用這些課程頁組織答案 →
日常對話幻覺案例
Q30面試官
「學了這麼多大模型知識,你觀察下來,AI 產品經理最容易踩的認知誤區有哪些?」
🎯 對方在考察什麼
收尾開放題,考知識內化程度。列舉誤區人人都會,面試官在聽你能不能把誤區和底層機制連起來,順便看你的自我認知。
🧭 答題框架
- 列高頻誤區:調高 Temperature 更聰明,實際只是更隨機;RAG 讓模型學習了文件,實際只是執行時臨時注入;模型在呼叫 API,實際它只是輸出了格式化文字;答錯就重新訓練,實際 Prompt 先試成本低 100 倍。
- 挖共同根源:這四個誤區都源於沒分清訓練和推理的邊界。參數凍結之後,一切執行時手段都是在操作上下文。
- 上升到方法:所有工程化操作本質都是對 message list 的處理。拿這個視角看任何新方案,都能判斷它在哪一層起作用、侷限在哪。
- 給自我定位:用鄧寧-克魯格曲線收尾:剛學會名詞時最危險,覺得什麼都懂。持續動手、持續被打臉,才能從愚昧之巔走到平穩高原。
⭐ 加分點收一句課程的原話:弱小和無知從來都不是生存的障礙,傲慢才是。面試裡能自然引出認知層的話,比多背十個術語更加分。
最後一個建議
這 30 題的正確用法是開口講一遍,對著同事、朋友或者錄音講。看懂不算數。講不順的地方,就是你以為懂了但還沒懂的地方,點關聯課程頁回去補上。