他們會這樣考你

AI Harness · 30 道靈魂拷問

Harness 核心篇講的全是工程落地:上下文、Prompt、安全、Agent、成本。這 30 個問題來自三個真實場景,先自己開口回答,再看框架。

怎麼用這一頁
每道題都標註了提問者。他們問同一塊知識,想聽的東西卻不一樣。
🎙 面試官想驗證你是真懂,還是在背名詞
👔 老闆要的是解釋和承諾
🛠 技術同事在試探你值不值得信任
每題給出三層:對方在考察什麼 → 答題框架 → 加分點。答不上來的環節,點末尾的課程頁回去補。
Q1面試官
「你哋嘅 AI 助手傾到三十輪就開始唔記得嘢,用戶第一輪講嘅需求佢完全記唔住。講吓點解,你打算點樣處理?」
🎯 對方在考察什麼
上下文工程的入門分水嶺。考你能不能從窗口機制推出工程方案。張口就答「換個窗口更大的模型」的人露餡了:既沒算過賬,也不知道大窗口有自己的坑。
🧭 答題框架
  1. 先定位根因:上下文窗口是模型一次能看到的全部 Token,超出的部分被截斷,模型連模糊的印象都沒有。忘事説明早期輪次已經被截掉了。
  2. 給三種策略:直接截斷(丟掉最早輪次,零成本但信息永久丟失)、摘要壓縮(歷史先總結再存,保留人名和偏好等要點)、選擇性保留(歷史向量化,語義檢索只注入相關輪次)。
  3. 按場景選型:查天氣這類單次工具型對話用截斷就夠;客服和長期學習類對話用摘要,超過 20 輪效果明顯;超長對話(100 輪以上)的複雜 Agent 用向量檢索,Token 最省、回答最準。
  4. 戳破大窗口方案:窗口按 Token 計費,全塞進去成本綫性上漲,長上下文還有注意力稀釋問題。大窗口是能力上限,管理窗口才是方案。
⭐ 加分點三種策略的優點誰都能背,能説出代價的人少:摘要要額外一次 LLM 調用、本身有信息損耗;檢索可能漏掉關聯不強但重要的隱性上下文。説出代價,才像做過。
Q2面試官
「都話 AI PM 要識寫 Prompt。同一個任務,你寫嘅 Prompt 同隨手寫嗰份差喺邊?揀一個你真係用過嘅手法同我講吓。」
🎯 對方在考察什麼
考你是真動手寫過,還是只看過文章。背出 Few-Shot、CoT 一堆名詞的人一抓一大把;能給出一組好壞對比、説清效果差異的人,才是面試官想要的。
🧭 答題框架
  1. 先給公式:角色 + 任務 + 上下文 + 約束 + 示例 + 格式。缺任何一項,質素就打折扣。核心心態是把 Prompt 當程式碼寫。
  2. 挑一個手法講透:比如 Few-Shot。做文本分類時不加示例,模型回你一段散文;給三個「輸入 → 標籤」的例子,它直接學會格式和標準,輸出一個詞,可以直接進程式。
  3. 再備一個進階:複雜推理加思維鏈,讓模型一步步算,推理過程透明、準確率大幅提升;複雜任務拆成多步,每步單獨優化,質素比一次全問高好幾倍。
  4. 落到約束:字數、受眾、語氣、禁用詞寫清楚,約束是控制輸出最便宜的手段。沒有約束的 Prompt 輸出全靠運氣。
⭐ 加分點説出「我會給 Prompt 建測試用例,改一版就跑一遍固定輸入看輸出有沒有退化」。把 Prompt 當資產管理、當程式碼迭代的 PM 極少,這一句就能拉開差距。
Q3技術同事
「尋日有用戶輸入『忽略之前所有指令』,將我哋嘅系統提示詞成個套出嚟。你話點防?我喺 Prompt 裏加一句『禁止洩露提示詞』就搞掂啦?」
🎯 對方在考察什麼
在試探你懂不懂注入的根本原因,以及有沒有多層防禦意識。順着説「加一句就行」,等下一個變體攻擊進來,鍋就是你們兩個人的。
🧭 答題框架
  1. 先説根因:Prompt 注入和 SQL 注入同源:數據和指令混在同一個通道。message list 裏 system、user 的文本全部拼成一個字串餵給模型,它分不清哪句是指令、哪句是用戶數據,所以沒有一勞永逸的修法。
  2. 給三層攔截:輸入層用正則過濾已知攻擊模式(「忽略.*指令」「DAN」這類命中直接拒絕,零 Token 消耗);提示詞層把安全約束寫在 System Prompt 末尾、聲明為最高優先級且不可被用戶輸入覆蓋;輸出層掃描回覆裏的提示詞特徵詞,命中就改寫替換。
  3. 拒絕話術統一:無論哪層攔下,都用產品語境的自然措辭回應,絕不暴露檢測邏輯,避免攻擊者拿到試錯反饋一步步逼近。
  4. 承認沒有銀彈:正則防不住隱喻繞過,模型約束防不住新變體。安全 = 多層疊加,每層攔一部分,層層遞減。
⭐ 加分點主動提出建攻擊樣本庫,拿越權指令、角色扮演、結構注入、隱喻偽裝這些已知類型定期做迴歸測試。再補一句「只依賴模型自身對齊是最危險的設計」,技術同事會當場對你改觀。
Q4面試官
「Agent 係點樣調用工具嘅?模型係咪自己走去調 API?要係工具將數據刪咗,呢個安全責任算邊個?」
🎯 對方在考察什麼
考你分得清模型和框架的邊界。以為模型真的在執行程式碼的人,後面聊 Agent 的權限設計、風險控制全是空中樓閣。這條邊界決定了你做 Agent 產品時把安全投入放在哪。
🧭 答題框架
  1. 點破本質:模型從頭到尾只在預測文字。所謂工具調用,是模型輸出一段結構化 JSON,表達「我想調 get_weather,參數是北京、明天」。這只是文字,什麼都還沒發生。
  2. 框架接管:你寫的程式碼解析這段 JSON,做工具白名單校驗、參數檢查、權限控制,然後真正去調 API。安全邏輯全在框架層,模型一概不管。
  3. 結果注回:API 返回的數據以 tool_result 消息追加進 message list,模型基於完整上下文再預測一次,生成用戶看到的自然語言回答。完整鏈路:文字 → 框架解析 → API → 注回 → 文字。
  4. 回答責任問題:算框架的。模型只提出請求,執行和攔截都是工程程式碼的事。所以高危操作要白名單、要參數校驗、要人工確認,這些是產品設計決策。
⭐ 加分點補一個細節:用戶看到 1 條回覆,背後是 5 條 API 消息的鏈路。再點一句工具描述的寫法直接影響模型選對工具的成功率,好壞描述能差 3 倍,這是 PM 能直接貢獻的地方。
Q5老闆
「AI 功能上綫一個月,API 帳單貴咗 8 倍,用戶先漲三成。錢都燒咗去邊?下個月砍唔砍得一半?」
🎯 對方在考察什麼
考你能不能把帳單拆開講成人話,再給出有時間表的優化承諾。答「大模型就是貴」等於告訴老闆你管不了成本;答「我讓技術查查」等於把主動權拱手讓人。
🧭 答題框架
  1. 先解釋結構性原因:多輪對話每一輪都要把全部歷史重發一遍,成本隨輪次越聊越貴。用戶漲三成、對話變深變長,帳單翻幾倍符合機制,且有得治。
  2. 給最快的一刀:查 KV Cache 命中率。System Prompt 保持穩定、別塞動態內容,緩存命中的歷史部分按折扣計費,多輪場景這是最大頭。
  3. 給第二刀:上下文瘦身。歷史做摘要壓縮、截掉無關輪次、別把窗口當垃圾桶,輸入 Token 直接降下來。
  4. 給量化承諾:定義單次會話成本指標,按周彙報。第一週修緩存命中,第二週上壓縮,系統性優化做完,砍一半是有依據的目標。
⭐ 加分點現場講一個具體浪費:System Prompt 裏寫了動態時間戳這種一行字,會讓緩存永遠失效、成本直接翻倍。老闆不需要懂 Attention,但他聽得懂「一行字燒掉一倍錢」。
Q6面試官
「KV Cache 係咩?聽講喺 System Prompt 裏加一行而家嘅時間,就可以令佢成個報廢,點解?」
🎯 對方在考察什麼
考你理解沒理解緩存命中的前綴條件。這是成本優化裏最容易被 PM 忽略、又最能體現工程理解的一題。答得好,説明你的成本意識已經深入到請求結構層面。
🧭 答題框架
  1. 説清原理:每輪對話模型都要對所有歷史 Token 做 Attention 計算。KV Cache 把已經算過的 K/V 矩陣緩存下來,下一輪只算新增 Token,用空間換時間,也換錢。
  2. 説清命中條件:緩存按前綴匹配。System Prompt 排在最前面,只要有一個字符變了,它後面的所有緩存全部作廢。
  3. 回答陷阱:動態時間戳每秒都在變,等於每次請求的前綴都不同,命中率歸零、成本 +100%。正確做法是 System Prompt 保持靜態,時間放進 user 消息裏帶過去。
  4. 補上工程坑:雲端推理是分佈式的,請求可能被路由到沒有你緩存的節點,隱式緩存會莫名 MISS。生產環境要用顯式緩存(cache_control)保證命中。
⭐ 加分點能列出其他緩存殺手:隨機 Session ID、用戶 ID 前綴、A/B 測試變數、隨機 emoji。原則一句話收尾:任何讓 System Prompt 每次不同的東西,都在燒錢。
Q7技術同事
「呢個 AI 功能嘅輸出,你要 JSON 定 Markdown?諗清楚未?你要係仲想做流式輸出,有啲格式可撐唔住。」
🎯 對方在考察什麼
在確認你懂不懂格式選型對解析和體驗的影響。隨口回「都行,你定」的 PM,會讓他寫一堆兜底程式碼,或者上綫後用戶盯着空屏等 10 秒。
🧭 答題框架
  1. 先按消費方分:輸出給程序解析、要入庫要走流程的,選 JSON,字段結構穩定;輸出直接給人看的,選 Markdown,模型最擅長、渲染成本低。
  2. 説清流式的關鍵差異:JSON 要全文到齊才能解析,流式場景下用戶只能乾等;Markdown 可以逐字顯示,體感最好。這是很多產品首字延遲差的根源。
  3. 給折中方案:既要結構化又要流式,可以用 XML 標籤包裹字段,前端捕獲到閉合標籤就渲染一段,結構和體驗兩頭兼顧。
  4. 補一筆成本賬:JSON 的括號、引號、字段名都是格式性 Token,同樣的內容比緊湊格式貴,高頻接口值得摳這 10-30%。
⭐ 加分點反問一句「這個輸出前端要直接渲染,還是後端要解析入庫?」用消費方倒推格式。技術同事最煩 PM 拍腦袋定格式,最喜歡 PM 幫他把邊界先想清楚。
Q8面試官
「點解 ChatGPT、Claude 呢啲產品預設都輸出 Markdown?我哋嘅產品想叫模型直接輸出靚仔嘅富文本,得唔得?」
🎯 對方在考察什麼
考你能不能從模型的輸出機制推出格式選擇。答「行業慣例吧」的人只見過表象;能一步步推演出 Markdown 為什麼勝出的人,才算理解了純文本模型的約束。
🧭 答題框架
  1. 先擺矛盾:LLM 是純文本模型,逐 Token 輸出文字,不懂顏色、字號、對齊;但用戶期望有標題、加粗、列表的排版。格式方案必須在純文本裏解決排版。
  2. 逐個淘汰:HTML 標籤太重,同樣一段內容約 45 Token、標籤佔一半;Word/PDF 是二進制,沒法逐字輸出;LaTeX 語法複雜,模型容易寫錯。Markdown 用 # 和 ** 幾個字符表達排版,同樣內容約 20 Token,省 55%。
  3. 渲染放前端:模型只輸出 Markdown 文本,前端用 marked.js(6KB、零依賴、一行程式碼)或 react-markdown 渲染成富文本。想要富文本效果,讓渲染層幹活,模型不用管樣式。
  4. 補流式的坑:流式輸出時程式碼塊可能沒閉合,直接 parse 會異常。工程上要檢測未閉合的反引號臨時補全再渲染,配合 50ms 節流,程式碼高亮每次重渲染後要重新執行。
⭐ 加分點點破本質:Markdown 是「純文本模型 + 排版需求」的最優解,所有主流 AI 產品都選它。這個推演思路可以遷移到一切格式決策上。
Q9老闆
「客户話我哋嘅 AI 回答太生硬,可唔可以畀佢好似我哋金牌客服咁説話,仲要跟公司模板輸出?呢樣係咪得花錢訓練個自己嘅模型?」
🎯 對方在考察什麼
考你能不能用最便宜的方案接住需求,順便攔下「要訓模型」這個昂貴誤解。答「可能要微調」等於給公司多花幾十萬;答「改 Prompt 就行」又顯得太輕飄,要講清為什麼行。
🧭 答題框架
  1. 先給結論:不用訓模型。System Prompt 定義角色、語氣、約束,同一個模型換一套角色定義就換一個產品。所有 AI 產品本質上都是在 System Prompt 裏寫了不同的角色。
  2. 口吻怎麼落地:把金牌客服的風格寫成角色設定,比如「温暖有力、3 到 5 句話、嚴禁説作為 AI、結尾給一個可執行建議」,再配 2 到 3 個真實對話示例讓模型照着學,比講道理管用。
  3. 模板怎麼落地:讓模型輸出結構化字段,前端按公司模板渲染。樣式由產品控制,模型只負責內容,模板改版也不用動 Prompt。
  4. 給時間和成本預期:改 Prompt 當天就能上綫小流量驗證,零訓練成本。唯一注意點是角色定義要保持穩定,別塞動態內容,否則緩存失效、成本上漲。
⭐ 加分點補一句:同一個模型,Prompt 不同,輸出天差地別,這是 AI 產品差異化的核心槓桿。公司口吻沉澱成角色資產,競品抄不走。
Q10面試官
「Prompt 注入同越獄係咪同一回事?攻擊者一般都有邊啲套路,你揀幾個講吓。」
🎯 對方在考察什麼
考你的安全知識是散點還是體系。只會説「忽略之前指令」的人停在第一課;能把攻擊面分類、説出每類的代表手法,才有資格聊防禦設計。
🧭 答題框架
  1. 先分清概念:注入是把指令混進數據通道,讓模型執行攻擊者的命令,比如「忽略之前所有指令」;越獄是誘導模型脱離安全約束、扮演一個無限制角色,比如 DAN。越獄可以看作注入裏靠角色扮演逃逸的那一類。
  2. 報出五大類型:越權指令(偽造身份、假授權碼、漸進式多輪升級權限)、角色扮演逃逸(DAN 越獄、祖母漏洞式情感操控)、Few-Shot 惡意注入(示例裏植入偏見、劫持輸出格式)、結構符號注入(JSON 偽裝管理指令、HTML 註釋藏指令、偽造系統分隔符)、隱喻偽裝(古典文學包裝、編程教學藉口、反向心理術)。
  3. 點出最危險的一類:漸進式越權是真實場景最常見的:前幾輪正常提問降低警惕,第三輪自稱管理員要求關閉限制。防禦原則是每一輪獨立評估安全性,不因前幾輪正常而放鬆。
  4. 落到防禦邏輯:正則攔得住 DAN、「忽略.*指令」這類已知關鍵詞,攔不住隱喻和新變體,所以提示詞層約束和輸出層掃描必須兜底。
⭐ 加分點舉出「HTML 註釋藏指令」這種視覺不可見但模型可讀的攻擊,再補一句輸入預處理要清除註釋和零寬字符,説明你連預處理層都想到了。
Q11技術同事
「你呢個需求講白咗就係畀 Agent 加個查庫存嘅工具嘛,接口我下晝就寫完。你仲要評估啲咩?」
🎯 對方在考察什麼
在試探你知不知道加工具的隱性成本,以及 PM 在工具設計裏該幹什麼。順着説「那就加」,上綫後調用成功率和帳單出問題,你連問題出在哪都説不清。
🧭 答題框架
  1. 先認可再補賬:接口確實不難,但每個工具定義常駐 System Prompt,每輪約 60 Token。10 個工具的產品,一天 100 輪對話,光工具定義就燒 6 萬 Token。工具列表越長,模型選錯工具的概率也越高。
  2. 描述要一起評審:好壞描述成功率差 3 倍。描述裏寫沒寫「日期必須 YYYY-MM-DD 格式」,決定模型一次調對(800 Token)還是猜 4 次格式(3000 Token)。前置依賴也要寫進去:發郵件工具註明「用戶給的是人名就先調 find_contact 查郵箱」,否則模型會編造地址。
  3. 標記安全屬性:這個工具是只讀還是會改狀態?能不能和別的工具併發執行?isConcurrencySafe 和讀寫屬性決定調度策略和要不要人工確認,這是業務判斷,得我來給。
  4. 定失敗策略:超時設多久、重試幾次、失敗返回什麼。讀操作 10 秒、寫操作 30 秒、最多重試 2 次、失敗返回友好提示,這些定了再上綫。
⭐ 加分點反問一句「這個工具會動用戶數據嗎」,把權限分級聊起來。技術同事會發現你在幫他排雷,態度立刻從挑戰變成合作。
Q12面試官
「成日都喺度講 Agent,你講吓 Agent 同普通聊天機械人到底差喺邊?唔好攞營銷詞呃我。」
🎯 對方在考察什麼
考你有沒有架構級的理解和出處意識。説「Agent 更智能」的人會被追問到啞口無言;能報出經典架構、拆出四個能力並配上運行細節的人,一聽就是學過體系的。
🧭 答題框架
  1. 一句話定界:普通 LLM 只能「説」,問題進來、回答出去就結束;Agent 能「做」,它會規劃、調工具、觀察結果、自己糾錯,直到任務完成。
  2. 報出處:Lilian Weng 2023 年 6 月的網誌《LLM Powered Autonomous Agents》給出了經典架構:LLM 居中當大腦,四周是 Planning 規劃、Memory 記憶、Tools 工具、Action 行動。今天幾乎所有 Agent 框架都能在這張圖裏找到影子。
  3. 逐個配例子:Plan 把競品分析拆成搜索、提取、對比、撰寫四步,發現競品 B 沒有公開定價還會動態調整改搜第三方測評;Memory 短期靠上下文窗口、長期靠向量庫跨會話記住用戶;Act/Reflect 是執行後觀察,程式碼報錯自己分析原因、改了再跑,直到測試通過。
  4. 收在公式上:Agent = LLM + 工具 + 循環。核心是「思考、行動、觀察、再思考」的循環,循環設計得越好,Agent 越可靠。
⭐ 加分點給一個真實數量級:一個中等複雜任務(刪掉項目裏所有 console.log 並跑測試)真實跑下來是 14 輪循環、15 次工具調用、約 2.5 萬 Token。説得出數字,才像見過 Agent 真實運行。
Q13面試官
「MCP 咁火,佢到底解決咗咩問題?如果你嚟負責我哋嘅工具生態,使唔使全接 MCP?」
🎯 對方在考察什麼
考你能不能把協議講成生意。背「Model Context Protocol」全稱沒有意義,面試官想聽的是它省掉了什麼成本、三種傳輸方式怎麼選、你的接入決策依據是什麼。
🧭 答題框架
  1. 用類比定性:MCP 是 AI 工具的 USB 標準。沒有它,每個 Agent 要為每個工具寫專屬對接程式碼:3 個 Agent 配 3 個工具是 9 條專屬對接,新增 1 個工具要加 3 條。有了它,工具只寫一次適配,6 條標準連接,新增工具只加 1 條。
  2. 三種傳輸方式:stdio 走本地進程的標準輸入輸出,最簡單、延遲最低,適合本地開發調試;SSE 是一去多回,伺服器持續推送但客户端不能中途插話,正在被逐步替代;Streamable HTTP 雙向流式,官方推薦標準,新項目直接用它。
  3. 給接入決策:要對外提供能力的工具值得接 MCP,一次適配就能進所有支持 MCP 的 Agent 生態;純內部的私有工具可以後置,先滿足業務再標準化。
⭐ 加分點補一個選型細節:存量 MCP Server 很多還在用 SSE,接入時要注意向前兼容。説明你看過真實生態,沒有只背新標準。
用這些課程頁組織答案 → MCP 協議:工具的 USB 接口 工具調用的秘密
Q14老闆
「隔壁部門將客户名單貼畀外部 AI 做分析,被通報咗。我哋團隊日日用 AI,你同我講清楚,到底邊啲事絕對唔做得?」
🎯 對方在考察什麼
老闆要的是一套團隊立刻能執行的邊界,出了事他擔管理責任。答「讓大家注意點」等於沒答;給出清晰的紅綫加判斷方法,他才敢把這攤事交給你。
🧭 答題框架
  1. 報四條紅綫:敏感數據不出牆,客户信息、商業秘密、財務數據不進外部 AI,服務商承諾「不保存」也不行,傳輸本身已構成洩露;憑證永不進對話,API Key、密碼、Token 貼了就立即輪換;高危操作必確認,刪庫、轉帳、改權限只能 AI 建議、人來按確認鍵;用前審批、用後標註,AI 生成內容對外發布要標識,這是《生成式人工智能服務管理暫行辦法》的法規要求。
  2. 給一綫的判斷法:預設脫敏原則:不確定能不能輸入,就脫敏後再輸入。自測一句話:這段對話被截圖發到網上會不會出事?會,就不要輸入。
  3. 配上分級管控:寫郵件做總結這類 L1 場景自主判斷;影響外部客户的 L2 場景須人工審核加主管審批;Agent 碰生產系統、資金的 L3 場景須沙箱測試、安全審批、一鍵終止,日誌留 180 天。
  4. 把責任説透:使用者是第一責任人,「AI 寫的不是我寫的」推不了責;審批人簽字即擔連帶責任;管理者「不知道下屬在用」也免不了責。
⭐ 加分點點出最容易踩雷的場景:調程式碼時説「幫我看看為什麼報錯」,把帶密鑰的程式碼整段貼出去。給團隊立一條「先 review 再貼,貼漏了立即輪換憑證」的操作習慣。
用這些課程頁組織答案 → AI 安全紅綫:四條底綫 風險分級與責任
Q15面試官
「用戶一句話叫 Agent 同時查機票、查天氣、搵酒店,模型一輪返回咗三個工具調用。你係一個個執行定一齊執行?依據係咩?」
🎯 對方在考察什麼
考你懂不懂調度策略背後的安全與體驗權衡。答「當然一起跑,快」的人沒想過數據競爭;答「都串行,穩」的人在白白浪費用戶時間。
🧭 答題框架
  1. 擺出三種策略:串行一個接一個最安全,總耗時是三者之和(1.5 + 0.8 + 1.2 = 3.5 秒);併發全部同時跑,總耗時等於最慢的那個(1.5 秒),提速 57%;智能分批按安全性分組執行。
  2. 給判斷標準:看有沒有狀態變更和依賴。機票預訂可能扣款、改用戶狀態,單獨跑;天氣和酒店是純查詢,安全合併並行。第 1 批跑機票,第 2 批天氣加酒店一起跑。
  3. 落到機制:框架給每個工具標 isConcurrencySafe,可併發的合成一批同時執行。標記是業務判斷,要產品經理告訴工程每個工具的安全等級。
  4. 追問依賴:如果酒店要按航班到達時間篩選,它就依賴機票結果,必須串行。先畫依賴圖,再談調度。
⭐ 加分點把策略換算成體驗:3.5 秒和 1.5 秒在對話產品裏是體感級差距。調度策略是用戶等待時間的直接決定因素,這句話説明你在用產品視角看工程。
Q16面試官
「用戶問咗句『明天北京天氣怎麼樣』,介面上就回咗一句話。你講吓呢一句話背後,API 裏到底跑咗幾條消息?」
🎯 對方在考察什麼
考你有沒有拆開看過一次工具調用的完整鏈路。只會説「模型調了個工具」的人,設計不了加載態、進度提示這些體驗細節,因為他根本不知道中間有幾個環節可以做文章。
🧭 答題框架
  1. 報出賬目:用戶看到 1 條回覆,API 裏跑了 5 條消息、2 次模型調用、1 次外部 API。消息依次是 system 指令、用戶提問、模型返回 tool_calls、tool 角色回填結果、模型給出最終回答。
  2. 講清關鍵一跳:第 3 條消息裏模型的 content 是 null,只有 tool_calls 字段。也就是説模型這一輪沒説話,只提交了一張「申請單」,真正調 API 的是框架。
  3. 點出成本含義:一次帶工具的對話至少兩次模型調用,Token 消耗比純問答翻倍還多。評估帶工具功能的成本時按這個倍數算,別按一次調用報預算。
  4. 落到產品決策:這 5 條消息裏哪些讓用戶感知、哪些靜默處理,就是產品設計。查詢中轉圈、工具結果做進度條、失敗暴露給用戶重試,每個環節都是決策點。
⭐ 加分點能順手寫出 messages 陣列的角色順序 system / user / assistant(tool_calls) / tool / assistant,説明你真看過 API 報文,這在 PM 裏是稀缺信號。
用這些課程頁組織答案 → 一次對話背後的 5 條消息 工具調用的秘密
Q17技術同事
「我哋 Agent 嘅長對話成日撐爆上下文,我打算快滿嘅時候將最早嘅消息全刪咗。你產品上有冇意見?」
🎯 對方在考察什麼
他在試探你懂不懂壓縮是分層的,一刀切會誤傷。你要是説「行啊你看着辦」,用戶第一輪説的需求被刪掉後,鍋就是產品的。
🧭 答題框架
  1. 先給預算框架:模型窗口 256K,實際安全空間設 200K,預留 56K 給模型回覆。壓縮的觸發點全部按這個安全空間的百分比來定。
  2. 擺出四層防綫:60% 時裁剪,刪早期工具返回的超長原始數據只留摘要,用戶完全無感;75% 時微壓縮,把早期長對話換成簡短摘要,輕微損失;85% 時摺疊,多輪早期對話併成一條會話摘要,細節丟但主綫在;95% 時緊急壓縮,只留 system 加全局摘要加最近 3 輪。
  3. 算收益給他聽:課程裏的演示數據,一條 1200 Token 的天氣 API 原始 JSON 壓成 80 Token 摘要;四層配合下來,同一個 200K 窗口能撐 5 倍以上的對話量。
  4. 給結論:全刪是把第四層的猛藥當第一層用。按四層來做,絕大多數對話只會走到第一二層,用戶根本察覺不到。
⭐ 加分點提醒他刪除順序有講究:先刪工具原始返回,再動對話內容。工具返回信息密度最低、最佔地方,是性價比最高的第一刀。
Q18面試官
「你哋嘅 Agent 記唔記得住用戶上個月嘅偏好?靠咩記?窗口就咁大,記憶多咗點算?」
🎯 對方在考察什麼
考你分不分得清短期記憶和長期記憶是兩套機制,以及會不會做檢索參數的取捨。答「存數據庫裏」就露餡了,關鍵在怎麼在對的時機把對的記憶撈出來。
🧭 答題框架
  1. 用類比定調:短期記憶是桌面,上下文窗口放得下的東西有限;長期記憶是檔案櫃,向量數據庫存着用戶偏好、項目配置、歷史 Bug,需要時檢索最相關的幾條放回桌面。
  2. 講清鏈路:記憶先經 Embedding 模型轉成向量存進向量庫,課程裏的例子是 768 維向量存 LanceDB;提問時把問題也轉成向量,按語義相似度召回。
  3. 報出兩個關鍵參數:topK=5 限定每次最多召回 5 條,防止記憶擠佔窗口;minScore=0.3 卡相似度下限,不相關的寧可不注入。這兩個數是產品要拍的取捨。
  4. 點出質素瓶頸:檢索質素取決於 Embedding 模型。「修登入接口」和「登入接口併發 500」能不能匹配到同一條記憶,決定了這套記憶是助手還是擺設。
⭐ 加分點反問一句:什麼信息值得進長期記憶?用戶偏好、項目配置這類高複用信息才值得存,把聊天全量入庫只會讓 topK=5 的名額被垃圾佔掉。
用這些課程頁組織答案 → 長期記憶:向量檢索 短期記憶 = 上下文窗口
Q19面試官
「綫上 Agent 時不時卡死,轉半日圈冇結果。你作為產品負責人,講吓佢一般係點樣死嘅,你打算點樣兜底?」
🎯 對方在考察什麼
考你對 Agent 失敗模式的枚舉能力。説得出幾種死法、每種配什麼防護,説明你真運營過 Agent 產品;只會説「加個超時」的人,多半只做過 demo。
🧭 答題框架
  1. 枚舉五種死法:參數格式錯誤,模型生成的 JSON 不合法;幻覺工具,調一個根本不存在的工具;無限遞歸,同一個動作反覆循環;信息不足,缺關鍵信息還硬着頭皮猜;API 異常,外部服務掛了沒人管。
  2. 逐個配防護:參數校驗攔格式錯誤、工具驗證攔幻覺工具、循環檢測攔無限遞歸、主動提問機制治信息不足、超時兜底治 API 異常。一種死法一味藥,別指望一個萬能開關。
  3. 轉成產品語言:每種故障都要預設用戶看到什麼。是重試、報錯、還是轉人工,故障文案和出口是產品設計,不能讓用戶對着轉圈乾等。
⭐ 加分點點出「信息不足」這條最特殊:它的解法是讓 Agent 學會開口問用戶,屬於交互設計問題。其他四條靠工程,這條靠產品。
Q20老闆
「新上嘅拍照識別功能,成本比純文字功能貴咗十幾倍。圖片呢樣嘢點解仲按錢計?可唔可以平啲?」
🎯 對方在考察什麼
老闆要的是錢花哪了和怎麼省兩個答案。你得把圖片計費的原理講成人話,再給一個不砍功能就能降本的方案。
🧭 答題框架
  1. 講清計費原理:模型把圖片切成像素塊換算 Token,公式是縮放後的高乘寬除以每 Token 對應像素數再加 2。尺寸還會強制對齊 32 的整數倍,超上限縮小、低於下限放大,按對齊後的尺寸計費。
  2. 指出浪費在哪:用戶隨手拍的 4K 原圖直接上傳,Token 是 512 見方小圖的幾十倍。任務只是「識別這是不是發票」的話,絕大部分像素都在燒錢。
  3. 給分級方案:按任務匹配分辨率。粗分類用低分辨率、場景理解用中檔、OCR 和圖表識別才上高分辨率。分辨率選對,Token 數能差 10 到 100 倍。
  4. 給落地動作:上傳鏈路加一層預處理,按功能類型自動壓到對應檔位,用戶無感,帳單立降。
⭐ 加分點補一句不同模型換算率不一樣,課程裏的對比是 Qwen3-VL 每 1024 像素一個 Token、Qwen2.5-VL 是 784。選型時把視覺計費也放進對比表。
用這些課程頁組織答案 → 圖片 Token:像素也在燒錢 按任務匹配分辨率
Q21面試官
「你哋嘅 Agent 可以執行刪檔呢類操作,用戶投訴話每步都要撳確認太煩,工程話全放行又怕出事。呢個權限你點樣設計?」
🎯 對方在考察什麼
這是一道安全與效率怎麼權衡的產品判斷題。答案本身沒有標準解,考官看的是你有沒有一套分級框架,以及敢不敢把風險決策留在產品手裏。
🧭 答題框架
  1. 擺出三種模式:確認模式每個危險操作都彈窗,最安全但最打斷;自動模式全部放行,最快但一次誤刪就是事故;智能模式用 LLM 分類器評估風險等級,低風險放行、高風險攔下確認。
  2. 點出前提工作:智能模式能跑的前提是每個工具都標好了「只讀」還是「破壞性」。這個標記是工具級別的產品決策,得產品經理逐個拍,推給工程就是失職。
  3. 正視新風險:用 LLM 判斷風險,LLM 自己也會誤判。所以破壞性最高的那一檔(刪庫、轉帳)不進智能判斷,永遠人工確認,給誤判上雙保險。
  4. 給體驗補償:確認彈窗做進上下文裏,一次確認可記住同類操作,把打斷次數降下來,而只在真正危險處保留剎車。
⭐ 加分點説出「權限設計的核心矛盾是安全 vs 效率,產品的職責就是選一個可辯護的平衡點」,把問題從功能層拉到責任層。
用這些課程頁組織答案 → 權限與安全 風險分級與責任
Q22技術同事
「你成日提叫我畀 Agent 加 Skill。Skill 講白咗就係一段提示詞啩?同我將話寫入 System Prompt 有咩分別?」
🎯 對方在考察什麼
他在挑戰 Skill 的必要性。你得承認它確實算不上新技術,再講清它在觸發、邊界、約束上和裸提示詞的差別,用機制説服他。
🧭 答題框架
  1. 先認同再區分:Skill 的本質就是把經驗寫成文檔,等於流程説明加工具調用指引。但它按需加載,識別到匹配任務才注入,寫死在 System Prompt 裏的內容每次請求都佔 Token。
  2. 拆開 SKILL.md 的結構:元信息帶觸發詞決定召回率;適用條件是防誤觸的保險,不在目標項目目錄就靜默退出;執行步驟是嚴格按順序跑的 SOP;允許工具劃安全邊界,比如發版 Skill 禁用 delete_file 和子 Agent。
  3. 講價值落點:沒有 Skill 的 ReAct 是差循環,試錯好幾輪;有 Skill 是好循環,AI 出門前就想清楚先做什麼再做什麼,一趟搞完。循環短了,Token 和延遲都降。
  4. 給協作分工:Skill 裏的步驟順序和安全約束是業務經驗,這部分產品來寫;加載和執行機制工程來管。Cursor、Claude Code、Copilot 都支持 SKILL.md 標準,不用自研。
⭐ 加分點點出約束條款比步驟更重要:步驟寫錯 Agent 只是做錯事,約束缺了 Agent 會做危險的事。發版 Skill 裏「不允許 force push、測試不過不發版」就是這種保命條款。
Q23面試官
「你哋嘅 Agent demo 演示得好驚豔,一上綫就各種翻車。由試驗品到產品,中間差嘅到底係咩?」
🎯 對方在考察什麼
考你知不知道 Agent 工程的大頭在腳手架。把翻車歸咎於「模型不夠聰明」的人,會一直等下一代模型;懂腳手架的人知道該補哪五塊板子。
🧭 答題框架
  1. 給出核心比例:Agent 工程等於 80% 腳手架加 20% 模型。大多數 Agent 項目失敗,敗在錯誤處理不夠健壯,模型聰明與否反倒是次要的。
  2. 列五大能力:超時與重試,工具調用設 timeout 加指數退避;最大步數限制,max_iterations 防死循環;輸入輸出校驗,JSON Schema 攔非法參數;狀態機加回滾,檢查點恢復,失敗不從頭來;觀測與日誌,全鏈路記錄,生產問題靠日誌定位。
  3. 用場景對比:課程裏「查機票加訂酒店」的模擬,裸跑的 Agent 一個 API 超時就整單報廢;加了腳手架,超時重試、失敗回滾到檢查點,用戶只感覺慢了一點。
  4. 落到排期:立項時就把五大能力列進工程需求,和功能同排期。上綫後再補,等於先開車再裝剎車。
⭐ 加分點把「demo 到產品」量化成驗收標準:每個工具有 timeout 嗎、有 max_iterations 嗎、失敗能回滾嗎。三個問題就能把一個 Agent 項目的成熟度摸個大概。
用這些課程頁組織答案 → 腳手架工程:從試驗品到產品 可觀測性
Q24老闆
「競品都喺度宣傳用最新旗艦模型,我哋使唔使全綫跟進?貴係貴少少,效果總唔會差啩?」
🎯 對方在考察什麼
老闆被「越貴越好」的直覺帶着走,你要用選型框架把他拉回來:錢花在刀刃上,還得説清刀刃在哪。
🧭 答題框架
  1. 先破直覺:能力和價格是非綫性關係。價格翻十倍,能力提升可能只有一兩成,很多任務上中檔模型和旗艦的輸出用戶根本分不出來。
  2. 給選型公式:選型等於任務難度乘調用量乘容錯空間。簡單高頻低容錯要求的任務用小模型,複雜低頻高價值的任務才配旗艦。
  3. 給替代方案:全綫上旗艦的錢,拿一小半做意圖識別加模型路由:80% 簡單問題走小模型,複雜的才升旗艦,成本能省 40% 到 60%,體驗基本無損。
  4. 用數據説話:拿場景化評測數據對比,別拿廠商跑分。同一批真實任務在候選模型上各跑一遍,按我們自己的場景出結論。
⭐ 加分點補一刀:競品宣傳用旗艦,多半也只在門面場景用。跟進宣傳口徑和跟進成本結構是兩回事。
用這些課程頁組織答案 → 模型選型:能力 vs 成本 綜合成本優化
Q25面試官
「如果叫你畀一個要上生產嘅 Agent 立規矩,你會立邊幾條?冇呢啲規矩會發生咩事?」
🎯 對方在考察什麼
考你能不能把穩定性拆成具體防綫。「多做測試」這種答案沒有信息量,考官想聽的是每道護欄防什麼事故、缺了會怎麼死。
🧭 答題框架
  1. 先給定位:Agent 的核心能力來自 LLM,穩定性來自工程護欄。沒有護欄的 Agent 等於沒有剎車的跑車,能力越強越危險。
  2. 列五道護欄:迭代上限防死循環,Agent 原地打轉時強制收工;輸出截斷防撐爆,工具返回超長數據直接截斷;超時控制防卡死,外部調用掛了不至於整個任務陪葬;中斷恢復防損壞,任務中途斷電斷網能從檢查點續跑;上下文急救防崩潰,窗口快滿時緊急壓縮保命。
  3. 講判斷標準:這五道防綫決定 Agent 是「能用」還是「好用」。驗收一個 Agent 產品,就按這五條逐項過,缺一條就有對應的一類綫上事故等着。
⭐ 加分點把護欄和卡死模式對上號:五種卡死是病,五道護欄是藥。能成對講出來,説明你理解的是體系,只會背清單的人講不出這層對應關係。
用這些課程頁組織答案 → 5 道工程護欄 Agent 卡死的 5 種模式
Q26技術同事
「平台唔係自帶 KV Cache 咩?我睇文檔話會自動命中,我哋仲要專門寫 cache_control 做乜?」
🎯 對方在考察什麼
他覺得隱式緩存夠用了。你要講清分佈式架構下隱式緩存為什麼靠不住,這直接決定省錢方案是真省還是紙面省。
🧭 答題框架
  1. 點破前提:雲端 LLM 跑在多台 GPU 節點上,請求經負載均衡隨機路由。你的緩存在節點 A,請求被派到節點 B 就是 MISS,隱式緩存的實際命中率不到 30%,純靠運氣。
  2. 講顯式方案:在請求裏加一行 cache_control 標記緩存錨點,平台保證把請求路由到有緩存的節點,命中率接近 100%。Anthropic、阿里雲、OpenAI 都支持這套寫法。
  3. 算價差:課程裏的折扣對比,隱式命中按標準價 20% 計費,顯式命中只按 10%,等於輸入成本省 90%。命中率和折扣兩頭都是顯式佔優。
  4. 下結論:生產環境必須顯式緩存。把省錢寄託在隨機路由上,既不可靠也不專業。
⭐ 加分點提醒錨點位置要配合緩存的前綴匹配特性:System Prompt 固定、動態內容後置,錨點才有意義。這句話能接回動態時間戳毀緩存的經典反例。
Q27面試官
「同樣嘅功能,人哋家提示詞幾百 Token,你哋家兩千幾。如果叫你嚟砍,由邊下手?」
🎯 對方在考察什麼
考你懂不懂提示詞是寫給機器的指令這個第一原則,以及能不能分清語法層和語義層兩類瘦身手段。
🧭 答題框架
  1. 先砍語法層:格式性 Token 最高佔提示詞 13% 到 20%。複雜對象用 YAML 代替 JSON 省 15% 到 30%;扁平列表用 CSV 代替 JSON 陣列,字段名重複 N 遍是最大浪費,省 30% 到 60%;去掉加粗、標題這些 Markdown 裝飾符號再省 8% 到 13%。課程裏的實測案例,光加粗符號就吃掉 8.5% 的 Token。
  2. 再砍語義層:Few-Shot 案例別硬編碼,用向量檢索每次只取最相關的 3 條,省 87.5%;長文檔先用 LLMLingua-2 壓縮再餵給模型,能壓 5 到 20 倍。
  3. 順手調結構:模型對中間內容注意力最弱,關鍵信息放首尾。這一步不省錢,但讓留下的每個 Token 更值錢。
  4. 點出雙重收益:注意力複雜度是 O(N²),Prompt 翻倍計算翻四倍。瘦身省的錢是一份,速度和效果的提升是白送的另一份。
⭐ 加分點引用課程那句判斷:千萬級調用量下,每月兩成預算花在「讓產品經理看着舒服」的排版上。砍提示詞先砍給人看的部分。
用這些課程頁組織答案 → 語法層優化:寫給機器的提示詞 語義層優化
Q28老闆
「我叫 AI 整理咗份行業報告,引用睇落都幾似回事,我直接發給客户冇問題啩?」
🎯 對方在考察什麼
老闆在找你要一個「放心」。你得讓他明白幻覺專挑像真的地方藏,同時給他一套下次自己就能用的分級判斷法,別只會説「要小心」。
🧭 答題框架
  1. 先講危險在哪:幻覺混在真實信息中間,格式和引用方式跟真的完全一致。課程裏的測試,六條量子計算史實裏藏一條編造的,人名、項目名、「Nature 年度十大」全是編的,編得比真的還像真的。
  2. 給識別套路:AI 造假三板斧是編人名、編項目、編榮譽,還愛配上真實機構、出版社、豆瓣評分來增加可信度。凡是具體到人名加成果的引用,優先核。
  3. 給場景分級:寫郵件、頭腦風暴、翻譯潤色放心用;數據分析、技術調研、寫程式碼要驗證後用;法律、醫療、投資是幻覺高危區,只能當綫索。發客户的報告屬於要驗證那檔,關鍵數字和引用逐條核完再發。
  4. 給操作動作:拿報告裏的關鍵詞去搜索交叉驗證,核不到出處的引用直接刪。十分鐘的事,比發出去被客户戳穿便宜多了。
⭐ 加分點給老闆留一句好記的自測:越是具體的引用越要查。AI 心虛的時候反而愛把細節編得特別足。
Q29面試官
「咩樣嘅任務值得拆畀多個 Agent 做?拆咗之後,點樣保證佢哋唔互相打架?」
🎯 對方在考察什麼
考你對多 Agent 協作的適用邊界和安全規則的理解。張口就「多 Agent 更強」的人是聽營銷聽多了,考官要的是拆分依據和併發紀律。
🧭 答題框架
  1. 給拆分模型:主 Agent 當協調員拆任務,子 Agent 各司其職。課程裏重構認證模組的例子:調研員只讀,負責分析程式碼結構;開發者可讀寫,負責改程式碼;測試員可讀加運行,負責驗證。
  2. 立併發紀律:只讀任務並行加速,寫入任務串行保安全。兩個子 Agent 同時改一個文件就是災難,所以權限和執行順序按讀寫性質分。
  3. 講隔離機制:子 Agent 跑在獨立 Worker Thread,記憶體隔離互不干擾,父級可以隨時中止子級。事件流上有 subagent_start、subagent_chunk、subagent_end 三類信號,進度條和中斷按鈕都掛在這上面。
  4. 劃適用邊界:單 Agent 能一趟幹完的活別拆。拆分帶來調度和彙總的開銷,只有任務天然分塊、且有並行收益時才值得上團隊。
⭐ 加分點補一句可觀測性:多 Agent 一跑,Token 消耗是乘法。事件流裏的 usage 事件要按子 Agent 分別計賬,不然帳單暴漲都不知道誰花的。
用這些課程頁組織答案 → 多 Agent 協作 可觀測性
Q30面試官
「你哋做嘅呢啲 Prompt 優化、RAG、緩存,等下一代模型發佈係咪全白幹咗?你點樣判斷邊啲值得投入?」
🎯 對方在考察什麼
這是本章的終極問題,考你有沒有第一性原理。能答好這題,説明前面所有手段在你腦子裏已經收斂成一件事,而沒答好的人只是背了一堆技巧。
🧭 答題框架
  1. 先給本質:一切 Harness 手段歸根到底都是構造更優質的上下文,讓模型更準確理解意圖。RAG、壓縮、Few-Shot、緩存,全是這一件事的不同側面。
  2. 給三個維度:質素,注入精準高密度的信息;結構,關鍵信息放首尾、核心約束進 System Prompt;成本,用最少 Token 傳遞最多有效信息。評估任何 Harness 投入,先看它落在哪個維度。
  3. 給取捨標準:值得做的,是和友商拼成本、效率、效果,且模型升級後效果更好的互補型手段;該放棄的,是消耗極大資源、模型升級後直接被替代、用戶又感知不到的手段。每個立項先問一句:模型版本升級後這件事還需要嗎?
  4. 收在原點:不知道怎麼做時回到那個問題:我現在給模型的上下文,是它做好這件事所需要的全部嗎?能答好這個問題,就掌握了 Harness 的本質。
⭐ 加分點用一個已經被淘汰的手段舉例,比如為省窗口做的複雜拆分在長上下文模型出來後失去價值,證明你真用「會不會被模型升級替代」這把尺子量過自己的方案。
用這些課程頁組織答案 → 大道至簡:堅守第一性原理 綜合成本優化
最後一個建議
這 30 題的正確用法是開口講一遍,對着同事、朋友或者錄音講。看懂不算數。講不順的地方,就是你以為懂了但還沒懂的地方,點關聯課程頁回去補上。