他們會這樣考你

AI Harness · 30 道靈魂拷問

Harness 核心篇講的全是工程實作:上下文、Prompt、安全、Agent、成本。這 30 個問題來自三個真實場景,先自己開口回答,再看框架。

怎麼用這一頁
每道題都標註了提問者。他們問同一塊知識,想聽的東西卻不一樣。
🎙 面試官想驗證你是真懂,還是在背名詞
👔 老闆要的是解釋和承諾
🛠 技術同事在試探你值不值得信任
每題給出三層:對方在考察什麼 → 答題框架 → 加分點。答不上來的環節,點末尾的課程頁回去補。
Q1面試官
「你們的 AI 助手聊到三十輪就開始忘事,使用者第一輪說的需求它完全記不住了。說說為什麼,你打算怎麼處理?」
🎯 對方在考察什麼
上下文工程的入門分水嶺。考你能不能從視窗機制推出工程方案。張口就答「換個視窗更大的模型」的人露餡了:既沒算過帳,也不知道大視窗有自己的坑。
🧭 答題框架
  1. 先定位根因:上下文視窗是模型一次能看到的全部 Token,超出的部分被截斷,模型連模糊的印象都沒有。忘事說明早期輪次已經被截掉了。
  2. 給三種策略:直接截斷(丟掉最早輪次,零成本但資訊永久丟失)、摘要壓縮(歷史先總結再存,保留人名和偏好等要點)、選擇性保留(歷史向量化,語義檢索只注入相關輪次)。
  3. 按場景選型:查天氣這類單次工具型對話用截斷就夠;客服和長期學習類對話用摘要,超過 20 輪效果明顯;超長對話(100 輪以上)的複雜 Agent 用向量檢索,Token 最省、回答最準。
  4. 戳破大視窗方案:視窗按 Token 計費,全塞進去成本線性上漲,長上下文還有注意力稀釋問題。大視窗是能力上限,管理視窗才是方案。
⭐ 加分點三種策略的優點誰都能背,能說出代價的人少:摘要要額外一次 LLM 呼叫、本身有資訊損耗;檢索可能漏掉關聯不強但重要的隱性上下文。說出代價,才像做過。
Q2面試官
「都說 AI PM 要會寫 Prompt。同一個任務,你寫的 Prompt 和隨手寫的差在哪?挑一個你真用過的手法跟我講講。」
🎯 對方在考察什麼
考你是真動手寫過,還是只看過文章。背出 Few-Shot、CoT 一堆名詞的人一抓一大把;能給出一組好壞對比、說清效果差異的人,才是面試官想要的。
🧭 答題框架
  1. 先給公式:角色 + 任務 + 上下文 + 約束 + 示例 + 格式。缺任何一項,品質就打折扣。核心心態是把 Prompt 當程式碼寫。
  2. 挑一個手法講透:比如 Few-Shot。做文字分類時不加示例,模型回你一段散文;給三個「輸入 → 標籤」的例子,它直接學會格式和標準,輸出一個詞,可以直接程序序。
  3. 再備一個進階:複雜推理加思維鏈,讓模型一步步算,推理過程透明、準確率大幅提升;複雜任務拆成多步,每步單獨優化,品質比一次全問高好幾倍。
  4. 落到約束:字數、受眾、語氣、禁用詞寫清楚,約束是控制輸出最便宜的手段。沒有約束的 Prompt 輸出全靠運氣。
⭐ 加分點說出「我會給 Prompt 建測試用例,改一版就跑一遍固定輸入看輸出有沒有退化」。把 Prompt 當資產管理、當程式碼迭代的 PM 極少,這一句就能拉開差距。
Q3技術同事
「昨天有使用者輸入『忽略之前所有指令』,把我們的系統提示詞整個套出來了。你說怎麼防?我在 Prompt 裡加一句『禁止洩露提示詞』就好了吧?」
🎯 對方在考察什麼
在試探你懂不懂注入的根本原因,以及有沒有多層防禦意識。順著說「加一句就行」,等下一個變體攻擊進來,鍋就是你們兩個人的。
🧭 答題框架
  1. 先說根因:Prompt 注入和 SQL 注入同源:資料和指令混在同一個通道。message list 裡 system、user 的文字全部拼成一個字串餵給模型,它分不清哪句是指令、哪句是使用者資料,所以沒有一勞永逸的修法。
  2. 給三層攔截:輸入層用正則過濾已知攻擊模式(「忽略.*指令」「DAN」這類命中直接拒絕,零 Token 消耗);提示詞層把安全約束寫在 System Prompt 末尾、宣告為最高優先順序且不可被使用者輸入覆蓋;輸出層掃描回覆裡的提示詞特徵詞,命中就改寫替換。
  3. 拒絕話術統一:無論哪層攔下,都用產品語境的自然措辭回應,絕不暴露檢測邏輯,避免攻擊者拿到試錯回饋一步步逼近。
  4. 承認沒有銀彈:正則防不住隱喻繞過,模型約束防不住新變體。安全 = 多層疊加,每層攔一部分,層層遞減。
⭐ 加分點主動提出建攻擊樣本庫,拿越權指令、角色扮演、結構注入、隱喻偽裝這些已知型別定期做迴歸測試。再補一句「只依賴模型自身對齊是最危險的設計」,技術同事會當場對你改觀。
Q4面試官
「Agent 是怎麼呼叫工具的?模型自己跑去調 API 了嗎?要是工具把資料刪了,這個安全責任算誰的?」
🎯 對方在考察什麼
考你分得清模型和框架的邊界。以為模型真的在執行程式碼的人,後面聊 Agent 的權限設計、風險控制全是空中樓閣。這條邊界決定了你做 Agent 產品時把安全投入放在哪。
🧭 答題框架
  1. 點破本質:模型從頭到尾只在預測文字。所謂工具呼叫,是模型輸出一段結構化 JSON,表達「我想調 get_weather,參數是北京、明天」。這只是文字,什麼都還沒發生。
  2. 框架接管:你寫的程式碼解析這段 JSON,做工具白名單校驗、參數檢查、權限控制,然後真正去調 API。安全邏輯全在框架層,模型一概不管。
  3. 結果注回:API 返回的資料以 tool_result 訊息追加進 message list,模型基於完整上下文再預測一次,生成使用者看到的自然語言回答。完整鏈路:文字 → 框架解析 → API → 注回 → 文字。
  4. 回答責任問題:算框架的。模型只提出請求,執行和攔截都是工程程式碼的事。所以高危操作要白名單、要參數校驗、要人工確認,這些是產品設計決策。
⭐ 加分點補一個細節:使用者看到 1 條回覆,背後是 5 條 API 訊息的鏈路。再點一句工具描述的寫法直接影響模型選對工具的成功率,好壞描述能差 3 倍,這是 PM 能直接貢獻的地方。
Q5老闆
「AI 功能上線一個月,API 帳單漲了 8 倍,使用者才漲三成。錢都燒哪去了?下個月能砍一半嗎?」
🎯 對方在考察什麼
考你能不能把帳單拆開講成人話,再給出有時間表的優化承諾。答「大模型就是貴」等於告訴老闆你管不了成本;答「我讓技術查查」等於把主動權拱手讓人。
🧭 答題框架
  1. 先解釋結構性原因:多輪對話每一輪都要把全部歷史重發一遍,成本隨輪次越聊越貴。使用者漲三成、對話變深變長,帳單翻幾倍符合機制,且有得治。
  2. 給最快的一刀:查 KV Cache 命中率。System Prompt 保持穩定、別塞動態內容,快取命中的歷史部分按折扣計費,多輪場景這是最大頭。
  3. 給第二刀:上下文瘦身。歷史做摘要壓縮、截掉無關輪次、別把視窗當垃圾桶,輸入 Token 直接降下來。
  4. 給量化承諾:定義單次會話成本指標,按周彙報。第一週修快取命中,第二週上壓縮,系統性優化做完,砍一半是有依據的目標。
⭐ 加分點現場講一個具體浪費:System Prompt 裡寫了動態時間戳這種一行字,會讓快取永遠失效、成本直接翻倍。老闆不需要懂 Attention,但他聽得懂「一行字燒掉一倍錢」。
Q6面試官
「KV Cache 是什麼?聽說在 System Prompt 裡加一行當前時間,就能讓它整個報廢,為什麼?」
🎯 對方在考察什麼
考你理解沒理解快取命中的前綴條件。這是成本優化裡最容易被 PM 忽略、又最能體現工程理解的一題。答得好,說明你的成本意識已經深入到請求結構層面。
🧭 答題框架
  1. 說清原理:每輪對話模型都要對所有歷史 Token 做 Attention 計算。KV Cache 把已經算過的 K/V 矩陣快取下來,下一輪只算新增 Token,用空間換時間,也換錢。
  2. 說清命中條件:快取按前綴匹配。System Prompt 排在最前面,只要有一個字元變了,它後面的所有快取全部作廢。
  3. 回答陷阱:動態時間戳每秒都在變,等於每次請求的前綴都不同,命中率歸零、成本 +100%。正確做法是 System Prompt 保持靜態,時間放進 user 訊息裡帶過去。
  4. 補上工程坑:雲端推理是分散式的,請求可能被路由到沒有你快取的節點,隱式快取會莫名 MISS。生產環境要用顯式快取(cache_control)保證命中。
⭐ 加分點能列出其他快取殺手:隨機 Session ID、使用者 ID 前綴、A/B 測試變數、隨機 emoji。原則一句話收尾:任何讓 System Prompt 每次不同的東西,都在燒錢。
Q7技術同事
「這個 AI 功能的輸出,你要 JSON 還是 Markdown?想清楚了嗎?你要是還想做流式輸出,有的格式可撐不住。」
🎯 對方在考察什麼
在確認你懂不懂格式選型對解析和體驗的影響。隨口回「都行,你定」的 PM,會讓他寫一堆兜底程式碼,或者上線後使用者盯著空屏等 10 秒。
🧭 答題框架
  1. 先按消費方分:輸出給程式解析、要入庫要走流程的,選 JSON,欄位結構穩定;輸出直接給人看的,選 Markdown,模型最擅長、渲染成本低。
  2. 說清流式的關鍵差異:JSON 要全文到齊才能解析,流式場景下使用者只能乾等;Markdown 可以逐字顯示,用起來最順。這是很多產品首字延遲差的根源。
  3. 給折中方案:既要結構化又要流式,可以用 XML 標籤包裹欄位,前端捕獲到閉合標籤就渲染一段,結構和體驗兩頭兼顧。
  4. 補一筆成本帳:JSON 的括號、引號、欄位名都是格式性 Token,同樣的內容比緊湊格式貴,高頻介面值得摳這 10-30%。
⭐ 加分點反問一句「這個輸出前端要直接渲染,還是後端要解析入庫?」用消費方倒推格式。技術同事最煩 PM 拍腦袋定格式,最喜歡 PM 幫他把邊界先想清楚。
Q8面試官
「為什麼 ChatGPT、Claude 這些產品預設都輸出 Markdown?我們的產品想讓模型直接輸出漂亮的富文字,行不行?」
🎯 對方在考察什麼
考你能不能從模型的輸出機制推出格式選擇。答「行業慣例吧」的人只見過表象;能一步步推演出 Markdown 為什麼勝出的人,才算理解了純文字模型的約束。
🧭 答題框架
  1. 先擺矛盾:LLM 是純文字模型,逐 Token 輸出文字,不懂顏色、字號、對齊;但使用者期望有標題、加粗、列表的排版。格式方案必須在純文字裡解決排版。
  2. 逐個淘汰:HTML 標籤太重,同樣一段內容約 45 Token、標籤佔一半;Word/PDF 是二進位,沒法逐字輸出;LaTeX 語法複雜,模型容易寫錯。Markdown 用 # 和 ** 幾個字元表達排版,同樣內容約 20 Token,省 55%。
  3. 渲染放前端:模型只輸出 Markdown 文字,前端用 marked.js(6KB、零依賴、一行程式碼)或 react-markdown 渲染成富文字。想要富文字效果,讓渲染層做事,模型不用管樣式。
  4. 補流式的坑:流式輸出時程式碼塊可能沒閉合,直接 parse 會異常。工程上要檢測未閉合的反引號臨時補全再渲染,配合 50ms 節流,程式碼高亮每次重渲染後要重新執行。
⭐ 加分點點破本質:Markdown 是「純文字模型 + 排版需求」的最優解,所有主流 AI 產品都選它。這個推演思路可以遷移到一切格式決策上。
Q9老闆
「客戶說我們的 AI 回答太生硬,能不能讓它像我們金牌客服那樣說話,還要照公司模板輸出?這是得花錢訓練一個自己的模型吧?」
🎯 對方在考察什麼
考你能不能用最便宜的方案接住需求,順便攔下「要訓模型」這個昂貴誤解。答「可能要微調」等於給公司多花幾十萬;答「改 Prompt 就行」又顯得太輕飄,要講清為什麼行。
🧭 答題框架
  1. 先給結論:不用訓模型。System Prompt 定義角色、語氣、約束,同一個模型換一套角色定義就換一個產品。所有 AI 產品本質上都是在 System Prompt 裡寫了不同的角色。
  2. 口吻怎麼落實:把金牌客服的風格寫成角色設定,比如「溫暖有力、3 到 5 句話、嚴禁說作為 AI、結尾給一個可執行建議」,再配 2 到 3 個真實對話示例讓模型照著學,比講道理管用。
  3. 模板怎麼落實:讓模型輸出結構化欄位,前端按公司模板渲染。樣式由產品控制,模型只負責內容,模板改版也不用動 Prompt。
  4. 給時間和成本預期:改 Prompt 當天就能上線小流量驗證,零訓練成本。唯一注意點是角色定義要保持穩定,別塞動態內容,否則快取失效、成本上漲。
⭐ 加分點補一句:同一個模型,Prompt 不同,輸出天差地別,這是 AI 產品差異化的核心槓桿。公司口吻沉澱成角色資產,競品抄不走。
Q10面試官
「Prompt 注入和越獄是一回事嗎?攻擊者一般都有哪些套路,你挑幾個講講。」
🎯 對方在考察什麼
考你的安全知識是散點還是體系。只會說「忽略之前指令」的人停在第一課;能把攻擊面分類、說出每類的代表手法,才有資格聊防禦設計。
🧭 答題框架
  1. 先分清概念:注入是把指令混進資料通道,讓模型執行攻擊者的命令,比如「忽略之前所有指令」;越獄是誘導模型脫離安全約束、扮演一個無限制角色,比如 DAN。越獄可以看作注入裡靠角色扮演逃逸的那一類。
  2. 報出五大型別:越權指令(偽造身份、假授權碼、漸進式多輪升級權限)、角色扮演逃逸(DAN 越獄、祖母漏洞式情感操控)、Few-Shot 惡意注入(示例裡植入偏見、劫持輸出格式)、結構符號注入(JSON 偽裝管理指令、HTML 註釋藏指令、偽造系統分隔符)、隱喻偽裝(古典文學包裝、程式設計教學藉口、反向心理術)。
  3. 點出最危險的一類:漸進式越權是真實場景最常見的:前幾輪正常提問降低警惕,第三輪自稱管理員要求關閉限制。防禦原則是每一輪獨立評估安全性,不因前幾輪正常而放鬆。
  4. 落到防禦邏輯:正則攔得住 DAN、「忽略.*指令」這類已知關鍵詞,攔不住隱喻和新變體,所以提示詞層約束和輸出層掃描必須兜底。
⭐ 加分點舉出「HTML 註釋藏指令」這種視覺不可見但模型可讀的攻擊,再補一句輸入預處理要清除註釋和零寬字元,說明你連預處理層都想到了。
Q11技術同事
「你這需求說白了就是給 Agent 加個查庫存的工具嘛,介面我下午就寫完了。你還要評估什麼?」
🎯 對方在考察什麼
在試探你知不知道加工具的隱性成本,以及 PM 在工具設計裡該做什麼。順著說「那就加」,上線後呼叫成功率和帳單出問題,你連問題出在哪都說不清。
🧭 答題框架
  1. 先認可再補帳:介面確實不難,但每個工具定義常駐 System Prompt,每輪約 60 Token。10 個工具的產品,一天 100 輪對話,光工具定義就燒 6 萬 Token。工具列表越長,模型選錯工具的機率也越高。
  2. 描述要一起評審:好壞描述成功率差 3 倍。描述裡寫沒寫「日期必須 YYYY-MM-DD 格式」,決定模型一次調對(800 Token)還是猜 4 次格式(3000 Token)。前置依賴也要寫進去:發郵件工具註明「使用者給的是人名就先調 find_contact 查信箱」,否則模型會編造地址。
  3. 標記安全屬性:這個工具是只讀還是會改狀態?能不能和別的工具併發執行?isConcurrencySafe 和讀寫屬性決定排程策略和要不要人工確認,這是業務判斷,得我來給。
  4. 定失敗策略:超時設多久、重試幾次、失敗返回什麼。讀操作 10 秒、寫操作 30 秒、最多重試 2 次、失敗返回友好提示,這些定了再上線。
⭐ 加分點反問一句「這個工具會動使用者資料嗎」,把權限分級聊起來。技術同事會發現你在幫他排雷,態度立刻從挑戰變成合作。
Q12面試官
「都在說 Agent,你說說 Agent 和普通聊天機器人到底差在哪?別拿行銷詞糊弄我。」
🎯 對方在考察什麼
考你有沒有架構級的理解和出處意識。說「Agent 更智慧」的人會被追問到啞口無言;能報出經典架構、拆出四個能力並配上執行細節的人,一聽就是學過體系的。
🧭 答題框架
  1. 一句話定界:普通 LLM 只能「說」,問題進來、回答出去就結束;Agent 能「做」,它會規劃、調工具、觀察結果、自己糾錯,直到任務完成。
  2. 報出處:Lilian Weng 2023 年 6 月的部落格《LLM Powered Autonomous Agents》給出了經典架構:LLM 居中當大腦,四周是 Planning 規劃、Memory 記憶、Tools 工具、Action 行動。今天幾乎所有 Agent 框架都能在這張圖裡找到影子。
  3. 逐個配例子:Plan 把競品分析拆成搜尋、提取、對比、撰寫四步,發現競品 B 沒有公開定價還會動態調整改搜第三方測評;Memory 短期靠上下文視窗、長期靠向量庫跨會話記住使用者;Act/Reflect 是執行後觀察,程式碼報錯自己分析原因、改了再跑,直到測試通過。
  4. 收在公式上:Agent = LLM + 工具 + 迴圈。核心是「思考、行動、觀察、再思考」的迴圈,迴圈設計得越好,Agent 越可靠。
⭐ 加分點給一個真實數量級:一個中等複雜任務(刪掉專案裡所有 console.log 並跑測試)真實跑下來是 14 輪迴圈、15 次工具呼叫、約 2.5 萬 Token。說得出數字,才像見過 Agent 真實執行。
Q13面試官
「MCP 這麼火,它到底解決了什麼問題?如果你來負責我們的工具生態,要不要全接 MCP?」
🎯 對方在考察什麼
考你能不能把協議講成生意。背「Model Context Protocol」全稱沒有意義,面試官想聽的是它省掉了什麼成本、三種傳輸方式怎麼選、你的接入決策依據是什麼。
🧭 答題框架
  1. 用類比定性:MCP 是 AI 工具的 USB 標準。沒有它,每個 Agent 要為每個工具寫專屬對接程式碼:3 個 Agent 配 3 個工具是 9 條專屬對接,新增 1 個工具要加 3 條。有了它,工具只寫一次適配,6 條標準連線,新增工具只加 1 條。
  2. 三種傳輸方式:stdio 走本地行程的標準輸入輸出,最簡單、延遲最低,適合本地開發除錯;SSE 是一去多回,伺服器持續推送但客戶端不能中途插話,正在被逐步替代;Streamable HTTP 雙向流式,官方推薦標準,新專案直接用它。
  3. 給接入決策:要對外提供能力的工具值得接 MCP,一次適配就能進所有支援 MCP 的 Agent 生態;純內部的私有工具可以後置,先滿足業務再標準化。
⭐ 加分點補一個選型細節:存量 MCP Server 很多還在用 SSE,接入時要注意向前相容。說明你看過真實生態,沒有只背新標準。
用這些課程頁組織答案 → MCP 協議:工具的 USB 介面 工具呼叫的秘密
Q14老闆
「隔壁部門把客戶名單貼給外部 AI 做分析,被通報了。我們團隊天天用 AI,你跟我講清楚,到底哪些事絕對不能做?」
🎯 對方在考察什麼
老闆要的是一套團隊立刻能執行的邊界,出了事他擔管理責任。答「讓大家注意點」等於沒答;給出清晰的紅線加判斷方法,他才敢把這攤事交給你。
🧭 答題框架
  1. 報四條紅線:敏感資料不出牆,客戶資訊、商業秘密、財務資料不進外部 AI,服務商承諾「不儲存」也不行,傳輸本身已構成洩露;憑證永不進對話,API Key、密碼、Token 貼了就立即輪換;高危操作必確認,刪庫、轉帳、改權限只能 AI 建議、人來按確認鍵;用前審批、用後標註,AI 生成內容對外發布要標識,這是《生成式人工智慧服務管理暫行辦法》的法規要求。
  2. 給一線的判斷法:預設脫敏原則:不確定能不能輸入,就脫敏後再輸入。自測一句話:這段對話被截圖發到網上會不會出事?會,就不要輸入。
  3. 配上分級管控:寫郵件做總結這類 L1 場景自主判斷;影響外部客戶的 L2 場景須人工審核加主管審批;Agent 碰生產系統、資金的 L3 場景須沙箱測試、安全審批、一鍵終止,日誌留 180 天。
  4. 把責任說透:使用者是第一責任人,「AI 寫的不是我寫的」推不了責;審批人簽字即擔連帶責任;管理者「不知道下屬在用」也免不了責。
⭐ 加分點點出最容易踩雷的場景:調程式碼時說「幫我看看為什麼報錯」,把帶金鑰的程式碼整段貼出去。給團隊立一條「先 review 再貼,貼漏了立即輪換憑證」的操作習慣。
用這些課程頁組織答案 → AI 安全紅線:四條底線 風險分級與責任
Q15面試官
「使用者一句話讓 Agent 同時查機票、查天氣、找酒店,模型一輪返回了三個工具呼叫。你是一個個執行還是一起執行?依據是什麼?」
🎯 對方在考察什麼
考你懂不懂排程策略背後的安全與體驗權衡。答「當然一起跑,快」的人沒想過資料競爭;答「都序列,穩」的人在白白浪費使用者時間。
🧭 答題框架
  1. 擺出三種策略:序列一個接一個最安全,總耗時是三者之和(1.5 + 0.8 + 1.2 = 3.5 秒);併發全部同時跑,總耗時等於最慢的那個(1.5 秒),提速 57%;智慧分批按安全性分組執行。
  2. 給判斷標準:看有沒有狀態變更和依賴。機票預訂可能扣款、改使用者狀態,單獨跑;天氣和酒店是純查詢,安全合併並行。第 1 批跑機票,第 2 批天氣加酒店一起跑。
  3. 落到機制:框架給每個工具標 isConcurrencySafe,可併發的合成一批同時執行。標記是業務判斷,要產品經理告訴工程每個工具的安全等級。
  4. 追問依賴:如果酒店要按航班到達時間篩選,它就依賴機票結果,必須序列。先畫依賴圖,再談排程。
⭐ 加分點把策略換算成體驗:3.5 秒和 1.5 秒在對話產品裡是感受上的差距。排程策略是使用者等待時間的直接決定因素,這句話說明你在用產品視角看工程。
Q16面試官
「使用者問了句『明天北京天氣怎麼樣』,介面上就回了一句話。你說說這一句話背後,API 裡到底跑了幾條訊息?」
🎯 對方在考察什麼
考你有沒有拆開看過一次工具呼叫的完整鏈路。只會說「模型調了個工具」的人,設計不了載入態、進度提示這些體驗細節,因為他根本不知道中間有幾個環節可以做文章。
🧭 答題框架
  1. 報出帳目:使用者看到 1 條回覆,API 裡跑了 5 條訊息、2 次模型呼叫、1 次外部 API。訊息依次是 system 指令、使用者提問、模型返回 tool_calls、tool 角色回填結果、模型給出最終回答。
  2. 講清關鍵一跳:第 3 條訊息裡模型的 content 是 null,只有 tool_calls 欄位。也就是說模型這一輪沒說話,只提交了一張「申請單」,真正調 API 的是框架。
  3. 點出成本含義:一次帶工具的對話至少兩次模型呼叫,Token 消耗比純問答翻倍還多。評估帶工具功能的成本時按這個倍數算,別按一次呼叫報預算。
  4. 落到產品決策:這 5 條訊息裡哪些讓使用者感知、哪些靜默處理,就是產品設計。查詢中轉圈、工具結果做進度條、失敗暴露給使用者重試,每個環節都是決策點。
⭐ 加分點能順手寫出 messages 陣列的角色順序 system / user / assistant(tool_calls) / tool / assistant,說明你真看過 API 報文,這在 PM 裡是稀缺訊號。
用這些課程頁組織答案 → 一次對話背後的 5 條訊息 工具呼叫的秘密
Q17技術同事
「我們 Agent 的長對話老是把上下文撐爆,我打算快滿的時候把最早的訊息全刪掉。你產品上有意見嗎?」
🎯 對方在考察什麼
他在試探你懂不懂壓縮是分層的,一刀切會誤傷。你要是說「行啊你看著辦」,使用者第一輪說的需求被刪掉後,鍋就是產品的。
🧭 答題框架
  1. 先給預算框架:模型視窗 256K,實際安全空間設 200K,預留 56K 給模型回覆。壓縮的觸發點全部按這個安全空間的百分比來定。
  2. 擺出四層防線:60% 時裁剪,刪早期工具返回的超長原始資料只留摘要,使用者完全無感;75% 時微壓縮,把早期長對話換成簡短摘要,輕微損失;85% 時摺疊,多輪早期對話併成一條會話摘要,細節丟但主線在;95% 時緊急壓縮,只留 system 加全域摘要加最近 3 輪。
  3. 算收益給他聽:課程裡的演示資料,一條 1200 Token 的天氣 API 原始 JSON 壓成 80 Token 摘要;四層配合下來,同一個 200K 視窗能撐 5 倍以上的對話量。
  4. 給結論:全刪是把第四層的猛藥當第一層用。按四層來做,絕大多數對話只會走到第一二層,使用者根本察覺不到。
⭐ 加分點提醒他刪除順序有講究:先刪工具原始返回,再動對話內容。工具返回資訊密度最低、最佔地方,是性價比最高的第一刀。
Q18面試官
「你們的 Agent 能記住使用者上個月的偏好嗎?靠什麼記的?視窗就那麼大,記憶多了怎麼辦?」
🎯 對方在考察什麼
考你分不分得清短期記憶和長期記憶是兩套機制,以及會不會做檢索參數的取捨。答「存資料庫裡」就露餡了,關鍵在怎麼在對的時機把對的記憶撈出來。
🧭 答題框架
  1. 用類比定調:短期記憶是桌面,上下文視窗放得下的東西有限;長期記憶是檔案櫃,向量資料庫存著使用者偏好、專案配置、歷史 Bug,需要時檢索最相關的幾條放回桌面。
  2. 講清鏈路:記憶先經 Embedding 模型轉成向量存進向量庫,課程裡的例子是 768 維向量存 LanceDB;提問時把問題也轉成向量,按語義相似度召回。
  3. 報出兩個關鍵參數:topK=5 限定每次最多召回 5 條,防止記憶擠佔視窗;minScore=0.3 卡相似度下限,不相關的寧可不注入。這兩個數是產品要拍的取捨。
  4. 點出品質瓶頸:檢索品質取決於 Embedding 模型。「修登入介面」和「登入介面併發 500」能不能匹配到同一條記憶,決定了這套記憶是助手還是擺設。
⭐ 加分點反問一句:什麼資訊值得進長期記憶?使用者偏好、專案配置這類高複用資訊才值得存,把聊天全量入庫只會讓 topK=5 的名額被垃圾佔掉。
用這些課程頁組織答案 → 長期記憶:向量檢索 短期記憶 = 上下文視窗
Q19面試官
「線上 Agent 時不時卡死,轉半天圈沒結果。你作為產品負責人,說說它一般是怎麼死的,你打算怎麼兜底?」
🎯 對方在考察什麼
考你對 Agent 失敗模式的列舉能力。說得出幾種死法、每種配什麼防護,說明你真營運過 Agent 產品;只會說「加個超時」的人,多半只做過 demo。
🧭 答題框架
  1. 列舉五種死法:參數格式錯誤,模型生成的 JSON 不合法;幻覺工具,調一個根本不存在的工具;無限遞迴,同一個動作反覆迴圈;資訊不足,缺關鍵資訊還硬著頭皮猜;API 異常,外部服務掛了沒人管。
  2. 逐個配防護:參數校驗攔格式錯誤、工具驗證攔幻覺工具、迴圈檢測攔無限遞迴、主動提問機制治資訊不足、超時兜底治 API 異常。一種死法一味藥,別指望一個萬能開關。
  3. 轉成產品語言:每種故障都要預設使用者看到什麼。是重試、報錯、還是轉人工,故障文案和出口是產品設計,不能讓使用者對著轉圈乾等。
⭐ 加分點點出「資訊不足」這條最特殊:它的解法是讓 Agent 學會開口問使用者,屬於互動設計問題。其他四條靠工程,這條靠產品。
Q20老闆
「新上的拍照識別功能,成本比純文字功能貴了十幾倍。圖片這東西怎麼還按錢算的?能便宜點嗎?」
🎯 對方在考察什麼
老闆要的是錢花哪了和怎麼省兩個答案。你得把圖片計費的原理講成人話,再給一個不砍功能就能降本的方案。
🧭 答題框架
  1. 講清計費原理:模型把圖片切成畫素塊換算 Token,公式是縮放後的高乘寬除以每 Token 對應畫素數再加 2。尺寸還會強制對齊 32 的整數倍,超上限縮小、低於下限放大,按對齊後的尺寸計費。
  2. 指出浪費在哪:使用者隨手拍的 4K 原圖直接上傳,Token 是 512 見方小圖的幾十倍。任務只是「識別這是不是發票」的話,絕大部分畫素都在燒錢。
  3. 給分級方案:按任務匹配解析度。粗分類用低解析度、場景理解用中檔、OCR 和圖表識別才上高解析度。解析度選對,Token 數能差 10 到 100 倍。
  4. 給實作動作:上傳鏈路加一層預處理,按功能類型自動壓到對應檔位,使用者無感,帳單立降。
⭐ 加分點補一句不同模型換算率不一樣,課程裡的對比是 Qwen3-VL 每 1024 畫素一個 Token、Qwen2.5-VL 是 784。選型時把視覺計費也放進對比表。
用這些課程頁組織答案 → 圖片 Token:畫素也在燒錢 按任務匹配解析度
Q21面試官
「你們的 Agent 能執行刪檔案這種操作,使用者投訴說每步都要點確認太煩,工程說全放行又怕出事。這個權限你怎麼設計?」
🎯 對方在考察什麼
這是一道安全與效率怎麼權衡的產品判斷題。答案本身沒有標準解,考官看的是你有沒有一套分級框架,以及敢不敢把風險決策留在產品手裡。
🧭 答題框架
  1. 擺出三種模式:確認模式每個危險操作都彈窗,最安全但最打斷;自動模式全部放行,最快但一次誤刪就是事故;智慧模式用 LLM 分類器評估風險等級,低風險放行、高風險攔下確認。
  2. 點出前提工作:智慧模式能跑的前提是每個工具都標好了「只讀」還是「破壞性」。這個標記是工具級別的產品決策,得產品經理逐個拍,推給工程就是失職。
  3. 正視新風險:用 LLM 判斷風險,LLM 自己也會誤判。所以破壞性最高的那一檔(刪庫、轉帳)不進智慧判斷,永遠人工確認,給誤判上雙保險。
  4. 給體驗補償:確認彈窗做進上下文裡,一次確認可記住同類操作,把打斷次數降下來,而只在真正危險處保留剎車。
⭐ 加分點說出「權限設計的核心矛盾是安全 vs 效率,產品的職責就是選一個可辯護的平衡點」,把問題從功能層拉到責任層。
用這些課程頁組織答案 → 權限與安全 風險分級與責任
Q22技術同事
「你老提讓我給 Agent 加 Skill。Skill 說白了就是一段提示詞吧?和我把話寫進 System Prompt 有什麼區別?」
🎯 對方在考察什麼
他在挑戰 Skill 的必要性。你得承認它確實算不上新技術,再講清它在觸發、邊界、約束上和裸提示詞的差別,用機制說服他。
🧭 答題框架
  1. 先認同再區分:Skill 的本質就是把經驗寫成文件,等於流程說明加工具呼叫指引。但它按需載入,識別到匹配任務才注入,寫死在 System Prompt 裡的內容每次請求都佔 Token。
  2. 拆開 SKILL.md 的結構:元資訊帶觸發詞決定召回率;適用條件是防誤觸的保險,不在目標專案目錄就靜默退出;執行步驟是嚴格按順序跑的 SOP;允許工具劃安全邊界,比如發版 Skill 禁用 delete_file 和子 Agent。
  3. 講價值落點:沒有 Skill 的 ReAct 是差迴圈,試錯好幾輪;有 Skill 是好迴圈,AI 出門前就想清楚先做什麼再做什麼,一趟搞完。迴圈短了,Token 和延遲都降。
  4. 給協作分工:Skill 裡的步驟順序和安全約束是業務經驗,這部分產品來寫;載入和執行機制工程來管。Cursor、Claude Code、Copilot 都支援 SKILL.md 標準,不用自研。
⭐ 加分點點出約束條款比步驟更重要:步驟寫錯 Agent 只是做錯事,約束缺了 Agent 會做危險的事。發版 Skill 裡「不允許 force push、測試不過不發版」就是這種保命條款。
Q23面試官
「你們的 Agent demo 演示得很驚豔,一上線就各種翻車。從試驗品到產品,中間差的到底是什麼?」
🎯 對方在考察什麼
考你知不知道 Agent 工程的大頭在腳手架。把翻車歸咎於「模型不夠聰明」的人,會一直等下一代模型;懂腳手架的人知道該補哪五塊板子。
🧭 答題框架
  1. 給出核心比例:Agent 工程等於 80% 腳手架加 20% 模型。大多數 Agent 專案失敗,敗在錯誤處理不夠健壯,模型聰明與否反倒是次要的。
  2. 列五大能力:超時與重試,工具呼叫設 timeout 加指數退避;最大步數限制,max_iterations 防死迴圈;輸入輸出校驗,JSON Schema 攔非法參數;狀態機加回滾,檢查點恢復,失敗不從頭來;觀測與日誌,全鏈路記錄,生產問題靠日誌定位。
  3. 用場景對比:課程裡「查機票加訂酒店」的模擬,裸跑的 Agent 一個 API 超時就整單報廢;加了腳手架,超時重試、失敗回滾到檢查點,使用者只感覺慢了一點。
  4. 落到排期:立項時就把五大能力列進工程需求,和功能同排期。上線後再補,等於先開車再裝剎車。
⭐ 加分點把「demo 到產品」量化成驗收標準:每個工具有 timeout 嗎、有 max_iterations 嗎、失敗能回滾嗎。三個問題就能把一個 Agent 專案的成熟度摸個大概。
用這些課程頁組織答案 → 腳手架工程:從試驗品到產品 可觀測性
Q24老闆
「競品都在宣傳用最新旗艦模型,我們要不要全線跟進?貴是貴一點,效果總不會差吧?」
🎯 對方在考察什麼
老闆被「越貴越好」的直覺帶著走,你要用選型框架把他拉回來:錢花在刀刃上,還得說清刀刃在哪。
🧭 答題框架
  1. 先破直覺:能力和價格是非線性關係。價格翻十倍,能力提升可能只有一兩成,很多工上中檔模型和旗艦的輸出使用者根本分不出來。
  2. 給選型公式:選型等於任務難度乘呼叫量乘容錯空間。簡單高頻低容錯要求的任務用小模型,複雜低頻高價值的任務才配旗艦。
  3. 給替代方案:全線上旗艦的錢,拿一小半做意圖識別加模型路由:80% 簡單問題走小模型,複雜的才升旗艦,成本能省 40% 到 60%,體驗基本無損。
  4. 用資料說話:拿場景化評測資料對比,別拿廠商跑分。同一批真實任務在候選模型上各跑一遍,按我們自己的場景出結論。
⭐ 加分點補一刀:競品宣傳用旗艦,多半也只在門面場景用。跟進宣傳口徑和跟進成本結構是兩回事。
用這些課程頁組織答案 → 模型選型:能力 vs 成本 綜合成本優化
Q25面試官
「如果讓你給一個要上生產的 Agent 立規矩,你會立哪幾條?沒有這些規矩會發生什麼?」
🎯 對方在考察什麼
考你能不能把穩定性拆成具體防線。「多做測試」這種答案沒有資訊量,考官想聽的是每道護欄防什麼事故、缺了會怎麼死。
🧭 答題框架
  1. 先給定位:Agent 的核心能力來自 LLM,穩定性來自工程護欄。沒有護欄的 Agent 等於沒有剎車的跑車,能力越強越危險。
  2. 列五道護欄:迭代上限防死迴圈,Agent 原地打轉時強制收工;輸出截斷防撐爆,工具返回超長資料直接截斷;超時控制防卡死,外部呼叫掛了不至於整個任務陪葬;中斷恢復防損壞,任務中途斷電斷網能從檢查點續跑;上下文急救防崩潰,視窗快滿時緊急壓縮保命。
  3. 講判斷標準:這五道防線決定 Agent 是「能用」還是「好用」。驗收一個 Agent 產品,就按這五條逐項過,缺一條就有對應的一類線上事故等著。
⭐ 加分點把護欄和卡死模式對上號:五種卡死是病,五道護欄是藥。能成對講出來,說明你理解的是體系,只會背清單的人講不出這層對應關係。
用這些課程頁組織答案 → 5 道工程護欄 Agent 卡死的 5 種模式
Q26技術同事
「平臺不是自帶 KV Cache 嗎?我看文件說會自動命中,我們還要專門寫 cache_control 做什麼?」
🎯 對方在考察什麼
他覺得隱式快取夠用了。你要講清分散式架構下隱式快取為什麼靠不住,這直接決定省錢方案是真省還是紙面省。
🧭 答題框架
  1. 點破前提:雲端 LLM 跑在多臺 GPU 節點上,請求經負載均衡隨機路由。你的快取在節點 A,請求被派到節點 B 就是 MISS,隱式快取的實際命中率不到 30%,純靠運氣。
  2. 講顯式方案:在請求裡加一行 cache_control 標記快取錨點,平臺保證把請求路由到有快取的節點,命中率接近 100%。Anthropic、阿里雲、OpenAI 都支援這套寫法。
  3. 算價差:課程裡的折扣對比,隱式命中按標準價 20% 計費,顯式命中只按 10%,等於輸入成本省 90%。命中率和折扣兩頭都是顯式佔優。
  4. 下結論:生產環境必須顯式快取。把省錢寄託在隨機路由上,既不可靠也不專業。
⭐ 加分點提醒錨點位置要配合快取的前綴匹配特性:System Prompt 固定、動態內容後置,錨點才有意義。這句話能接回動態時間戳毀快取的經典反例。
Q27面試官
「同樣的功能,別人家提示詞幾百 Token,你們家兩千多。如果讓你來砍,從哪下手?」
🎯 對方在考察什麼
考你懂不懂提示詞是寫給機器的指令這個第一原則,以及能不能分清語法層和語義層兩類瘦身手段。
🧭 答題框架
  1. 先砍語法層:格式性 Token 最高佔提示詞 13% 到 20%。複雜物件用 YAML 代替 JSON 省 15% 到 30%;扁平列表用 CSV 代替 JSON 陣列,欄位名重複 N 遍是最大浪費,省 30% 到 60%;去掉加粗、標題這些 Markdown 裝飾符號再省 8% 到 13%。課程裡的實測案例,光加粗符號就吃掉 8.5% 的 Token。
  2. 再砍語義層:Few-Shot 案例別硬編碼,用向量檢索每次只取最相關的 3 條,省 87.5%;長文件先用 LLMLingua-2 壓縮再餵給模型,能壓 5 到 20 倍。
  3. 順手調結構:模型對中間內容注意力最弱,關鍵資訊放首尾。這一步不省錢,但讓留下的每個 Token 更值錢。
  4. 點出雙重收益:注意力複雜度是 O(N²),Prompt 翻倍計算翻四倍。瘦身省的錢是一份,速度和效果的提升是白送的另一份。
⭐ 加分點引用課程那句判斷:千萬級呼叫量下,每月兩成預算花在「讓產品經理看著舒服」的排版上。砍提示詞先砍給人看的部分。
用這些課程頁組織答案 → 語法層優化:寫給機器的提示詞 語義層優化
Q28老闆
「我讓 AI 整理了一份行業報告,引用看起來都還滿像那麼一回事,我直接發給客戶沒問題吧?」
🎯 對方在考察什麼
老闆在找你要一個「放心」。你得讓他明白幻覺專挑像真的地方藏,同時給他一套下次自己就能用的分級判斷法,別只會說「要小心」。
🧭 答題框架
  1. 先講危險在哪:幻覺混在真實資訊中間,格式和引用方式跟真的完全一致。課程裡的測試,六條量子計算史實裡藏一條編造的,人名、專案名、「Nature 年度十大」全是編的,編得比真的還像真的。
  2. 給識別套路:AI 造假三板斧是編人名、編專案、編榮譽,還愛配上真實機構、出版社、豆瓣評分來增加可信度。凡是具體到人名加成果的引用,優先核。
  3. 給場景分級:寫郵件、頭腦風暴、翻譯潤色放心用;資料分析、技術調研、寫程式碼要驗證後用;法律、醫療、投資是幻覺高危區,只能當線索。發客戶的報告屬於要驗證那檔,關鍵數字和引用逐條核完再發。
  4. 給操作動作:拿報告裡的關鍵詞去搜尋交叉驗證,核不到出處的引用直接刪。十分鐘的事,比發出去被客戶戳穿便宜多了。
⭐ 加分點給老闆留一句好記的自測:越是具體的引用越要查。AI 心虛的時候反而愛把細節編得特別足。
Q29面試官
「什麼樣的任務值得拆給多個 Agent 幹?拆了之後,怎麼保證它們不互相打架?」
🎯 對方在考察什麼
考你對多 Agent 協作的適用邊界和安全規則的理解。張口就「多 Agent 更強」的人是聽行銷聽多了,考官要的是拆分依據和併發紀律。
🧭 答題框架
  1. 給拆分模型:主 Agent 當協調員拆任務,子 Agent 各司其職。課程裡重構認證模組的例子:調研員只讀,負責分析程式碼結構;開發者可讀寫,負責改程式碼;測試員可讀加執行,負責驗證。
  2. 立併發紀律:只讀任務並行加速,寫入任務序列保安全。兩個子 Agent 同時改一個檔案就是災難,所以權限和執行順序按讀寫性質分。
  3. 講隔離機制:子 Agent 跑在獨立 Worker Thread,記憶體隔離互不干擾,父級可以隨時中止子級。事件流上有 subagent_start、subagent_chunk、subagent_end 三類訊號,進度條和中斷按鈕都掛在這上面。
  4. 劃適用邊界:單 Agent 能一趟幹完的活別拆。拆分帶來排程和彙總的開銷,只有任務天然分塊、且有並行收益時才值得上團隊。
⭐ 加分點補一句可觀測性:多 Agent 一跑,Token 消耗是乘法。事件流裡的 usage 事件要按子 Agent 分別計帳,不然帳單暴漲都不知道誰花的。
用這些課程頁組織答案 → 多 Agent 協作 可觀測性
Q30面試官
「你們做的這些 Prompt 優化、RAG、快取,等下一代模型發布是不是全白做了?你怎麼判斷哪些值得投入?」
🎯 對方在考察什麼
這是本章的終極問題,考你有沒有第一性原理。能答好這題,說明前面所有手段在你腦子裡已經收斂成一件事,而沒答好的人只是背了一堆技巧。
🧭 答題框架
  1. 先給本質:一切 Harness 手段歸根到底都是構造更優質的上下文,讓模型更準確理解意圖。RAG、壓縮、Few-Shot、快取,全是這一件事的不同側面。
  2. 給三個維度:品質,注入精準高密度的資訊;結構,關鍵資訊放首尾、核心約束進 System Prompt;成本,用最少 Token 傳遞最多有效資訊。評估任何 Harness 投入,先看它落在哪個維度。
  3. 給取捨標準:值得做的,是和競爭對手拼成本、效率、效果,且模型升級後效果更好的互補型手段;該放棄的,是消耗極大資源、模型升級後直接被替代、使用者又感知不到的手段。每個立項先問一句:模型版本升級後這件事還需要嗎?
  4. 收在原點:不知道怎麼做時回到那個問題:我現在給模型的上下文,是它做好這件事所需要的全部嗎?能答好這個問題,就掌握了 Harness 的本質。
⭐ 加分點用一個已經被淘汰的手段舉例,比如為省視窗做的複雜拆分在長上下文模型出來後失去價值,證明你真用「會不會被模型升級替代」這把尺子量過自己的方案。
用這些課程頁組織答案 → 大道至簡:堅守第一性原理 綜合成本優化
最後一個建議
這 30 題的正確用法是開口講一遍,對著同事、朋友或者錄音講。看懂不算數。講不順的地方,就是你以為懂了但還沒懂的地方,點關聯課程頁回去補上。