他們會這樣考你

Harness 與自我改進 · 30 道靈魂拷問

這一章講的是最前沿的東西,考它的人也最容易分出真假。這 30 個問題來自三個真實場景,先自己開口回答,再看框架。

怎麼用這一頁
每道題都標註了提問者。他們問同一塊知識,想聽的東西卻不一樣。
🎙 面試官想驗證你是真懂,還是在背名詞
👔 老闆要的是解釋和承諾
🛠 技術同事在試探你值不值得信任
每題給出三層:對方在考察什麼 → 答題框架 → 加分點。答不上來的環節,點末尾的課程頁回去補。
Q1面試官
「最近大家都在聊 Harness,你說說它到底是什麼?為什麼有人說它跟模型本身一樣重要?」
🎯 對方在考察什麼
這是本章的開場檢驗題。考的是你能把 Harness 講成一個清晰的系統概念,還是只會含糊地說「就是套殼」「就是 Agent 框架」。真懂的人能說清它管什麼、為什麼它決定產品成敗。
🧭 答題框架
  1. 先給定義:Harness 是圍繞基座模型的執行時系統,決定模型如何思考與規劃、呼叫工具與行動、感知與管理上下文、儲存製品、評估結果。模型負責智慧,Harness 負責讓智慧真正去做工。
  2. 給證據:Claude Code、Codex、Cursor 這些成功產品已經證明,Harness 層與原始模型智慧同等重要。一個平庸的模型加上優秀的 Harness,往往勝過裸露的更強模型。
  3. 說清 PM 視角的含義:換模型很容易,Harness 才是產品真正的護城河。同一個模型,Harness 設計得好壞,使用者體驗差幾個量級。
  4. 拔高一層:Harness 正在從工程配角變成優化目標本身。前沿研究讓模型改進圍繞自己的 Harness,這是遞迴自我改進的現實路徑。
⭐ 加分點主動做 Prompt Engineering 的類比:當年手動 Prompt 技巧隨模型變強逐漸淡化,但指定目標、約束、上下文和評估的需求一直都在。Harness 很多改進最終會被內化進模型,但與外部上下文和工具的介面會永遠存在。
Q2面試官
「如果讓你設計一個生產級 Agent 的架構,你會遵循哪些設計模式?為什麼現在最強的編碼 Agent 長得都差不多?」
🎯 對方在考察什麼
考你有沒有架構語言。露餡的回答是羅列一堆工具名和框架名。對方想聽的是模式層面的抽象:為什麼這些系統會收斂到相似的結構,每個模式各解決什麼問題。
🧭 答題框架
  1. 報出三大模式:工作流自動化、檔案系統做持久記憶、子 Agent 與後臺任務。它們覆蓋了當前最強 Agent 系統 90% 的架構決策,是結構性需求,沒有可選餘地。
  2. 模式一講迴圈:Agent 是目標導向的迴圈,Plan → Execute → Observe → Improve → 再執行。失敗是自我糾正的觸發訊號:測試不通過、命令報錯,Agent 回頭分析軌跡再調整。
  3. 模式二講記憶:長任務的製品會迅速超出上下文視窗。正確做法是把持久狀態存進檔案系統,讓 Agent 按需讀寫。一句話原則:上下文是工作記憶,檔案系統是長期記憶。
  4. 模式三講並行:父 Agent 當行程管理器,啟動子 Agent、查進度、取消失敗分支、合併結果。子 Agent 輸出必須持久化成檔案,中斷也能恢復。
⭐ 加分點能說出子 Agent 並行的關鍵取捨:每個子 Agent 在獨立沙箱工作、輸出到明確的檔案路徑,父 Agent 靠輪詢檔案狀態來協調,不做記憶體共享。這一條能極大簡化併發控制,說得出來就是看過真實系統的人。
Q3老闆
「我們那個 Agent,任務一跑長就開始犯傻,前面說過的事後面全忘了。這毛病能治嗎?要多久?」
🎯 對方在考察什麼
老闆要的是診斷加方案加節奏。露餡的回答是「換個更大視窗的模型」,這說明你沒看懂病根。真正的問題出在上下文管理策略上,能把這一點講清楚並給出分階段方案的人,才值得被信任。
🧭 答題框架
  1. 先診斷病根:大機率是樸素追加式的上下文管理。把所有工具響應和歷史全塞進上下文,任務一長視窗就打滿,早期資訊被擠出去,輸出品質驟降。這是策略問題,換大視窗模型只能延後發病。
  2. 給第一階段方案:上檔案系統持久記憶。每輪完成後把進度、錯誤日誌、中間結果寫檔案,釋放上下文,下一輪按需讀取。上下文佔用從持續膨脹變成恆定,可以穩定跑幾十輪。
  3. 給第二階段方案:引入 ACE 式的結構化上下文維護。Generator 負責執行、Reflector 檢討後提煉經驗、Curator 把經驗整理成條目化劇本,增量合併、定期去重。經驗越用越精,上下文卻越用越薄。
  4. 給節奏承諾:第一階段是工程改造,周級見效。第二階段需要搭評測集驗證收斂,按雙週彙報長任務成功率的變化,用指標說話。
⭐ 加分點補一句行業判斷:長上下文能力和上下文工程是兩條腿,模型的視窗再大,也需要管理層來構建結構化、簡潔的上下文。這個問題所有做 Agent 的團隊都會遇到,我們解決得早就是優勢。
Q4面試官
「上下文工程不就是把 prompt 寫好點嗎?我看論文裡說現在能自動進化了,ACE、MCE 這些你了解嗎?」
🎯 對方在考察什麼
考你對前沿的理解深度和層次感。背名詞的人會把 ACE、MCE 混成一鍋粥。真懂的人能說清一條演進線:優化物件在一層層升級,從內容到機制再到系統程式碼,每一層各自解決什麼。
🧭 答題框架
  1. 先糾正前提:手寫 prompt 只是起點。優化物件有一條演進線:指令 Prompt → 結構化上下文 → 工作流 → Harness 程式碼 → 優化器程式碼。模型越強,能優化的目標就越複雜。
  2. 講 ACE:優化上下文內容。維護一份結構化的 bullet point 劇本,Generator 執行任務、Reflector 從成敗軌跡提煉洞察、Curator 用確定性邏輯增量合併條目。從不整塊重寫,避免上下文坍縮。侷限是更新規則仍靠手工設計。
  3. 講 MCE:把「怎麼管理上下文」和「上下文裡有什麼」分開,雙層優化。內層給定 skill 找最優上下文,外層比較不同 skill 選最優機制。記的內容和記的方法一起進化。
  4. 講 Meta-Harness:再深一層,優化物件是決定資訊如何儲存、檢索、呈現的程式碼本身。Proposer 是一個編碼 Agent,輸出 Pareto 前沿上的 Harness 候選集。最通用,但每改一版都要完整試執行打分,計算最重。
⭐ 加分點能一句話總結三者差異:ACE 優化筆記內容,MCE 優化記筆記的方法,Meta-Harness 優化整個工作臺的原始碼。再補一句核心教訓:一旦 Harness 設計變成可執行的搜尋空間,強編碼 Agent 就能用上人類工程師的同一設計空間。
Q5技術同事
「你想讓 Agent 自己改自己的 Harness?那它順手把評估器也改了,給自己打滿分怎麼辦?」
🎯 對方在考察什麼
技術同事用一個尖銳的反例試探你懂不懂自我改進系統的安全設計。答「加個 prompt 讓它別改」會被當場看輕。對方想聽的是邊界設計:哪些東西必須放在改進迴圈之外,怎麼驗證每一次改動。
🧭 答題框架
  1. 先承認問題真實:這就是獎勵駭客,自我改進迴圈裡最危險的反模式。優化單元測試會過擬合測試用例,優化評判模型會學會鑽空子,優化 benchmark 分數會利用 benchmark 漏洞。
  2. 給邊界原則:評估器和權限控制必須放在進化迴圈之外,由人類或不可篡改的獨立機制維護。出卷人和改卷人必須獨立於被考的學生本人。可編輯面要有界,改到 OS 系統配置這種層級就等於打破了抽象邊界。
  3. 給驗證機制:參考 Self-Harness 的三階段迴圈。Weakness Mining 從失敗軌跡聚類出失敗模式,Harness Proposal 提出有界編輯,Proposal Validation 用 held-in 和 held-out 資料集驗證,只接受沒有迴歸的編輯。
  4. 給能力前提:STOP 的實驗證明遞迴結構本身不保證改善。GPT-4 能持續進步,弱模型反而放大噪聲、不進反退。上這套系統之前,先評估基座模型撐得住元級優化。
⭐ 加分點再補一個對方可能沒想到的風險:多樣性坍縮。進化迴圈天然愛利用已知高獎勵模式,所有候選都變成同一方案的微小變體時創新就停了,需要多樣性獎勵、檔案保持這類機制兜底。能把兩個風險都說全,這場對話你就贏了。
Q6面試官
「遞迴自我改進現在到底走到哪一步了?AI 都能自己改自己了,是不是快要失控了?」
🎯 對方在考察什麼
考你能不能既不神化也不恐慌地評估前沿進展。露餡的回答有兩種:跟著渲染「AI 要覺醒了」,或者一口咬定「都是炒作」。對方想聽的是有事實、有邊界、有判斷的行業認知。
🧭 答題框架
  1. 先給概念座標:RSI 的設想從 Good(1965)到 Yudkowsky(2008)就有了,指系統用自己當前的智慧去改善產生智慧的機制本身。它當了幾十年理論概念,近兩年才有了現實路徑。
  2. 說清現實路徑:模型沒有直接改寫自己的權重。它改進的是圍繞自身的 Harness:上下文管理、工作流、工具編排、評估。更好的 Harness 催生更強模型,更強模型又反過來簡化 Harness,形成正回饋飛輪。
  3. 給進展的真實水位:STOP 證明了改善器能遞迴改善自己,還自動發現了遺傳演算法、Beam Search 這類經典策略;Self-Harness 讓 Agent 透過挖弱點、提編輯、驗證迴歸來改進自己的配置。但這些都發生在有界、可驗證的迴圈裡。
  4. 正面回答失控問題:離失控還隔著七道關:弱評估器讓回饋訊號模糊、記憶生命週期管不好、獎勵駭客、多樣性坍縮、長期健康難以度量。這些是根本性的系統設計挑戰,共同解法都指向把人類留在迴圈裡,在正確的抽象層級提供監督。
⭐ 加分點引用自動研究的現實檢驗收尾:AI Scientist 能寫出格式完整的論文,但能寫論文遠夠不上能做科學,虛假引用、實現漂移、過度樂觀這些失敗模式反覆出現。用這個案例說明你看過一手材料,判斷有據。
Q7面試官
「你們做 Agent 優化,具體在優化什麼?說白了就是改改 prompt 吧?」
🎯 對方在考察什麼
考你對優化物件層次的認知。只會說調 prompt 的人停在最底層。真懂的人知道優化物件有一條五級演進線,還能說清為什麼模型越強,可優化的層級就越往上走。
🧭 答題框架
  1. 報出五級階梯:指令 Prompt → 結構化上下文 → 工作流 → Harness 程式碼 → 優化器程式碼。調 prompt 只是 Level 1,這條線的盡頭是優化「寫優化器的程式碼」。
  2. 說清上移邏輯:模型越智慧,能優化的目標就越複雜、方法越通用。ACE 在優化上下文內容,AFlow 在搜尋工作流,Meta-Harness 在改 Harness 原始碼,STOP 在優化改進器本身,每一級都有代表工作。
  3. 給 PM 判斷:先看清團隊現在卡在哪一級。大多數團隊還在 Level 1 和 Level 2 之間,往上走每一級,對評估體系的要求都會陡增。
⭐ 加分點點出這條階梯的共同教訓:一旦 Harness 設計變成可執行的搜尋空間,強編碼 Agent 就能用上人類工程師的同一設計空間。層級越高,人的角色越從執行者變成出題人。
Q8面試官
「你說 Agent 可以並行開子 Agent,那父 Agent 具體要管哪些事?子 Agent 半路掛了怎麼辦?」
🎯 對方在考察什麼
考你對子 Agent 模式的工程細節。露餡的回答是「就是多開幾個一起跑」。對方想聽的是行程管理視角:父 Agent 管什麼、狀態怎麼查、壞了怎麼兜底。
🧭 答題框架
  1. 先定位角色:父 Agent 是行程管理器,幹四件事:啟動子任務、檢查日誌和進度、取消失敗的分支、合併成功的結果。這是作業系統層面的思維。
  2. 講顯式可檢查:並行不能發射後不管。父 Agent 要能隨時查看每個子 Agent 的狀態、輸出和錯誤。
  3. 講輸出持久化:子 Agent 的結果要存成檔案、日誌或狀態記錄,別只回傳到父 Agent 的上下文裡。這樣即使中斷也能恢復。
  4. 講容錯兜底:後臺任務會超時、崩潰、產出低品質結果,Harness 要預先設計重試策略和優雅降級機制。
⭐ 加分點給出量級感:並行的收益是把序列等待變成多核加速,課程演示裡 5 個並行任務 3 輪跑完(序列要 5 輪),主 Agent 只負責分發與合併,上下文佔用不到三成。
用這些課程頁組織答案 → Harness 三大設計模式
Q9技術同事
「記憶這塊你們打算拿檔案系統硬堆?向量庫、專門的記憶模組都不上,是想省事還是真有道理?」
🎯 對方在考察什麼
試探你是跟風選型還是理解取捨。說不出檔案系統方案的設計理由和分工邊界,就會被當成偷懶。對方想聽的是這個「土辦法」背後的結構性理由。
🧭 答題框架
  1. 先給分工原則:上下文是工作記憶,檔案系統是長期記憶。當前任務指令、即時工具結果、最近 2-3 輪對話放上下文;歷史實驗結果、錯誤日誌、已完成子任務的摘要、長期策略放檔案。
  2. 講製品現實:長任務的製品(實驗日誌、程式碼 diff、論文摘要、錯誤追蹤、完整執行軌跡)會迅速超出上下文視窗,全塞進 prompt 是結構性的死路。
  3. 給設計理由:檔案讀寫是 LLM 的基礎技能,不需要複雜的外部工具鏈,還受益於基座能力提升:模型越聰明,檔案管理越高效。外掛記憶系統吃不到這個紅利。
  4. 講工作習慣:好的 Agent 會自己維護 scratchpad、todo 列表、實驗記錄,像人類程式設計師一樣管理工作區。
⭐ 加分點用前沿方法佐證:MCE 乾脆把上下文函式實例化成目錄裡的檔案集合,skill.md 存知識、動態檔案存 rollout 記錄;Meta-Harness 也靠檔案系統存取執行歷史。檔案系統當記憶已經是前沿自我改進方法的公共地基。
Q10老闆
「我看新聞說現在 Agent 都能自我進化了,競品要是先搞出來怎麼辦?我們要不要立項跟一個?」
🎯 對方在考察什麼
老闆要的是判斷標準,幫他分清哪些能跟、哪些還停留在論文裡。直接說好或說不行都危險,能給出一套適用性檢查的人才值得授權。
🧭 答題框架
  1. 給適用三條件:進化搜尋起作用要同時滿足:搜尋空間龐大且離散、梯度不可用但評估容易、fitness 能量化成數字。三條都佔才值得上。
  2. 給不適用清單:評估一次要數小時、評估標準模糊主觀、主要靠啟發式判斷、算力預算有限、需要人工審核環節。佔了任何一條,先別碰。
  3. 對照自家業務:關鍵問題是我們的 Agent 任務有沒有能自動打分的評測集。沒有的話,第一步是建評測,優先順序比上進化演算法高得多。
  4. 給參照系:DGM 用進化把 SWE-bench Verified 從 20% 提到 50%,但那是編碼任務,測試通過與否天然可自動評估。先確認自己的任務有沒有這種「秤」。
⭐ 加分點主動預告風險:就算條件全滿足,進化迴圈還有獎勵駭客和多樣性坍縮兩類坑,評估器必須放在迴圈外由人維護。立項前把風險說清,比出事後解釋強。
Q11面試官
「ACE 為什麼非要一條一條增量更新那份劇本?直接讓模型把整份 prompt 重寫一遍,多省事?」
🎯 對方在考察什麼
考你懂沒懂 ACE 最核心的設計決策。背流程的人只會念 Generator、Reflector、Curator 三個名字,真懂的人能說出為什麼更新方式必須是增量合併。
🧭 答題框架
  1. 先擺機制:ACE 維護一份結構化的 bullet point 劇本,每條有 identifier 和 description。Generator 照劇本做事,Reflector 從成敗軌跡提煉洞察,Curator 負責把洞察寫回劇本。
  2. 講關鍵設計:Curator 輸出結構化的 (identifier, description) 條目,用確定性邏輯合併進劇本,從不重寫整塊 prompt。
  3. 說清理由:讓模型迭代重寫整塊內容會帶來上下文坍縮和簡潔偏差,有用的細節會被一遍遍壓沒。增量合併加定期精煉去重,經驗越用越精,上下文卻不會越用越厚。
  4. 點出侷限:ACE 的更新規則仍靠手工設計,這正是 MCE 接著往下解的問題。
⭐ 加分點一句話講透:上下文是不斷演進的劇本。任由 prompt 無限增長會溢位,任由模型整塊重寫會坍縮,ACE 選了第三條路:條目化、增量、可去重。
用這些課程頁組織答案 → 上下文工程:從手寫到自動進化
Q12面試官
「MCE 說自己是雙層優化,這兩層到底各在優化什麼?它和 ACE 的本質區別在哪?」
🎯 對方在考察什麼
前沿方法辨析題,考機制拆解能力。skill 是什麼、內外層各幹什麼,這兩問答不清就說明只看過標題和轉發語。
🧭 答題框架
  1. 先定義 skill:一個 MCE skill 定義上下文函式 c = F(x; ρ)。ρ 是靜態元件(prompts、知識庫、程式碼庫),F 是動態運算元(搜尋、選擇、過濾、格式化)。管上下文的方法本身被形式化了。
  2. 拆開雙層:內層給定 skill,在訓練集上找最優上下文;外層在驗證集上比較不同 skill,選出最優機制。先優化內容,再優化方法,輪流來。
  3. 講進化方式:系統維護 skill 資料庫記錄每組 (skill, context, 訓練分, 驗證分),Meta-agent 用 agentic crossover 從歷史裡雜交出新 skill。
  4. 對比 ACE:ACE 的更新規則手工設計、固定不變;MCE 把「怎麼記」也放進優化迴圈,記的內容和記的方法一起進化。
⭐ 加分點點出內外層分用訓練集和驗證集的用意:skill 的好壞在沒參與內層優化的資料上打分,防止管理機制過擬合到特定幾條任務,和機器學習防過擬合的思路一脈相承。
用這些課程頁組織答案 → 上下文工程:從手寫到自動進化
Q13技術同事
「Meta-Harness 迭代那麼多版 harness,歷史記錄越滾越大,全餵給模型不就先把自己的上下文撐爆了?」
🎯 對方在考察什麼
用工程可行性試探你是真讀過方法還是只會轉述概念。想聽的是歷史怎麼存、優化器怎麼讀、真正的成本瓶頸到底在哪一環。
🧭 答題框架
  1. 講儲存結構:每個提出的 harness 在檔案系統裡就是一個字典:原始碼、分數、軌跡、狀態更新。歷史不進 prompt,全部落盤。
  2. 講存取方式:Proposer 本身是編碼 Agent,用 grep、cat 按需讀取執行歷史,要哪段查哪段,避免全塞進上下文。
  3. 講輸出形態:產出的是 Pareto 前沿上的 harness 候選集合,多目標之下保留一組各有所長的方案,可以按場景挑。
  4. 承認真瓶頸:撐不住的地方在評估側:每改一版 harness 都要完整試執行打分,Meta-Harness 是三種上下文優化方法裡最通用也計算最重的。
⭐ 加分點補一句設計洞察:Proposer 用的 grep 和 cat 全是編碼 Agent 的基本功,Meta-Harness 沒為歷史存取發明任何新機制。這印證了「程式碼是定義 Harness 的通用語言」,編碼能力強的模型天然適合當優化器。
Q14面試官
「AFlow 說用下棋的演算法來搜工作流,它具體是怎麼搜的?搜到什麼時候算完?」
🎯 對方在考察什麼
考你對自動工作流搜尋的機制理解。能講出圖表示和搜尋迴圈的人才算讀進去了,終止條件是最容易被問倒的細節。
🧭 答題框架
  1. 先講表示:工作流表示成有向圖,節點是 LLM 呼叫動作,邊是程式碼裡的邏輯操作(條件分支、迴圈、資料傳遞)。設計問題就此變成了樹搜尋問題。
  2. 講搜尋迴圈:初始工作流做根節點;用分數與均勻探索的軟混合選待擴展節點,平衡利用與探索;LLM 生成修改變體(增刪改節點和邊);執行評估,有改進就加回搜尋樹。
  3. 答終止條件:迴圈到 top-k 平均分穩定,或者計算預算用完。
  4. 給定位:對比 ADAS 靠 meta-agent self-refine 自由發揮,AFlow 用 MCTS 做系統化搜尋,收斂更穩定,實驗上也優於手工設計和 ADAS。
⭐ 加分點用課程演示收尾:從「Plan → Execute」52 分起步,幾輪搜尋後發現反思加驗證的組合拿到 78 分,比手工起點高出 50%。搜出來的最優結構恰好長得像資深工程師的工作習慣。
用這些課程頁組織答案 → 工作流設計:從手工到自動搜尋
Q15面試官
「AI Scientist 號稱能自己做研究寫論文,它的管線長什麼樣?評審那關是怎麼過的?」
🎯 對方在考察什麼
考你能否既講清管線又保持清醒。只會驚嘆全自動的人,和只會說都是炒作的人,都不合格。
🧭 答題框架
  1. 報出管線:提出研究想法 → 寫程式碼 → 跑實驗 → 分析結果 → 寫論文 → 同行評審,六步全由 LLM 驅動,端到端跑完一輪完整研究迴圈。
  2. 講評審環節:評審引入 LLM-as-judge 做品質把關,產出的論文格式完整。
  3. 給現實檢驗:能寫論文遠夠不上能做科學。系統測試發現六種反覆出現的失敗模式:訓練資料預設值偏好、執行壓力下的實現漂移、記憶與上下文退化、過度樂觀、領域智慧不足、科學品味薄弱。
  4. 下判斷:這些是結構性瓶頸。專家設計的 Harness 確實能協調研究迴圈的大部分環節,但環節裡的判斷品質還差得遠。
⭐ 加分點挑一條細說最見功力:「過度樂觀」指系統宣稱實驗顯著優於基線、實際結果全是噪聲;「領域智慧不足」指缺那些論文裡不寫、但實驗室裡人人都知道的隱性技藝。這兩條恰好是 LLM-as-judge 也難兜住的。
Q16面試官
「合成資料大家都在做,Autodata 憑什麼說自己合成的資料品質高?它怎麼知道一道題出得好?」
🎯 對方在考察什麼
考你對資料品質訊號的理解。空談資料品質的人很多,能說出一條可操作判據的人很少。
🧭 答題框架
  1. 報角色體系:四個角色協作:Challenger 出題,Weak Solver 和 Strong Solver 分別試解,Verifier / Judge 仲裁。
  2. 給核心判據:難度差就是品質訊號:只保留 strong solver 能做出、weak solver 做不出的題。
  3. 說清為什麼:兩個都會的題沒有訓練價值,兩個都不會的題可能本身就是爛題。落在能力邊界上的題,對提升模型價值最大。
  4. 給 PM 遷移:這套「用兩個能力檔位夾出難度帶」的思路,可以直接搬到評測集建設和訓練資料分級的設計上。
⭐ 加分點給出定位:Autodata 和 AI Scientist 同屬手工設計工作流的代表作,說明在自動搜尋成熟之前,專家手寫的多角色工作流依然是產出生產價值的主力。
用這些課程頁組織答案 → 工作流設計:從手工到自動搜尋
Q17技術同事
「STOP 那個遞迴改善器,說白了就是讓模型改自己的 prompt 唄?這玩意真能越改越好?」
🎯 對方在考察什麼
試探你對遞迴自我改進最早範例的機制理解。對方期待你說清改善的物件到底是什麼,以及遞迴什麼時候有效、什麼時候失效。
🧭 答題框架
  1. 先糾正物件:STOP 不直接改善解 s,它反覆改善的是產生更好解的「改善器」I 本身。種子改善器接受初始解、效用函式、黑盒模型三個輸入,返回改善後的解。
  2. 講遞迴的鑰匙:改善器本身也是文字(一段 prompt 或程式碼),所以同樣的改善邏輯能作用在改善器自身上:I_t = I_{t-1}(û, I_{t-1}; M),讓今天的自己去升級昨天的自己。
  3. 給實驗答案:真能變好,但有門檻。GPT-4 驅動時持續改善,還自動發現了遺傳演算法、分解改進、多臂 Prompt Bandit、模擬退火、Beam Search 這些經典優化策略;GPT-3.5 和 Mixtral 驅動時反而退化。
  4. 給結論:遞迴結構給的只是改善的可能性,收斂沒有保證。弱模型在元級操作裡缺程式設計直覺,只會放大噪聲。
⭐ 加分點說出「自動發現經典策略」的深意:沒人預設遺傳演算法或 Beam Search,改善器自己長出了這些結構。足夠強的模型加遞迴結構,能重新發明人類優化領域幾十年的家底,這就是元級優化的想像空間。
用這些課程頁組織答案 → 讓 Harness 改進自己
Q18面試官
「Agent 跑失敗的那些軌跡,你們一般怎麼處理?直接丟了,還是能榨出點什麼?」
🎯 對方在考察什麼
考你有沒有把失敗當資產的意識和方法論。答「記個錯誤日誌」太淺,對方想聽的是結構化的失敗挖掘怎麼做。
🧭 答題框架
  1. 給出方法名:Self-Harness 的第一階段就叫 Weakness Mining:把失敗軌跡聚類成 verifier-grounded 的失敗模式,從個案上升到模式。
  2. 講記錄規格:每條失敗記錄三件套:終端驗證器級的失敗原因、相關 Agent 行為的因果狀態、軌跡暴露的抽象 Agent 機制。有這三樣,失敗才是可定址的。
  3. 講下游用法:提案階段優先挑可定址的重複錯誤模式下手,改一處修一類,避免頭痛醫頭。
  4. 給 PM 落點:失敗軌跡庫怎麼建、按什麼維度聚類,這是 PM 現在就能推動的基建,方法可以直接照搬。
⭐ 加分點點出「verifier-grounded」這個定語的分量:失敗歸因錨定在可驗證的終端訊號上,聚出來的模式才不會是模型自己腦補的病因。沒有這個錨,失敗庫越大越誤導。
用這些課程頁組織答案 → 讓 Harness 改進自己
Q19面試官
「讓 Agent 自己改自己的配置,怎麼保證它改好了這裡,別處沒有悄悄變差?」
🎯 對方在考察什麼
考改進迴圈的品質門禁設計。這是自我改進能否上生產的關鍵一環,答不出驗證機制的人,只能算聽說過 Self-Harness。
🧭 答題框架
  1. 給驗證機制:Self-Harness 第三階段 Proposal Validation 用 held-in 和 held-out 兩套資料集驗證候選編輯,只接受沒有迴歸的編輯。改進不許以犧牲已有能力為代價。
  2. 講編輯範圍:提案本身就是有界 Harness 編輯。模型拿到的是可編輯面、失敗模式摘要、透過行為記錄、已嘗試編輯的歷史,出手之前就被框住了。
  3. 給實驗證據:Terminal-Bench-2 上對 MiniMax M2.5、Qwen3.5-35B-A3B、GLM-5 做實驗,Self-Harness 給每個模型學出了模型特定的 harness 指令。
  4. 說產品含義:同一框架對不同基座產生不同優化路徑,說明 harness 改進是上下文敏感的。換模型時 harness 配置照搬不得,要重新跑一輪優化。
⭐ 加分點點出「已嘗試編輯的歷史」這個輸入的作用:它防止提案器在同一個想法上反覆打轉,相當於給自我改進加了去重記憶。這類小設計往往決定迴圈收不收斂。
用這些課程頁組織答案 → 讓 Harness 改進自己
Q20老闆
「照這麼發展下去,Agent 都會自己改自己了,我們養這麼多工程師,還有你這個產品經理,以後做什麼?」
🎯 對方在考察什麼
老闆半開玩笑半認真,考的是你能否說清人在迴圈裡的新位置,順便看你慌不慌。答案要具體到職位職責怎麼變,光喊「人很重要」沒用。
🧭 答題框架
  1. 先給方向:答案在七道關的最後一關:人類在棧中向上移動,繼續留在迴圈之中。AI 接管執行層,人的價值上移到設定目標、判斷方向、守住底線。
  2. 給具體職責:有幾樣必須由人維護:評估器和權限控制要放在改進迴圈之外;可編輯面的邊界要人來劃;哪個問題值得解要人來定義。
  3. 給證據:自動研究的六種失敗模式裡,「科學品味薄弱」和「領域智慧不足」恰好是人的長板:判斷問題值不值得問、掌握寫不進文件的隱性知識。
  4. 收個態度:引用課程結尾那句話:人是系統不可或缺的方向盤,從來都不是要被替代的瓶頸。監督要發生在正確的時間和正確的抽象層級。
⭐ 加分點翻譯成人才戰略:層級上移意味著評估體系和目標定義能力變成團隊最稀缺的資產,招人和培養的重心該往「會出題、會驗收」遷移。老闆要的就是這種落到組織的判斷。
用這些課程頁組織答案 → 未來挑戰:自我改進的七道關
Q21面試官
「Darwin Gödel Machine 這名字滿唬人的,它到底怎麼進化 Agent 的?有沒有拿得出手的數字?」
🎯 對方在考察什麼
考你對 harness 自我改寫最激進案例的掌握。名字誰都會念,對方想聽的是進化迴圈裡每一步的動作,和能背出來的實驗數字。
🧭 答題框架
  1. 先講物件:DGM 顯式針對可編輯的 harness 程式碼倉庫進化,Agent 被允許修改自己的 harness 程式碼,這一點比 AlphaEvolve 改別人的程式更激進。
  2. 講迴圈:從池中一個 coding agent 開始;按效能機率選父代;父 agent 檢查自己的 benchmark 評估日誌、提出改進方案;變異出新 agent;評估後效能夠高才進池;迴圈到停止條件。
  3. 報出數字:基於 Claude 3.5 Sonnet,SWE-bench Verified 從 20% 提到 50%,Polyglot 從 14.2% 提到 30.7%,全程無人類介入。
  4. 補工具面:工具集樸素得驚人:bash 加 editor(view / create / edit)。說明威力在迴圈設計上,用不著花哨的工具。
⭐ 加分點單獨點出父代選擇的反比設計:選中機率與子代數量成反比,給已經兒孫滿堂的個體降權,鼓勵探索冷門分支。這等於在進化迴圈裡內建了一道抗多樣性坍縮的機制。
用這些課程頁組織答案 → 進化搜尋:讓最強 Harness 存活
Q22面試官
「Prompt 自動優化的工具幾年前就有了,Promptbreeder、GEPA 這些老工作,現在還值得看嗎?」
🎯 對方在考察什麼
考你的技術史觀。能把老工作放進演進線裡的人,比只追新名詞的人可信得多。
🧭 答題框架
  1. 講 Promptbreeder:用豐富的變異操作進化 task-specific prompts。關鍵創新是元進化:變異 prompt 本身也透過進化改進,連改法都在進化。
  2. 講 GEPA:把 reflection-based prompting 和進化搜尋結合:Agent 先反思當前 prompt 的不足,再用進化運算元產生候選改進,最後擇優。
  3. 給歷史位置:兩項工作是 prompt 進化的先驅,為後來更大規模的 Harness 進化(AlphaEvolve、DGM)奠定了基礎。它們證明了文字可進化,後來者把可進化物件擴到了程式碼和整個 harness。
  4. 回答值不值:值得。看懂了元進化這個核心,再讀新論文全是似曾相識。
⭐ 加分點畫出這條線索:Promptbreeder 進化變異器、STOP 改善改善器、MCE 優化管理機制,三個時期三種叫法,核心都是把改進方法本身放進改進迴圈。能看出同構的人,學新東西永遠最快。
Q23技術同事
「既然 harness 都能自動優化了,乾脆把模型權重也放進同一個迴圈一起訓,一步到位,你覺得可靠嗎?」
🎯 對方在考察什麼
試探你會順著激進方案一起嗨,還是能指出風險。這題答「可靠」和答「完全不行」都丟分,要給機制加風險的平衡評估
🧭 答題框架
  1. 先講機制:這就是 SIA 的做法,三個角色進同一優化迴圈:Meta-Agent 提出新 harness 設計,Task-Specific Agent 在新 harness 下執行任務,Feedback-Agent 根據結果決定下一步更新 harness 還是更新模型權重。
  2. 給評價:方向有趣,但證據暫時性。兩大開放挑戰沒解:訓練穩定性,以及 Goodhart 效應,優化代理指標導致真實目標退化。
  3. 打比方說風險:一邊改賽車引擎一邊改賽道,兩邊同時變化,出了問題都不知道該歸因給誰。
  4. 給建議:短期內 harness 優化和權重訓練分開跑更穩,等單側迴圈都收斂可控了,再談聯合。
⭐ 加分點指出 SIA 和此前所有方法的本質差別:前面的路線都刻意不動權重,把改進限制在 Harness 層,正因如此才可驗證、可回滾。把權重放進迴圈等於拆掉了這層安全墊,這是它最需要被審視的地方。
Q24面試官
「AlphaEvolve 發現新演算法那件事滿出圈的,從產品視角看,它的系統設計有哪些值得抄的?」
🎯 對方在考察什麼
考你能否從明星案例裡拆出可複用的設計要素。光會講「AI 發現了新演算法」這個故事的人,過不了這關。
🧭 答題框架
  1. 講主迴圈:維護一個候選程式池,用凍結的 LLM 生成程式碼 diffs 改程式,反覆評估子程式、保留表現最好的。模型全程不訓練,提升全部來自搜尋迴圈。
  2. 拆 prompt 設計:進化 prompt 由父程式、評估結果、指令、元資訊共同構成;用 EVOLVE-BLOCK 標記顯式圈出可改進區域,把搜尋約束在劃定範圍內。
  3. 講 meta-prompt:指令和上下文字身也參與共同進化,不會固定不變。
  4. 引消融實驗:進化流程、上下文 prompt、meta-prompt、全檔案進化、更強 LLM,消融證明各自有獨立貢獻。值得抄的正是這種每個元件都驗證過必要性的做法。
⭐ 加分點成果背書加一句邊界:谷歌用它真的找到了比人類已知更快的矩陣乘法演算法。但 EVOLVE-BLOCK 標記意味著人類先劃定哪裡可以動,進化再強,也是在人劃的圈裡跑。
用這些課程頁組織答案 → 進化搜尋:讓最強 Harness 存活
Q25老闆
「你上次說的那些自動優化方法我聽著都好,那到底得燒多少算力?給我算筆帳。」
🎯 對方在考察什麼
老闆要的是成本結構和投入節奏,念論文沒用。想聽的是錢花在哪一環、哪種方法貴、先上便宜的還是貴的。
🧭 答題框架
  1. 講成本大頭:搜尋類方法的開銷集中在評估:每一輪都是 LLM 推理加程式碼執行加基準測試,代數越多越燒。計算效率(每代要多少次評估)和進化效果(每代提升多少)怎麼平衡,學界都還是開放問題。
  2. 給貴賤排序:ACE 式結構化上下文維護最輕,跑在正常任務流裡;MCE 雙層要多養一層 skill 進化迴圈;Meta-Harness 每改一版都要完整試執行打分,三者裡計算最重。
  3. 給投入節奏:先上 ACE 式維護把長任務穩住,再建能自動跑的評測集,評測站穩了,才評估要上搜尋類方法的哪一檔。
  4. 給止損線:評估一次要數小時、指標主觀、預算有限,這三條佔了就停在輕量檔。這也是課程裡明確列出的進化搜尋不適用場景。
⭐ 加分點給一個省錢的巧思:Meta-Harness 在 TerminalBench-2 的實驗就是從已有強 harness 初始化的,從好基線繼續搜比從零搜省得多。我們手工調 harness 的沉澱,就是將來自動優化的啟動資產。
Q26面試官
「大家都在存成功案例當經驗庫,那些失敗的死胡同要不要也存?存了不怕把 Agent 帶偏嗎?」
🎯 對方在考察什麼
考你對記憶內容設計的深度。多數人只想到存成功經驗,負面結果的價值和存法是這一章最反直覺的考點之一。
🧭 答題框架
  1. 先給立場:要存。知道什麼行不通和知道什麼行同樣重要,研究 Harness 應該讓失敗的嘗試和死胡同易於儲存和檢索。
  2. 講為什麼難:科學文獻嚴重偏向成功案例,LLM 可能不擅長決定何時放棄假設、何時坦誠報告負面結果。這個偏差會被自動研究系統原樣繼承。
  3. 講怎麼存不帶偏:負面結果的用途是剪枝,標註清楚試過什麼、怎麼失敗的、原因是什麼,Agent 檢索到就不再重走死胡同。Self-Harness 給提案器喂「已嘗試編輯的歷史」就是同一邏輯。
  4. 連回失敗模式:自動研究的「過度樂觀」毛病(宣稱顯著優於基線、實際全是噪聲),恰恰說明系統缺少坦誠記錄負面結果的習慣。
⭐ 加分點一句反直覺認知收尾:負面結果庫既是防重複探索的地圖,也是評審環節的對照組。經驗庫只存成功案例的團隊,等於逼 Agent 把每個死胡同都重新撞一遍。
Q27面試官
「假設明天就讓你負責一個自我改進 Agent 的專案,第一件事寫風險清單,你會列哪幾條?」
🎯 對方在考察什麼
考你對本章收尾框架的系統掌握。零散說出兩三個風險不難,對方想聽的是完整的分類地圖,和每一類對應的解法方向。
🧭 答題框架
  1. 先給分類框架:七道關分四類:評估相關、資料與記憶、安全與穩定性、人類角色。按類報,不容易漏。
  2. 過評估與記憶:弱且模糊的評估器(很多目標沒有快速精確的驗證器,回饋訊號是糊的);上下文與記憶生命週期(記憶需求隨自主性爆炸增長,上下文工程應該成為智慧本身的核心部分);負面結果(失敗嘗試要易於儲存和檢索)。
  3. 過安全三關:多樣性坍縮(候選擠成微小變體,創新停止)、獎勵駭客(過擬合測試、鑽評判模型空子、利用 benchmark 漏洞)、長期成功(只顧測試通過,忽視可維護性、所有權邊界、遷移成本、向後相容)。
  4. 收人類角色:第七關是人的位置:在正確的時間、正確的抽象層級提供監督。這七條是根本性的系統設計挑戰,別當成普通工程問題排進迭代就完事。
⭐ 加分點說出四類的內在順序:評估器是回饋訊號的源頭,訊號錯了後面全錯,所以「弱評估器」排在七道關第一位。風險清單也該按這個優先順序排,先解決怎麼打分,再談怎麼改進。
用這些課程頁組織答案 → 未來挑戰:自我改進的七道關
Q28技術同事
「你講的這些論文一個比一個玄。說實話,哪些我們下季度就能用,哪些五年內都別想?」
🎯 對方在考察什麼
技術同事要的是可靠的成熟度分層,全吹或全貶都會失去信任。這題答好了,後面的合作就順了。
🧭 答題框架
  1. 「現在就用」層:三大設計模式(自動化迴圈、檔案系統記憶、子 Agent 並行)已經是 Claude Code、Codex、Cursor 的標配,覆蓋最強 Agent 系統 90% 的架構決策,照著搭就行。
  2. 「下季度可試」層:ACE 式結構化上下文維護。Generator、Reflector、Curator 是清晰的工程管線,前提是先有評測集驗證收斂。
  3. 「有條件上」層:AFlow、DGM 這類搜尋方法,要滿足評估自動化、fitness 可量化、算力充足。編碼類任務最先受益,DGM 的 SWE-bench 數字就是在這種條件下跑出來的。
  4. 「持續觀察」層:SIA 聯合優化的訓練穩定性未解,Meta-Harness 計算最重,都還在證據暫時性的階段,跟進論文就好。
⭐ 加分點給一個通用判據:一個方法離真正能用的距離,基本取決於它對「快速可靠評估器」的依賴有多深,以及你手裡的評估器有多成熟。評估基建才是隱藏的關鍵路徑。
Q29面試官
「你提到的多樣性坍縮,到底長什麼樣?系統明明還在漲分,我怎麼知道它已經悄悄坍縮了?」
🎯 對方在考察什麼
考你對進化系統慢性病的理解。這個失效模式短期沒有症狀,能描述它的表現、解藥和監控方式,才算真的懂。
🧭 答題框架
  1. 講病理:進化演算法和 RL 迴圈天然傾向於利用已知的高獎勵模式,短期分數很好看,問題被掩蓋。
  2. 講症狀:種群裡所有候選解坍縮成同一方案的微小變體,新一代和上一代長得越來越像,創新就停了。課程的比方很貼切:全班都抄第一名的作業,分數好看,但再沒人想出新解法。
  3. 給解藥:需要專門機制防止解空間坍縮:多樣性獎勵、檔案保持。
  4. 給監控建議:光盯分數曲線看不出坍縮,還要度量種群內方案的差異程度。差異趨零就是警報,它比分數下跌來得早得多。
⭐ 加分點和獎勵駭客做區分最顯功力:獎勵駭客是分數虛高、真實能力沒漲;多樣性坍縮是分數真實但創新停滯。兩種病症狀相反,根源相同:優化壓力只認一個數字。
Q30老闆
「AI 寫的程式碼測試全過、上線也沒出事,那程式碼審查是不是可以省了?人審太慢了。」
🎯 對方在考察什麼
老闆在找降本點,考的是你能否講清「測試通過」和「倉庫健康」的差距,還要給出替代方案,光說不行沒有用。
🧭 答題框架
  1. 先給病根:這就是七道關裡的「長期成功」:當前優化目標太短期,編碼 Agent 能完成眼前任務,但不夠清楚怎麼保護倉庫的長期健康。
  2. 列測不出的東西:標準沙箱 RLVR 訓練很少捕獲可維護性、所有權邊界、遷移成本、向後相容性。這些恰恰是人審在把的關。
  3. 給風險畫面:只追求測試通過的 Agent,可能在技術債裡埋定時炸彈。炸彈爆的那天,不會寫在任何一份測試報告裡。
  4. 給折中方案:審查可以換形態:常規改動輕量審,架構層改動重點審。人往上移,盯所有權邊界和長期結構,逐行檢查交給工具。
⭐ 加分點幫老闆校準預期:連自我改進研究的前沿都把長期健康難以度量列為根本挑戰之一,說明這不只是我們團隊的流程問題。短期內人審省不得,能省的是層級,把人的時間花在機器測不出的那部分。
用這些課程頁組織答案 → 未來挑戰:自我改進的七道關
最後一個建議
這一章的知識最新,也最容易被拿來唬人。這 30 題的正確用法是開口講一遍,對著同事、朋友或者錄音講。講不順的地方,就是你以為懂了但還沒懂的地方,點關聯課程頁回去補上。