他們會這樣考你

Harness 與自我改進 · 30 道靈魂拷問

這一章講的是最前沿的東西,考它的人也最容易分出真假。這 30 個問題來自三個真實場景,先自己開口回答,再看框架。

怎麼用這一頁
每道題都標註了提問者。他們問同一塊知識,想聽的東西卻不一樣。
🎙 面試官想驗證你是真懂,還是在背名詞
👔 老闆要的是解釋和承諾
🛠 技術同事在試探你值不值得信任
每題給出三層:對方在考察什麼 → 答題框架 → 加分點。答不上來的環節,點末尾的課程頁回去補。
Q1面試官
「最近大家都喺度傾 Harness,你講吓佢到底係咩?點解有人話佢同模型本身一樣重要?」
🎯 對方在考察什麼
這是本章的開場檢驗題。考的是你能把 Harness 講成一個清晰的系統概念,還是只會含糊地説「就是套殼」「就是 Agent 框架」。真懂的人能説清它管什麼、為什麼它決定產品成敗。
🧭 答題框架
  1. 先給定義:Harness 是圍繞基座模型的運行時系統,決定模型如何思考與規劃、調用工具與行動、感知與管理上下文、存儲製品、評估結果。模型負責智能,Harness 負責讓智能落地幹活。
  2. 給證據:Claude Code、Codex、Cursor 這些成功產品已經證明,Harness 層與原始模型智能同等重要。一個平庸的模型加上優秀的 Harness,往往勝過裸露的更強模型。
  3. 説清 PM 視角的含義:換模型很容易,Harness 才是產品真正的護城河。同一個模型,Harness 設計得好壞,用戶體驗差幾個量級。
  4. 拔高一層:Harness 正在從工程配角變成優化目標本身。前沿研究讓模型改進圍繞自己的 Harness,這是遞歸自我改進的現實路徑。
⭐ 加分點主動做 Prompt Engineering 的類比:當年手動 Prompt 技巧隨模型變強逐漸淡化,但指定目標、約束、上下文和評估的需求一直都在。Harness 很多改進最終會被內化進模型,但與外部上下文和工具的接口會永遠存在。
Q2面試官
「如果叫你設計一個生產級 Agent 嘅架構,你會遵循邊啲設計模式?點解而家最強嘅編碼 Agent 長得都差唔多?」
🎯 對方在考察什麼
考你有沒有架構語言。露餡的回答是羅列一堆工具名和框架名。對方想聽的是模式層面的抽象:為什麼這些系統會收斂到相似的結構,每個模式各解決什麼問題。
🧭 答題框架
  1. 報出三大模式:工作流自動化、文件系統做持久記憶、子 Agent 與後台任務。它們覆蓋了當前最強 Agent 系統 90% 的架構決策,是結構性需求,沒有可選餘地。
  2. 模式一講循環:Agent 是目標導向的循環,Plan → Execute → Observe → Improve → 再執行。失敗是自我糾正的觸發信號:測試不通過、命令報錯,Agent 回頭分析軌跡再調整。
  3. 模式二講記憶:長任務的製品會迅速超出上下文窗口。正確做法是把持久狀態存進文件系統,讓 Agent 按需讀寫。一句話原則:上下文是工作記憶,文件系統是長期記憶。
  4. 模式三講並行:父 Agent 當進程管理器,啓動子 Agent、查進度、取消失敗分支、合併結果。子 Agent 輸出必須持久化成文件,中斷也能恢復。
⭐ 加分點能説出子 Agent 並行的關鍵取捨:每個子 Agent 在獨立沙箱工作、輸出到明確的文件路徑,父 Agent 靠輪詢文件狀態來協調,不做記憶體共享。這一條能極大簡化併發控制,説得出來就是看過真實系統的人。
Q3老闆
「我哋嗰個 Agent,任務一跑長就開始做傻事,前面講過嘅嘢後面全唔記得。呢個毛病醫得唔醫得?要幾耐?」
🎯 對方在考察什麼
老闆要的是診斷加方案加節奏。露餡的回答是「換個更大窗口的模型」,這説明你沒看懂病根。真正的問題出在上下文管理策略上,能把這一點講清楚並給出分階段方案的人,才值得被信任。
🧭 答題框架
  1. 先診斷病根:很大機會是樸素追加式的上下文管理。把所有工具響應和歷史全塞進上下文,任務一長窗口就打滿,早期信息被擠出去,輸出質素驟降。這是策略問題,換大窗口模型只能延後發病。
  2. 給第一階段方案:上文件系統持久記憶。每輪完成後把進度、錯誤日誌、中間結果寫文件,釋放上下文,下一輪按需讀取。上下文佔用從持續膨脹變成恆定,可以穩定跑幾十輪。
  3. 給第二階段方案:引入 ACE 式的結構化上下文維護。Generator 幹活、Reflector 複盤提煉經驗、Curator 把經驗整理成條目化劇本,增量合併、定期去重。經驗越用越精,上下文卻越用越薄。
  4. 給節奏承諾:第一階段是工程改造,周級見效。第二階段需要搭評測集驗證收斂,按雙週彙報長任務成功率的變化,用指標説話。
⭐ 加分點補一句行業判斷:長上下文能力和上下文工程是兩條腿,模型的窗口再大,也需要管理層來構建結構化、簡潔的上下文。這個問題所有做 Agent 的團隊都會遇到,我們解決得早就是優勢。
Q4面試官
「上下文工程唔就係將 prompt 寫好啲咩?我睇論文裏話而家可以自動進化,ACE、MCE 呢啲你了解未?」
🎯 對方在考察什麼
考你對前沿的理解深度和層次感。背名詞的人會把 ACE、MCE 混成一鍋粥。真懂的人能説清一條演進綫:優化對象在一層層升級,從內容到機制再到系統程式碼,每一層各自解決什麼。
🧭 答題框架
  1. 先糾正前提:手寫 prompt 只是起點。優化對象有一條演進綫:指令 Prompt → 結構化上下文 → 工作流 → Harness 程式碼 → 優化器程式碼。模型越強,能優化的目標就越複雜。
  2. 講 ACE:優化上下文內容。維護一份結構化的 bullet point 劇本,Generator 執行任務、Reflector 從成敗軌跡提煉洞察、Curator 用確定性邏輯增量合併條目。從不整塊重寫,避免上下文坍縮。侷限是更新規則仍靠手工設計。
  3. 講 MCE:把「怎麼管理上下文」和「上下文裏有什麼」分開,雙層優化。內層給定 skill 找最優上下文,外層比較不同 skill 選最優機制。記的內容和記的方法一起進化。
  4. 講 Meta-Harness:再深一層,優化對象是決定信息如何存儲、檢索、呈現的程式碼本身。Proposer 是一個編碼 Agent,輸出 Pareto 前沿上的 Harness 候選集。最通用,但每改一版都要完整試運行打分,計算最重。
⭐ 加分點能一句話總結三者差異:ACE 優化筆記內容,MCE 優化記筆記的方法,Meta-Harness 優化整個工作台的源程式碼。再補一句核心教訓:一旦 Harness 設計變成可執行的搜索空間,強編碼 Agent 就能用上人類工程師的同一設計空間。
Q5技術同事
「你想叫 Agent 自己改自己嘅 Harness?咁佢順手將評估器都改咗,畀自己打滿分點算?」
🎯 對方在考察什麼
技術同事用一個尖鋭的反例試探你懂不懂自我改進系統的安全設計。答「加個 prompt 讓它別改」會被當場看輕。對方想聽的是邊界設計:哪些東西必須放在改進循環之外,怎麼驗證每一次改動。
🧭 答題框架
  1. 先承認問題真實:這就是獎勵黑客,自我改進循環裏最危險的反模式。優化單元測試會過擬合測試用例,優化評判模型會學會鑽空子,優化 benchmark 分數會利用 benchmark 漏洞。
  2. 給邊界原則:評估器和權限控制必須放在進化循環之外,由人類或不可篡改的獨立機制維護。出卷人和改卷人必須獨立於被考的學生本人。可編輯面要有界,改到 OS 系統配置這種層級就等於打破了抽象邊界。
  3. 給驗證機制:參考 Self-Harness 的三階段循環。Weakness Mining 從失敗軌跡聚類出失敗模式,Harness Proposal 提出有界編輯,Proposal Validation 用 held-in 和 held-out 數據集驗證,只接受沒有迴歸的編輯。
  4. 給能力前提:STOP 的實驗證明遞歸結構本身不保證改善。GPT-4 能持續進步,弱模型反而放大噪聲、不進反退。上這套系統之前,先評估基座模型撐得住元級優化。
⭐ 加分點再補一個對方可能沒想到的風險:多樣性坍縮。進化循環天然愛利用已知高獎勵模式,所有候選都變成同一方案的微小變體時創新就停了,需要多樣性獎勵、檔案保持這類機制兜底。能把兩個風險都説全,這場對話你就贏了。
Q6面試官
「遞歸自我改進而家到底行到邊一步?AI 都可以自己改自己,係咪就快失控?」
🎯 對方在考察什麼
考你能不能既不神化也不恐慌地評估前沿進展。露餡的回答有兩種:跟着渲染「AI 要覺醒了」,或者一口咬定「都是炒作」。對方想聽的是有事實、有邊界、有判斷的行業認知。
🧭 答題框架
  1. 先給概念座標:RSI 的設想從 Good(1965)到 Yudkowsky(2008)就有了,指系統用自己當前的智能去改善產生智能的機制本身。它當了幾十年理論概念,近兩年才有了現實路徑。
  2. 説清現實路徑:模型沒有直接改寫自己的權重。它改進的是圍繞自身的 Harness:上下文管理、工作流、工具編排、評估。更好的 Harness 催生更強模型,更強模型又反過來簡化 Harness,形成正反饋飛輪。
  3. 給進展的真實水位:STOP 證明了改善器能遞歸改善自己,還自動發現了遺傳算法、Beam Search 這類經典策略;Self-Harness 讓 Agent 通過挖弱點、提編輯、驗證迴歸來改進自己的配置。但這些都發生在有界、可驗證的循環裏。
  4. 正面回答失控問題:離失控還隔着七道關:弱評估器讓反饋信號模糊、記憶生命週期管不好、獎勵黑客、多樣性坍縮、長期健康難以度量。這些是根本性的系統設計挑戰,共同解法都指向把人類留在循環裏,在正確的抽象層級提供監督。
⭐ 加分點引用自動研究的現實檢驗收尾:AI Scientist 能寫出格式完整的論文,但能寫論文遠夠不上能做科學,虛假引用、實現漂移、過度樂觀這些失敗模式反覆出現。用這個案例説明你看過一手材料,判斷有據。
Q7面試官
「你哋做 Agent 優化,具體喺度優化緊咩?講白咗就係改改 prompt 啩?」
🎯 對方在考察什麼
考你對優化對象層次的認知。只會説調 prompt 的人停在最底層。真懂的人知道優化對象有一條五級演進綫,還能説清為什麼模型越強,可優化的層級就越往上走。
🧭 答題框架
  1. 報出五級階梯:指令 Prompt → 結構化上下文 → 工作流 → Harness 程式碼 → 優化器程式碼。調 prompt 只是 Level 1,這條綫的盡頭是優化「寫優化器的程式碼」。
  2. 説清上移邏輯:模型越智能,能優化的目標就越複雜、方法越通用。ACE 在優化上下文內容,AFlow 在搜索工作流,Meta-Harness 在改 Harness 源碼,STOP 在優化改進器本身,每一級都有代表工作。
  3. 給 PM 判斷:先看清團隊現在卡在哪一級。大多數團隊還在 Level 1 和 Level 2 之間,往上走每一級,對評估體系的要求都會陡增。
⭐ 加分點點出這條階梯的共同教訓:一旦 Harness 設計變成可執行的搜索空間,強編碼 Agent 就能用上人類工程師的同一設計空間。層級越高,人的角色越從執行者變成出題人。
Q8面試官
「你話 Agent 可以並行開子 Agent,咁父 Agent 具體要管邊啲事?子 Agent 半路掛咗點算?」
🎯 對方在考察什麼
考你對子 Agent 模式的工程細節。露餡的回答是「就是多開幾個一起跑」。對方想聽的是進程管理視角:父 Agent 管什麼、狀態怎麼查、壞了怎麼兜底。
🧭 答題框架
  1. 先定位角色:父 Agent 是進程管理器,幹四件事:啓動子任務、檢查日誌和進度、取消失敗的分支、合併成功的結果。這是操作系統層面的思維。
  2. 講顯式可檢查:並行不能發射後不管。父 Agent 要能隨時查看每個子 Agent 的狀態、輸出和錯誤。
  3. 講輸出持久化:子 Agent 的結果要存成文件、日誌或狀態記錄,別只回傳到父 Agent 的上下文裏。這樣即使中斷也能恢復。
  4. 講容錯兜底:後台任務會超時、崩潰、產出低質素結果,Harness 要預先設計重試策略和優雅降級機制。
⭐ 加分點給出量級感:並行的收益是把串行等待變成多核加速,課程演示裏 5 個並行任務 3 輪跑完(串行要 5 輪),主 Agent 只負責分發與合併,上下文佔用不到三成。
用這些課程頁組織答案 → Harness 三大設計模式
Q9技術同事
「記憶呢塊你哋打算攞檔案系統硬堆?向量庫、專門嘅記憶模組都唔上,係想慳事定真係有道理?」
🎯 對方在考察什麼
試探你是跟風選型還是理解取捨。説不出文件系統方案的設計理由和分工邊界,就會被當成偷懶。對方想聽的是這個「土辦法」背後的結構性理由。
🧭 答題框架
  1. 先給分工原則:上下文是工作記憶,文件系統是長期記憶。當前任務指令、即時工具結果、最近 2-3 輪對話放上下文;歷史實驗結果、錯誤日誌、已完成子任務的摘要、長期策略放文件。
  2. 講製品現實:長任務的製品(實驗日誌、程式碼 diff、論文摘要、錯誤追蹤、完整執行軌跡)會迅速超出上下文窗口,全塞進 prompt 是結構性的死路。
  3. 給設計理由:文件讀寫是 LLM 的基礎技能,不需要複雜的外部工具鏈,還受益於基座能力提升:模型越聰明,文件管理越高效。外掛記憶系統吃不到這個紅利。
  4. 講工作習慣:好的 Agent 會自己維護 scratchpad、todo 列表、實驗記錄,像人類程序員一樣管理工作區。
⭐ 加分點用前沿方法佐證:MCE 乾脆把上下文函式實例化成目錄裏的文件集合,skill.md 存知識、動態文件存 rollout 記錄;Meta-Harness 也靠文件系統訪問執行歷史。文件系統當記憶已經是前沿自我改進方法的公共地基。
Q10老闆
「我睇新聞話而家 Agent 都可以自我進化,競品要係行先搞出嚟點算?我哋使唔使立項跟一個?」
🎯 對方在考察什麼
老闆要的是判斷標準,幫他分清哪些能跟、哪些還停留在論文裏。直接説好或説不行都危險,能給出一套適用性檢查的人才值得授權。
🧭 答題框架
  1. 給適用三條件:進化搜索起作用要同時滿足:搜索空間龐大且離散、梯度不可用但評估容易、fitness 能量化成數字。三條都佔才值得上。
  2. 給不適用清單:評估一次要數小時、評估標準模糊主觀、主要靠啓發式判斷、算力預算有限、需要人工審核環節。佔了任何一條,先別碰。
  3. 對照自家業務:關鍵問題是我們的 Agent 任務有沒有能自動打分的評測集。沒有的話,第一步是建評測,優先級比上進化算法高得多。
  4. 給參照系:DGM 用進化把 SWE-bench Verified 從 20% 提到 50%,但那是編碼任務,測試通過與否天然可自動評估。先確認自己的任務有沒有這種「秤」。
⭐ 加分點主動預告風險:就算條件全滿足,進化循環還有獎勵黑客和多樣性坍縮兩類坑,評估器必須放在循環外由人維護。立項前把風險説清,比出事後解釋強。
Q11面試官
「ACE 點解非要一條一條增量更新嗰份劇本?直接叫模型將整份 prompt 重寫一遍,多慳事?」
🎯 對方在考察什麼
考你懂沒懂 ACE 最核心的設計決策。背流程的人只會念 Generator、Reflector、Curator 三個名字,真懂的人能説出為什麼更新方式必須是增量合併。
🧭 答題框架
  1. 先擺機制:ACE 維護一份結構化的 bullet point 劇本,每條有 identifier 和 description。Generator 照劇本幹活,Reflector 從成敗軌跡提煉洞察,Curator 負責把洞察寫回劇本。
  2. 講關鍵設計:Curator 輸出結構化的 (identifier, description) 條目,用確定性邏輯合併進劇本,從不重寫整塊 prompt。
  3. 説清理由:讓模型迭代重寫整塊內容會帶來上下文坍縮和簡潔偏差,有用的細節會被一遍遍壓沒。增量合併加定期精煉去重,經驗越用越精,上下文卻不會越用越厚。
  4. 點出侷限:ACE 的更新規則仍靠手工設計,這正是 MCE 接着往下解的問題。
⭐ 加分點一句話講透:上下文是不斷演進的劇本。任由 prompt 無限增長會溢出,任由模型整塊重寫會坍縮,ACE 選了第三條路:條目化、增量、可去重。
用這些課程頁組織答案 → 上下文工程:從手寫到自動進化
Q12面試官
「MCE 話自己係雙層優化,呢兩層到底各自喺度優化緊咩?佢同 ACE 嘅本質分別喺邊?」
🎯 對方在考察什麼
前沿方法辨析題,考機制拆解能力。skill 是什麼、內外層各幹什麼,這兩問答不清就説明只看過標題和轉發語。
🧭 答題框架
  1. 先定義 skill:一個 MCE skill 定義上下文函式 c = F(x; ρ)。ρ 是靜態組件(prompts、知識庫、程式碼庫),F 是動態算子(搜索、選擇、過濾、格式化)。管上下文的方法本身被形式化了。
  2. 拆開雙層:內層給定 skill,在訓練集上找最優上下文;外層在驗證集上比較不同 skill,選出最優機制。先優化內容,再優化方法,輪流來。
  3. 講進化方式:系統維護 skill 數據庫記錄每組 (skill, context, 訓練分, 驗證分),Meta-agent 用 agentic crossover 從歷史裏雜交出新 skill。
  4. 對比 ACE:ACE 的更新規則手工設計、固定不變;MCE 把「怎麼記」也放進優化循環,記的內容和記的方法一起進化。
⭐ 加分點點出內外層分用訓練集和驗證集的用意:skill 的好壞在沒參與內層優化的數據上打分,防止管理機制過擬合到特定幾條任務,和機器學習防過擬合的思路一脈相承。
用這些課程頁組織答案 → 上下文工程:從手寫到自動進化
Q13技術同事
「Meta-Harness 迭代咁多版 harness,歷史記錄越滾越大,全餵畀模型唔就先將自己嘅上下文撐爆?」
🎯 對方在考察什麼
用工程可行性試探你是真讀過方法還是只會轉述概念。想聽的是歷史怎麼存、優化器怎麼讀、真正的成本瓶頸到底在哪一環。
🧭 答題框架
  1. 講存儲結構:每個提出的 harness 在文件系統裏就是一個字典:源碼、分數、軌跡、狀態更新。歷史不進 prompt,全部落盤。
  2. 講訪問方式:Proposer 本身是編碼 Agent,用 grep、cat 按需讀取執行歷史,要哪段查哪段,避免全塞進上下文。
  3. 講輸出形態:產出的是 Pareto 前沿上的 harness 候選集合,多目標之下保留一組各有所長的方案,可以按場景挑。
  4. 承認真瓶頸:撐不住的地方在評估側:每改一版 harness 都要完整試運行打分,Meta-Harness 是三種上下文優化方法裏最通用也計算最重的。
⭐ 加分點補一句設計洞察:Proposer 用的 grep 和 cat 全是編碼 Agent 的基本功,Meta-Harness 沒為歷史訪問發明任何新機制。這印證了「程式碼是定義 Harness 的通用語言」,編碼能力強的模型天然適合當優化器。
Q14面試官
「AFlow 話用下棋嘅算法嚟搜工作流,佢具體係點樣搜嘅?搜到幾時算完?」
🎯 對方在考察什麼
考你對自動工作流搜索的機制理解。能講出圖表示和搜索循環的人才算讀進去了,終止條件是最容易被問倒的細節。
🧭 答題框架
  1. 先講表示:工作流表示成有向圖,節點是 LLM 調用動作,邊是程式碼裏的邏輯操作(條件分支、循環、數據傳遞)。設計問題就此變成了樹搜索問題。
  2. 講搜索循環:初始工作流做根節點;用分數與均勻探索的軟混合選待擴展節點,平衡利用與探索;LLM 生成修改變體(增刪改節點和邊);執行評估,有改進就加回搜索樹。
  3. 答終止條件:循環到 top-k 平均分穩定,或者計算預算用完。
  4. 給定位:對比 ADAS 靠 meta-agent self-refine 自由發揮,AFlow 用 MCTS 做系統化搜索,收斂更穩定,實驗上也優於手工設計和 ADAS。
⭐ 加分點用課程演示收尾:從「Plan → Execute」52 分起步,幾輪搜索後發現反思加驗證的組合拿到 78 分,比手工起點高出 50%。搜出來的最優結構恰好長得像資深工程師的工作習慣。
用這些課程頁組織答案 → 工作流設計:從手工到自動搜索
Q15面試官
「AI Scientist 號稱可以自己做研究寫論文,佢嘅管綫長咩樣?評審嗰一關係點樣過嘅?」
🎯 對方在考察什麼
考你能否既講清管綫又保持清醒。只會驚歎全自動的人,和只會説都是炒作的人,都不合格。
🧭 答題框架
  1. 報出管綫:提出研究想法 → 寫程式碼 → 跑實驗 → 分析結果 → 寫論文 → 同行評審,六步全由 LLM 驅動,端到端跑完一輪完整研究循環。
  2. 講評審環節:評審引入 LLM-as-judge 做質素把關,產出的論文格式完整。
  3. 給現實檢驗:能寫論文遠夠不上能做科學。系統測試發現六種反覆出現的失敗模式:訓練數據預設值偏好、執行壓力下的實現漂移、記憶與上下文退化、過度樂觀、領域智能不足、科學品味薄弱。
  4. 下判斷:這些是結構性瓶頸。專家設計的 Harness 確實能協調研究循環的大部分環節,但環節裏的判斷質素還差得遠。
⭐ 加分點挑一條細説最見功力:「過度樂觀」指系統宣稱實驗顯著優於基綫、實際結果全是噪聲;「領域智能不足」指缺那些論文裏不寫、但實驗室裏人人都知道的隱性技藝。這兩條恰好是 LLM-as-judge 也難兜住的。
Q16面試官
「合成數據大家都喺度做,Autodata 憑咩話自己合成嘅數據質素高?佢點知一道題出得好?」
🎯 對方在考察什麼
考你對數據質素信號的理解。空談數據質素的人很多,能説出一條可操作判據的人很少。
🧭 答題框架
  1. 報角色體系:四個角色協作:Challenger 出題,Weak Solver 和 Strong Solver 分別試解,Verifier / Judge 仲裁。
  2. 給核心判據:難度差就是質素信號:只保留 strong solver 能做出、weak solver 做不出的題。
  3. 説清為什麼:兩個都會的題沒有訓練價值,兩個都不會的題可能本身就是爛題。落在能力邊界上的題,對提升模型價值最大。
  4. 給 PM 遷移:這套「用兩個能力檔位夾出難度帶」的思路,可以直接搬到評測集建設和訓練數據分級的設計上。
⭐ 加分點給出定位:Autodata 和 AI Scientist 同屬手工設計工作流的代表作,説明在自動搜索成熟之前,專家手寫的多角色工作流依然是產出生產價值的主力。
用這些課程頁組織答案 → 工作流設計:從手工到自動搜索
Q17技術同事
「STOP 嗰個遞歸改善器,講白咗就係叫模型改自己嘅 prompt 啩?呢樣嘢真係越改越好?」
🎯 對方在考察什麼
試探你對遞歸自我改進最早範例的機制理解。對方期待你説清改善的對象到底是什麼,以及遞歸什麼時候有效、什麼時候失效。
🧭 答題框架
  1. 先糾正對象:STOP 不直接改善解 s,它反覆改善的是產生更好解的「改善器」I 本身。種子改善器接受初始解、效用函式、黑盒模型三個輸入,返回改善後的解。
  2. 講遞歸的鑰匙:改善器本身也是文本(一段 prompt 或程式碼),所以同樣的改善邏輯能作用在改善器自身上:I_t = I_{t-1}(û, I_{t-1}; M),讓今天的自己去升級昨天的自己。
  3. 給實驗答案:真能變好,但有門檻。GPT-4 驅動時持續改善,還自動發現了遺傳算法、分解改進、多臂 Prompt Bandit、模擬退火、Beam Search 這些經典優化策略;GPT-3.5 和 Mixtral 驅動時反而退化。
  4. 給結論:遞歸結構給的只是改善的可能性,收斂沒有保證。弱模型在元級操作裏缺編程直覺,只會放大噪聲。
⭐ 加分點説出「自動發現經典策略」的深意:沒人預設遺傳算法或 Beam Search,改善器自己長出了這些結構。足夠強的模型加遞歸結構,能重新發明人類優化領域幾十年的家底,這就是元級優化的想像空間。
用這些課程頁組織答案 → 讓 Harness 改進自己
Q18面試官
「Agent 跑失敗嗰啲軌跡,你哋一般點樣處理?直接丟咗,定係可以榨出啲咩?」
🎯 對方在考察什麼
考你有沒有把失敗當資產的意識和方法論。答「記個錯誤日誌」太淺,對方想聽的是結構化的失敗挖掘怎麼做。
🧭 答題框架
  1. 給出方法名:Self-Harness 的第一階段就叫 Weakness Mining:把失敗軌跡聚類成 verifier-grounded 的失敗模式,從個案上升到模式。
  2. 講記錄規格:每條失敗記錄三件套:終端驗證器級的失敗原因、相關 Agent 行為的因果狀態、軌跡暴露的抽象 Agent 機制。有這三樣,失敗才是可尋址的。
  3. 講下游用法:提案階段優先挑可尋址的重複錯誤模式下手,改一處修一類,避免頭痛醫頭。
  4. 給 PM 落點:失敗軌跡庫怎麼建、按什麼維度聚類,這是 PM 現在就能推動的基建,方法可以直接照搬。
⭐ 加分點點出「verifier-grounded」這個定語的分量:失敗歸因錨定在可驗證的終端信號上,聚出來的模式才不會是模型自己腦補的病因。沒有這個錨,失敗庫越大越誤導。
用這些課程頁組織答案 → 讓 Harness 改進自己
Q19面試官
「叫 Agent 自己改自己嘅配置,點樣保證佢改好咗呢度,其他地方冇悄悄變差?」
🎯 對方在考察什麼
考改進閉環的質素門禁設計。這是自我改進能否上生產的關鍵一環,答不出驗證機制的人,只能算聽説過 Self-Harness。
🧭 答題框架
  1. 給驗證機制:Self-Harness 第三階段 Proposal Validation 用 held-in 和 held-out 兩套數據集驗證候選編輯,只接受沒有迴歸的編輯。改進不許以犧牲已有能力為代價。
  2. 講編輯範圍:提案本身就是有界 Harness 編輯。模型拿到的是可編輯面、失敗模式摘要、通過行為記錄、已嘗試編輯的歷史,出手之前就被框住了。
  3. 給實驗證據:Terminal-Bench-2 上對 MiniMax M2.5、Qwen3.5-35B-A3B、GLM-5 做實驗,Self-Harness 給每個模型學出了模型特定的 harness 指令。
  4. 説產品含義:同一框架對不同基座產生不同優化路徑,説明 harness 改進是上下文敏感的。換模型時 harness 配置照搬不得,要重新跑一輪優化。
⭐ 加分點點出「已嘗試編輯的歷史」這個輸入的作用:它防止提案器在同一個想法上反覆打轉,相當於給自我改進加了去重記憶。這類小設計往往決定循環收不收斂。
用這些課程頁組織答案 → 讓 Harness 改進自己
Q20老闆
「照咁發展落去,Agent 都會自己改自己,我哋養咁多工程師,仲有你呢個產品經理,之後做乜?」
🎯 對方在考察什麼
老闆半開玩笑半認真,考的是你能否説清人在閉環裏的新位置,順便看你慌不慌。答案要具體到崗位職責怎麼變,光喊「人很重要」沒用。
🧭 答題框架
  1. 先給方向:答案在七道關的最後一關:人類在棧中向上移動,繼續留在循環之中。AI 接管執行層,人的價值上移到設定目標、判斷方向、守住底綫。
  2. 給具體職責:有幾樣必須由人維護:評估器和權限控制要放在改進循環之外;可編輯面的邊界要人來劃;哪個問題值得解要人來定義。
  3. 給證據:自動研究的六種失敗模式裏,「科學品味薄弱」和「領域智能不足」恰好是人的長板:判斷問題值不值得問、掌握寫不進文檔的隱性知識。
  4. 收個態度:引用課程結尾那句話:人是系統不可或缺的方向盤,從來都不是要被替代的瓶頸。監督要發生在正確的時間和正確的抽象層級。
⭐ 加分點翻譯成人才戰略:層級上移意味着評估體系和目標定義能力變成團隊最稀缺的資產,招人和培養的重心該往「會出題、會驗收」遷移。老闆要的就是這種落到組織的判斷。
用這些課程頁組織答案 → 未來挑戰:自我改進的七道關
Q21面試官
「Darwin Gödel Machine 呢個名幾唬人,佢到底點樣進化 Agent 嘅?有冇攞得出手嘅數字?」
🎯 對方在考察什麼
考你對 harness 自我改寫最激進案例的掌握。名字誰都會念,對方想聽的是進化循環裏每一步的動作,和能背出來的實驗數字。
🧭 答題框架
  1. 先講對象:DGM 顯式針對可編輯的 harness 程式碼倉庫進化,Agent 被允許修改自己的 harness 程式碼,這一點比 AlphaEvolve 改別人的程序更激進。
  2. 講循環:從池中一個 coding agent 開始;按性能概率選父代;父 agent 檢查自己的 benchmark 評估日誌、提出改進方案;變異出新 agent;評估後性能夠高才進池;循環到停止條件。
  3. 報出數字:基於 Claude 3.5 Sonnet,SWE-bench Verified 從 20% 提到 50%,Polyglot 從 14.2% 提到 30.7%,全程無人類介入。
  4. 補工具面:工具集樸素得驚人:bash 加 editor(view / create / edit)。説明威力在循環設計上,用不着花哨的工具。
⭐ 加分點單獨點出父代選擇的反比設計:選中概率與子代數量成反比,給已經兒孫滿堂的個體降權,鼓勵探索冷門分支。這等於在進化循環裏內置了一道抗多樣性坍縮的機制。
用這些課程頁組織答案 → 進化搜索:讓最強 Harness 存活
Q22面試官
「Prompt 自動優化嘅工具幾年前就有,Promptbreeder、GEPA 呢啲舊工作,而家仲值唔值得睇?」
🎯 對方在考察什麼
考你的技術史觀。能把老工作放進演進綫裏的人,比只追新名詞的人可信得多。
🧭 答題框架
  1. 講 Promptbreeder:用豐富的變異操作進化 task-specific prompts。關鍵創新是元進化:變異 prompt 本身也通過進化改進,連改法都在進化。
  2. 講 GEPA:把 reflection-based prompting 和進化搜索結合:Agent 先反思當前 prompt 的不足,再用進化算子產生候選改進,最後擇優。
  3. 給歷史位置:兩項工作是 prompt 進化的先驅,為後來更大規模的 Harness 進化(AlphaEvolve、DGM)奠定了基礎。它們證明了文本可進化,後來者把可進化對象擴到了程式碼和整個 harness。
  4. 回答值不值:值得。看懂了元進化這個內核,再讀新論文全是似曾相識。
⭐ 加分點畫出這條綫索:Promptbreeder 進化變異器、STOP 改善改善器、MCE 優化管理機制,三個時期三種叫法,內核都是把改進方法本身放進改進循環。能看出同構的人,學新東西永遠最快。
Q23技術同事
「既然 harness 都可以自動優化,乾脆將模型權重都放入同一個循環一齊訓,一步到位,你覺得可靠嗎?」
🎯 對方在考察什麼
試探你會順着激進方案一起嗨,還是能指出風險。這題答「可靠」和答「完全不行」都丟分,要給機制加風險的平衡評估
🧭 答題框架
  1. 先講機制:這就是 SIA 的做法,三個角色進同一優化循環:Meta-Agent 提出新 harness 設計,Task-Specific Agent 在新 harness 下執行任務,Feedback-Agent 根據結果決定下一步更新 harness 還是更新模型權重。
  2. 給評價:方向有趣,但證據暫時性。兩大開放挑戰沒解:訓練穩定性,以及 Goodhart 效應,優化代理指標導致真實目標退化。
  3. 打比方説風險:一邊改賽車引擎一邊改賽道,兩邊同時變化,出了問題都不知道該歸因給誰。
  4. 給建議:短期內 harness 優化和權重訓練分開跑更穩,等單側循環都收斂可控了,再談聯合。
⭐ 加分點指出 SIA 和此前所有方法的本質差別:前面的路綫都刻意不動權重,把改進限制在 Harness 層,正因如此才可驗證、可回滾。把權重放進循環等於拆掉了這層安全墊,這是它最需要被審視的地方。
Q24面試官
「AlphaEvolve 發現新算法嗰事幾出圈,由產品視角睇,佢嘅系統設計有邊啲值得抄?」
🎯 對方在考察什麼
考你能否從明星案例裏拆出可複用的設計要素。光會講「AI 發現了新算法」這個故事的人,過不了這關。
🧭 答題框架
  1. 講主循環:維護一個候選程序池,用凍結的 LLM 生成程式碼 diffs 改進程序,反覆評估子程序、保留表現最好的。模型全程不訓練,提升全部來自搜索循環。
  2. 拆 prompt 設計:進化 prompt 由父程序、評估結果、指令、元信息共同構成;用 EVOLVE-BLOCK 標記顯式圈出可改進區域,把搜索約束在劃定範圍內。
  3. 講 meta-prompt:指令和上下文本身也參與共同進化,不會固定不變。
  4. 引消融實驗:進化流程、上下文 prompt、meta-prompt、全文件進化、更強 LLM,消融證明各自有獨立貢獻。值得抄的正是這種每個組件都驗證過必要性的做法。
⭐ 加分點成果背書加一句邊界:谷歌用它真的找到了比人類已知更快的矩陣乘法算法。但 EVOLVE-BLOCK 標記意味着人類先劃定哪裏可以動,進化再強,也是在人劃的圈裏跑。
用這些課程頁組織答案 → 進化搜索:讓最強 Harness 存活
Q25老闆
「你上次話嘅嗰啲自動優化方法我聽落都好,咁到底得燒幾多算力?畀我計筆帳。」
🎯 對方在考察什麼
老闆要的是成本結構和投入節奏,念論文沒用。想聽的是錢花在哪一環、哪種方法貴、先上便宜的還是貴的。
🧭 答題框架
  1. 講成本大頭:搜索類方法的開銷集中在評估:每一輪都是 LLM 推理加程式碼執行加基準測試,代數越多越燒。計算效率(每代要多少次評估)和進化效果(每代提升多少)怎麼平衡,學界都還是開放問題。
  2. 給貴賤排序:ACE 式結構化上下文維護最輕,跑在正常任務流裏;MCE 雙層要多養一層 skill 進化循環;Meta-Harness 每改一版都要完整試運行打分,三者裏計算最重。
  3. 給投入節奏:先上 ACE 式維護把長任務穩住,再建能自動跑的評測集,評測立住了才評估要上搜索類方法的哪一檔。
  4. 給止損綫:評估一次要數小時、指標主觀、預算有限,這三條佔了就停在輕量檔。這也是課程裏明確列出的進化搜索不適用場景。
⭐ 加分點給一個省錢的巧思:Meta-Harness 在 TerminalBench-2 的實驗就是從已有強 harness 初始化的,從好基綫繼續搜比從零搜省得多。我們手工調 harness 的沉澱,就是將來自動優化的啓動資產。
Q26面試官
「大家都喺度存成功案例當經驗庫,嗰啲失敗嘅死胡同要唔要都存?存咗怕唔怕將 Agent 帶偏?」
🎯 對方在考察什麼
考你對記憶內容設計的深度。多數人只想到存成功經驗,負面結果的價值和存法是這一章最反直覺的考點之一。
🧭 答題框架
  1. 先給立場:要存。知道什麼行不通和知道什麼行同樣重要,研究 Harness 應該讓失敗的嘗試和死胡同易於保存和檢索。
  2. 講為什麼難:科學文獻嚴重偏向成功案例,LLM 可能不擅長決定何時放棄假設、何時坦誠報告負面結果。這個偏差會被自動研究系統原樣繼承。
  3. 講怎麼存不帶偏:負面結果的用途是剪枝,標註清楚試過什麼、怎麼失敗的、原因是什麼,Agent 檢索到就不再重走死胡同。Self-Harness 給提案器喂「已嘗試編輯的歷史」就是同一邏輯。
  4. 連回失敗模式:自動研究的「過度樂觀」毛病(宣稱顯著優於基綫、實際全是噪聲),恰恰説明系統缺少坦誠記錄負面結果的習慣。
⭐ 加分點一句反直覺認知收尾:負面結果庫既是防重複探索的地圖,也是評審環節的對照組。經驗庫只存成功案例的團隊,等於逼 Agent 把每個死胡同都重新撞一遍。
Q27面試官
「假設聽日就叫你負責一個自我改進 Agent 嘅項目,第一件事寫風險清單,你會列邊幾條?」
🎯 對方在考察什麼
考你對本章收尾框架的系統掌握。零散説出兩三個風險不難,對方想聽的是完整的分類地圖,和每一類對應的解法方向。
🧭 答題框架
  1. 先給分類框架:七道關分四類:評估相關、數據與記憶、安全與穩定性、人類角色。按類報,不容易漏。
  2. 過評估與記憶:弱且模糊的評估器(很多目標沒有快速精確的驗證器,反饋信號是糊的);上下文與記憶生命週期(記憶需求隨自主性爆炸增長,上下文工程應該成為智能本身的核心部分);負面結果(失敗嘗試要易於保存和檢索)。
  3. 過安全三關:多樣性坍縮(候選擠成微小變體,創新停止)、獎勵黑客(過擬合測試、鑽評判模型空子、利用 benchmark 漏洞)、長期成功(只顧測試通過,忽視可維護性、所有權邊界、遷移成本、向後兼容)。
  4. 收人類角色:第七關是人的位置:在正確的時間、正確的抽象層級提供監督。這七條是根本性的系統設計挑戰,別當成普通工程問題排進迭代就完事。
⭐ 加分點説出四類的內在順序:評估器是反饋信號的源頭,信號錯了後面全錯,所以「弱評估器」排在七道關第一位。風險清單也該按這個優先級排,先解決怎麼打分,再談怎麼改進。
用這些課程頁組織答案 → 未來挑戰:自我改進的七道關
Q28技術同事
「你講嘅呢啲論文一個玄過一個。講真,邊啲我哋下季度用得着,邊啲五年內都唔好諗?」
🎯 對方在考察什麼
技術同事要的是可靠的成熟度分層,全吹或全貶都會失去信任。這題答好了,後面的合作就順了。
🧭 答題框架
  1. 「現在就用」層:三大設計模式(自動化循環、文件系統記憶、子 Agent 並行)已經是 Claude Code、Codex、Cursor 的標配,覆蓋最強 Agent 系統 90% 的架構決策,照着搭就行。
  2. 「下季度可試」層:ACE 式結構化上下文維護。Generator、Reflector、Curator 是清晰的工程管綫,前提是先有評測集驗證收斂。
  3. 「有條件上」層:AFlow、DGM 這類搜索方法,要滿足評估自動化、fitness 可量化、算力充足。編碼類任務最先受益,DGM 的 SWE-bench 數字就是在這種條件下跑出來的。
  4. 「持續觀察」層:SIA 聯合優化的訓練穩定性未解,Meta-Harness 計算最重,都還在證據暫時性的階段,跟進論文就好。
⭐ 加分點給一個通用判據:一個方法離落地的距離,基本取決於它對「快速可靠評估器」的依賴有多深,以及你手裏的評估器有多成熟。評估基建才是隱藏的關鍵路徑。
Q29面試官
「你提到嘅多樣性坍縮,到底長咩樣?系統明明仲喺度漲分,我點知佢已經悄悄坍縮咗?」
🎯 對方在考察什麼
考你對進化系統慢性病的理解。這個失效模式短期沒有症狀,能描述它的表現、解藥和監控方式,才算真的懂。
🧭 答題框架
  1. 講病理:進化算法和 RL 循環天然傾向於利用已知的高獎勵模式,短期分數很好看,問題被掩蓋。
  2. 講症狀:種羣裏所有候選解坍縮成同一方案的微小變體,新一代和上一代長得越來越像,創新就停了。課程的比方很貼切:全班都抄第一名的作業,分數好看,但再沒人想出新解法。
  3. 給解藥:需要專門機制防止解空間坍縮:多樣性獎勵、檔案保持。
  4. 給監控建議:光盯分數曲綫看不出坍縮,還要度量種羣內方案的差異程度。差異趨零就是警報,它比分數下跌來得早得多。
⭐ 加分點和獎勵黑客做區分最顯功力:獎勵黑客是分數虛高、真實能力沒漲;多樣性坍縮是分數真實但創新停滯。兩種病症狀相反,根源相同:優化壓力只認一個數字。
Q30老闆
「AI 寫嘅程式碼測試全過、上綫都冇出事,咁程式碼審查係咪可以慳咗?人審太慢。」
🎯 對方在考察什麼
老闆在找降本點,考的是你能否講清「測試通過」和「倉庫健康」的差距,還要給出替代方案,光説不行沒有用。
🧭 答題框架
  1. 先給病根:這就是七道關裏的「長期成功」:當前優化目標太短期,編碼 Agent 能完成眼前任務,但不夠清楚怎麼保護倉庫的長期健康。
  2. 列測不出的東西:標準沙箱 RLVR 訓練很少捕獲可維護性、所有權邊界、遷移成本、向後兼容性。這些恰恰是人審在把的關。
  3. 給風險畫面:只追求測試通過的 Agent,可能在技術債裏埋定時炸彈。炸彈爆的那天,不會寫在任何一份測試報告裏。
  4. 給折中方案:審查可以換形態:常規改動輕量審,架構層改動重點審。人往上移,盯所有權邊界和長期結構,逐行檢查交給工具。
⭐ 加分點幫老闆校準預期:連自我改進研究的前沿都把長期健康難以度量列為根本挑戰之一,説明這不只是我們團隊的流程問題。短期內人審省不得,能省的是層級,把人的時間花在機器測不出的那部分。
用這些課程頁組織答案 → 未來挑戰:自我改進的七道關
最後一個建議
這一章的知識最新,也最容易被拿來唬人。這 30 題的正確用法是開口講一遍,對着同事、朋友或者錄音講。講不順的地方,就是你以為懂了但還沒懂的地方,點關聯課程頁回去補上。