PART 5 · Harness 與自我改進

未來挑戰:自我改進的七道關

研究者取得了真正的進展,但通往完整遞迴自我改進的路上,還有若干瓶頸。

Reality Check

自動研究:能寫論文 ≠ 能做科學

AI Scientist 證明了專家設計的 Harness 能協調自動研究迴圈的大部分環節,但論文產出並不等於科學發現。系統可以寫出看似合理的論文,卻可能包含虛假引用、實現漂移或薄弱的實驗結果。
💬 講人話:AI 現在能寫出看起來像論文的東西,但就像一個只會套模板的實習生:格式對了、引用全了,可實驗可能是錯的、結論可能是編的。下面這六種毛病,是研究者反覆觀察到的實習生通病。

六種反覆出現的失敗模式

Trehan & Chopra (2026) 系統測試了 LLM 從想法到論文的全流程能力,發現了六種反覆出現的失敗模式。這些是當前自動研究的結構性瓶頸,絕非偶發 Bug。

1
訓練資料預設值偏好 傾向於使用舊庫、過時命令、標準模板,錯過最優方案。
2
執行壓力下的實現漂移 遇到複雜度牆就轉向更簡單的替代方案,偏離原始設計。
3
記憶與上下文退化 長期專案中逐漸丟失關鍵細節,前後文不一致。
4
過度樂觀 宣稱實驗「顯著優於基線」,但實際結果充滿噪聲。
5
領域智慧不足 缺乏隱性技藝知識:那些論文不會寫、但實驗室裡每個人都知道的東西。
6
科學品味薄弱 實驗可以執行,但無法判斷「這個問題值不值得問」。
七大未來挑戰
評估相關 資料與記憶 安全與穩定性 人類角色
1
評估相關
弱且模糊的評估器
程式設計有單元測試,數學有證明,但很多研究宣告沒有快速精確的驗證器。研究品味、新穎性、長期科學價值極難衡量。沒有可靠評估器,自我改進迴圈的回饋訊號就是模糊的,改進方向可能是錯的。

💬 打個比方:健身有體重秤,程式碼有測試,但「這篇論文有沒有價值」沒有秤可稱。沒有秤,再努力的減肥計劃也不知道自己是瘦了還是胖了。
2
資料與記憶
上下文與記憶生命週期
記憶需求隨 Agent 自主性增長而爆炸式增長。當前的上下文工程大多停留在軟體系統層,但它應該成為智慧本身的核心部分。一個不能管理自己記憶的 Agent,無法完成跨天、跨周的複雜研究任務。
3
資料與記憶
負面結果
科學文獻嚴重偏向成功案例。LLM 可能不擅長決定何時放棄假設、何時坦誠報告負面結果。研究 Harness 應該讓失敗的嘗試和死胡同易於儲存和檢索,因為知道「什麼行不通」和知道「什麼行」同樣重要。
4
安全與穩定性
多樣性坍縮
進化演算法和 RL 迴圈天然傾向於利用已知的高獎勵模式。當種群中所有候選解都坍縮為同一方案的微小變體時,創新就停止了。需要專門的機制(如多樣性獎勵、檔案保持)來防止解空間坍縮

💬 打個比方:全班都抄第一名的作業,短期分數好看,但再也不會有人想出新解法了。
5
安全與穩定性
獎勵駭客
優化單元測試會過擬合測試用例;優化評判模型會學會 reward hacking;優化 benchmark 分數會利用 benchmark 漏洞。這是自我改進迴圈中最危險的反模式之一:評估器和權限控制應該在進化迴圈之外,由獨立機制維護。

💬 打個比方:如果考試只看分數,學生就會背題庫、找漏洞、甚至改成績單,沒有人真正學會知識。所以出卷人和改卷人絕不能是學生自己。
6
安全與穩定性
長期成功
當前優化目標太短期。編碼 Agent 能完成眼前的任務,但不夠清楚如何保護倉庫的長期健康。標準沙箱 RLVR 訓練很少捕獲可維護性、所有權邊界、遷移成本和向後相容性。一個只追求測試通過的 Agent 可能在技術債中埋下定時炸彈。
7
人類角色
人類的角色
人類應該在棧中向上移動,繼續留在迴圈之中。隨著 AI 接管越來越多的執行層工作,人類的價值在於在正確的時間、正確的抽象層級提供監督:設定目標、判斷方向、守住底線。完全自主的 AI 不是最終目標,人機協作的品質才是。

最終思考

自動研究、遞迴自我改進、AI Agent,這些技術正在快速發展,但上面列出的七道關並不是工程問題,它們是根本性的系統設計挑戰

弱評估器讓回饋訊號模糊,多樣性坍縮讓創新停滯,獎勵駭客讓改進方向跑偏,短期優化讓長期健康受損。所有這些問題的共同解法,最終都指向同一個方向:


我們在為人類更好的未來構建技術,方向永遠是技術服務於人。
許多挑戰都需要人類的回饋和引導。人是系統不可或缺的方向盤,從來都不是要被替代的瓶頸。