PART 5 · Harness 與自我改進
未來挑戰:自我改進的七道關
研究者取得了真正的進展,但通往完整遞歸自我改進的路上,還有若干瓶頸。
Reality Check
自動研究:能寫論文 ≠ 能做科學
AI Scientist 證明了專家設計的 Harness 能協調自動研究循環的大部分環節,但論文產出並不等於科學發現。系統可以寫出看似合理的論文,卻可能包含虛假引用、實現漂移或薄弱的實驗結果。
講人話:AI 而家寫得出睇落好似論文嘅嘢,但就好似一個淨係識套模板嘅實習生:格式啱、引用齊,但實驗可能係錯、結論可能係編。下面呢六種毛病,係研究者反覆觀察到嘅實習生通病。
六種反覆出現的失敗模式
Trehan & Chopra (2026) 系統測試了 LLM 從想法到論文的全流程能力,發現了六種反覆出現的失敗模式。這些是當前自動研究的結構性瓶頸,絕非偶發 Bug。
1
訓練數據預設值偏好
傾向於使用舊庫、過時命令、標準模板,錯過最優方案。
2
執行壓力下的實現漂移
遇到複雜度牆就轉向更簡單的替代方案,偏離原始設計。
3
記憶與上下文退化
長期項目中逐漸丟失關鍵細節,前後文不一致。
4
過度樂觀
宣稱實驗「顯著優於基綫」,但實際結果充滿噪聲。
5
領域智能不足
缺乏隱性技藝知識:那些論文不會寫、但實驗室裏每個人都知道的東西。
6
科學品味薄弱
實驗可以執行,但無法判斷「呢條問題值唔值得問」。
七大未來挑戰
評估相關
數據與記憶
安全與穩定性
人類角色
1
評估相關
弱且模糊的評估器
編程有單元測試,數學有證明,但很多研究聲明沒有快速精確的驗證器。研究品味、新穎性、長期科學價值極難衡量。沒有可靠評估器,自我改進循環的反饋信號就是模糊的,改進方向可能是錯的。
💬 打個比喻:健身有體重秤,程式碼有測試,但「呢篇論文有冇價值」就冇秤可稱。冇秤,再努力嘅減肥計劃都唔知自己係瘦咗定肥咗。
💬 打個比喻:健身有體重秤,程式碼有測試,但「呢篇論文有冇價值」就冇秤可稱。冇秤,再努力嘅減肥計劃都唔知自己係瘦咗定肥咗。
2
數據與記憶
上下文與記憶生命週期
記憶需求隨 Agent 自主性增長而爆炸式增長。當前的上下文工程大多停留在軟件系統層,但它應該成為智能本身的核心部分。一個不能管理自己記憶的 Agent,無法完成跨天、跨周的複雜研究任務。
3
數據與記憶
負面結果
科學文獻嚴重偏向成功案例。LLM 可能不擅長決定何時放棄假設、何時坦誠報告負面結果。研究 Harness 應該讓失敗的嘗試和死胡同易於保存和檢索,因為知「咩行唔通」同知「咩得」同樣重要。
4
安全與穩定性
多樣性坍縮
進化算法和 RL 循環天然傾向於利用已知的高獎勵模式。當種羣中所有候選解都坍縮為同一方案的微小變體時,創新就停止了。需要專門的機制(如多樣性獎勵、檔案保持)來防止解空間坍縮。
💬 打個比喻:全班都抄第一名份功課,短期分數好睇,但再唔會有人諗到新解法。
💬 打個比喻:全班都抄第一名份功課,短期分數好睇,但再唔會有人諗到新解法。
5
安全與穩定性
獎勵黑客
優化單元測試會過擬合測試用例;優化評判模型會學會 reward hacking;優化 benchmark 分數會利用 benchmark 漏洞。這是自我改進循環中最危險的反模式之一:評估器和權限控制應該在進化循環之外,由獨立機制維護。
💬 打個比喻:如果考試淨係睇分數,學生就會背題庫、搵漏洞、甚至改成績單,冇人真正學會知識。所以出卷同改卷嘅人絕對唔可以係學生自己。
💬 打個比喻:如果考試淨係睇分數,學生就會背題庫、搵漏洞、甚至改成績單,冇人真正學會知識。所以出卷同改卷嘅人絕對唔可以係學生自己。
6
安全與穩定性
長期成功
當前優化目標太短期。編碼 Agent 能完成眼前的任務,但不夠清楚如何保護倉庫的長期健康。標準沙箱 RLVR 訓練很少捕獲可維護性、所有權邊界、遷移成本和向後兼容性。一個只追求測試通過的 Agent 可能在技術債中埋下定時炸彈。
7
人類角色
人類的角色
人類應該在棧中向上移動,繼續留在循環之中。隨着 AI 接管越來越多的執行層工作,人類的價值在於在正確的時間、正確的抽象層級提供監督:設定目標、判斷方向、守住底綫。完全自主的 AI 不是最終目標,人機協作的質素才是。
最終思考
自動研究、遞歸自我改進、AI Agent,這些技術正在快速發展,但上面列出的七道關並不是工程問題,它們是根本性的系統設計挑戰。
弱評估器讓反饋信號模糊,多樣性坍縮讓創新停滯,獎勵黑客讓改進方向跑偏,短期優化讓長期健康受損。所有這些問題的共同解法,最終都指向同一個方向:
我們在為人類更好的未來構建技術,方向永遠是技術服務於人。
許多挑戰都需要人類的回饋和引導。人是系統不可或缺的方向盤,從來都不是要被替代的瓶頸。