PART 5 · Harness 與自我改進

從腳手架到自我改進系統

Harness 不只是包裹模型的外殼。它正在成為 AI 遞迴自我改進的核心引擎。

Recursive Self-Improvement

一個系統,能用自己當前的智慧去改善產生智慧的機制本身

I. J. Good(1965)定義了「超級智慧機器」:能在所有智力活動上超越人類,並設計更好的機器來改進自身。Yudkowsky(2008)將此概括為「遞迴自我改進」(RSI)。
Lilian Weng
本篇章的全部思路,來自 Lilian Weng 的這篇部落格
自我改進篇的整個框架、概念與案例,都源自 Lilian Weng 於 2026 年 7 月發表的長文《Harness Engineering for Self-Improvement》。我在這裡做的只是把它講得更適合課堂,觀點與功勞都屬於原作者。

她是一位令人尊敬的前輩,多年來在 AI 安全與 Agent 前沿領域持續輸出,她的部落格幾乎是這個行業公認的必讀。非常推薦關注她的推特,也強烈建議你讀完這一章後回去讀原文。
RSI 的演進
1965 · Good
"Ultra-intelligent machine":能設計更好機器的機器。理論設想。
2008 · Yudkowsky
正式提出 "Recursive Self-Improvement":AI 用自身智慧改進產生智慧的認知機制。
2023–2024
Self-play、合成資料、Test-time training 等早期嘗試。模型開始改善自己的訓練資料。
2025–2026
Harness 工程成為 RSI 的核心路徑:模型不直接改寫權重,它改進的是圍繞自身的部署系統、工作流和上下文管理。
什麼是 Harness?
Harness = 模型周圍的一切編排系統
Harness 是圍繞基座模型的執行時系統,決定模型如何:

思考與規劃 · 呼叫工具與行動 · 感知與管理上下文 · 儲存製品 · 評估結果

成功的 AI 產品(如 Claude Code、Codex、Cursor)已經證明:Harness 層與原始模型智慧同等重要。一個平庸的模型加上優秀的 Harness,往往勝過裸露的更強模型。
Codex Agent Loop
一個簡化的 Codex Agent 迴圈:Agent 呼叫工具,工具返回影響下一輪生成。(來源:OpenAI)
為什麼 Harness 是近期 RSI 的實際路徑?
近期 RSI 的三步預測
1. 模型不會直接改寫自己的權重,但它能改進訓練管線和部署系統,使下一代模型更強。

2. Harness 工程走向元方法論:改善的對象從答案本身,變成得到更好答案的機制。Harness 本身成為優化目標。

3. 成熟 Harness + 智慧模型 = 正回饋迴圈:更好的 Harness 催生更強模型,更強模型又讓 Harness 不必過度工程化。
與 Prompt Engineering 的類比
我們已經見過更軟的版本:隨著指令微調和推理能力提升,手動 Prompt 技巧變得不那麼核心了,但指定目標、約束、上下文和評估的需求並沒有消失。

同理,最終很多 Harness 改進會被內化為模型行為,但與外部上下文和工具的介面將永遠存在。
核心觀點:遞迴自我改進不需要從模型直接修改權重開始。更現實的路徑是讓模型改進圍繞它的 Harness 系統(上下文管理、工作流、工具編排、評估),形成持續改進的飛輪。這就是 Harness Engineering for Self-Improvement 的核心論點。