Agent 工程
Agent:能幹活的 AI
點選能力卡片,右側逐步演示 Agent 在真實場景中的執行過程
普通 LLM 只能「說」,Agent 能「做」。區別在於 Agent 有四個額外能力,讓它可以在真實世界中執行任務。
經典架構 · 出處必讀
Lilian Weng(翁荔)@lilianweng
前 OpenAI 研究副總裁、Thinking Machines Lab 聯合創始人 · 現已重返 OpenAI,領導遞迴自我改進(RSI)等核心前沿研究
本節乃至整個 Agent 工程章節的很多想法,都來自她 2023 年 6 月的部落格 《LLM Powered Autonomous Agents》。她是一位令人尊敬的前輩,明確提出了影響深遠的 Agent 架構——就是上面這張著名的「螃蟹圖」:Agent(LLM)居中當大腦,向四周伸出 Planning 規劃、Memory 記憶、Tools 工具、Action 行動。
這張圖對整個 AI Agent 行業影響深遠,今天幾乎所有 Agent 框架都能在裡面找到影子。非常推薦關注她的推特。
四大能力(源自 Lilian Weng 架構)· 點選切換演示
Plan 規劃
把複雜任務拆解為可執行的步驟序列,先想清楚再動手
Tool Use 工具
呼叫搜尋、程式碼執行、資料庫、API,是手腳的延伸
Memory 記憶
短期上下文 + 長期向量儲存,跨對話記住使用者
Act / Reflect 反思
執行後觀察結果,失敗則自動分析原因並糾錯
普通 LLM vs Agent
普通 LLM
問題 → 生成回答 → 結束
只能「說」,不能「做」
只能「說」,不能「做」
→
Agent
任務 → 規劃 → 調工具 → 觀察 → 糾錯 → 完成
逐步演示
進入視野自動播放 · 點選能力卡片切換演示
Takeaway
Takeaway Agent = LLM + 工具 + 迴圈。核心是「思考 → 行動 → 觀察 → 再思考」——這正是 Lilian Weng 那張架構圖跑起來的樣子:LLM 是大腦,Planning / Memory / Tools 是四肢。每個 AI 產品背後都是在設計這個迴圈。迴圈設計得越好,Agent 就越可靠。