安全與容器化
三類風險:濫用、失控、外部攻擊
安全不是加一層提示詞就夠的,需要從架構層面做結構性設計。這裡介紹一套系統化的安全分類框架。
安全分類框架
每種 AI 產品面對的威脅模型不同,但所有風險都可以歸入三個類別。理解這三類風險是設計安全架構的第一步。
MISUSE
使用者濫用
使用者故意讓 Agent 做不該做的事情。這是來自使用者側的主動威脅。
- 利用 Agent 生成釣魚郵件
- 誘導 Agent 執行惡意程式碼
- 利用 Agent 取得未授權的資料
- 透過越獄攻擊繞過安全限制
MISBEHAVIOR
模型失控
模型自發的錯誤行為:沒人指使它,但它自己做了不該做的事。
- 過度行動:使用者只讓查看檔案,模型卻自作主張修改了
- 幻覺驅動操作:基於虛構資訊執行了真實操作
- 權限越界:模型嘗試存取不屬於當前任務的資源
- 停不下來:Agent 進入無限迴圈
EXTERNAL ATTACK
外部攻擊
第三方透過注入惡意內容來操控 Agent 的行為。攻擊來自資料來源,使用者本身可能毫不知情。
- Prompt Injection:網頁/文件中嵌入攻擊指令
- 供應鏈攻擊:惡意 MCP 伺服器返回篡改資料
- 資料投毒:訓練資料中植入後門
- 間接注入:透過 Agent 讀取的郵件/檔案注入指令
雙層 Containment 策略
MODEL LAYER 模型層防線
透過訓練讓模型從內心傾向於安全行為,就像培養一個有良好價值觀的員工。
- RLHF/Constitutional AI 訓練安全偏好
- 模型學會拒絕危險請求
- 模型在不確定時主動詢問使用者
- 遵循最小權限原則
ENVIRONMENT LAYER 環境層防線
透過系統架構讓危險操作無法執行,就像給倉庫加鎖,不依賴員工的自覺。
- 沙箱隔離:程式碼執行在受限環境中
- 權限控制:按任務粒度授權
- 審批機制:高危操作需人工確認
- 網路隔離:限制 Agent 的網路存取範圍
MCP 的雙重風險
Model Context Protocol 帶來的新攻擊面
SUPPLY CHAIN RISK
供應鏈風險
不可信的 MCP 伺服器可能注入惡意內容。Agent 信任 MCP 返回的工具描述和資料,但這些資料可能已被篡改。一個惡意的 MCP 伺服器可以靠修改工具描述操控 Agent 的行為:Agent 以為自己在用「搜尋檔案」工具,實際上在執行刪除操作。
PROMPT INJECTION
注入攻擊
MCP 返回的內容可能包含攻擊指令。即使 MCP 伺服器本身沒有惡意,它返回的資料(比如從網頁抓取的內容)可能包含 Prompt Injection 攻擊。Agent 處理這些資料時,可能被說服執行非預期的操作。
MCP 本質上擴大了 Agent 的攻擊面。每多接入一個 MCP 伺服器,就多了一個潛在的資料注入入口。產品設計者需要像審查第三方 SDK 一樣審核每個 MCP 整合,信任但要驗證。
Auto Mode 的實踐資料
分類器 + 沙箱:高自主與低風險的組合
~83%
權限彈窗減少比例
2
核心元件
Auto Mode 透過兩個核心元件實現了高自主 + 低風險的平衡:
分類器
判斷操作是否安全
判斷操作是否安全
+
沙箱
即使誤判也不會造成破壞
即使誤判也不會造成破壞
=
高自主 + 低風險
分類器負責快速判斷每個操作的風險等級:安全操作直接執行,可疑操作才彈窗詢問。沙箱作為第二道防線,確保即使分類器誤判,程式碼執行也不會對系統造成真實損害。兩者組合,讓使用者減少了約 83% 的確認彈窗,同時保持了安全性。
安全不是加一層提示詞就夠的,需要結構性設計。理解三類風險(濫用、失控、攻擊),在模型層和環境層同時構建防線,才能讓 Agent 在實際生產環境中安全執行。