從「模型防護」轉向「架構治理」
過去僅依賴語意過濾的防禦手段,已無法應對現代 Agent 生產環境的挑戰。
隨著系統從傳統的單輪 Prompt 交互演進為具備自主性的 Agentic 系統,防禦哲學必須從「防範模型被騙」轉向「強化應用架構」。 即使模型本身遭受攻擊,透過嚴密的層層圍堵,仍能將下游的潛在影響降至最低。在此背景下,我們必須先釐清潛在的威脅樣貌:

[圖 1:基於 LLM 應用的 OWASP TOP 10 風險]
根據 OWASP GenAI LLM Top 10 以及針對 Agent 的 ASI (Agentic Applications) Top 10 威脅,可發現目前的 Agentic 系統應用風險已轉向 Tool-call 濫用、身分偽造與代理間通訊的安全漏洞。業界過往常忽略對 Memory 與 Tool-call 等結構層級的治理,這正是導致安全漏洞的根本原因。

[圖 2:基於 Agentic Application 應用的 OWASP TOP 10 風險]
七層防禦框架:從單點到深度防護
要確保 Agent 的安全性,必須落實一套具備防禦深度的結構化框架,包含四大同步攔截點、三個 Agentic 專屬層,並橫切一個身分核心:
四大同步攔截點(Per-turn)
Input Rail: 在模型接收輸入前進行分類,防禦 Prompt Injection。
Retrieval Rail: 針對 RAG 檢索內容進行過濾,防止間接注入攻擊。
Tool-call Rail: 這是最關鍵的一環。我們不能僅依賴語意判斷,必須具備審核參數與執行權限的能力。透過沙盒化與 Allowlist,確保即使惡意指令進入模型,也無法轉化為非預期的特權操作。
Output Rail: 在模型輸出後進行檢查,防禦洩漏、不當內容或幻覺問題。
三大 Agentic 專屬層
Memory Rail: 針對記憶的寫入與讀取進行保護,防止跨回合的狀態污染(如 Memory Attack)。
Inter-Agent Communication Rail: 在 Agent 間建立交互信任,透過相互驗證(Mutual Authentication)防止身分偽造。
Chain-level Policy Check: 單一 tool call 可能看似合法,但組合起來可能有害。必須在多步動作鏈上執行政策,並定義最高拒絕原則。
落實風險分級與身分治理
面對效能挑戰,防禦不應是一視同仁的重型攔截。我們應採取「基於風險等級的動態調用」,根據應用資料範疇與權限將 Agent 分級。對於高風險操作,必須引入「運行時行為護欄」,在 Agent 進行 CoT 推理階段即監聽意圖。當偵測到潛在權限越級時,系統應啟動「負責任的降級機制」,強制切換至最嚴格監管模式或引入人工介入。
參考近期發生的 AI Agent 誤刪生產資料庫等案例,這些悲劇往往源於權限配置過度且缺乏對 tool-call 的有效控管。企業的身分治理(IAM)框架必須從頭設計,而非事後補丁。
在這套深度防禦體系中,身分層扮演的是最後一道、也是最穩固的底線。前述七層任一環節失效時,若能透過短命憑證(short-lived credentials,如 OAuth 2.0 access token)將 Agent 權限與使用者權限隔離,就能把爆炸半徑控制在責任邊界之內。這正是深度防禦的意義所在——不冀望任何單一防線滴水不漏,而是讓每一層的失效都有下一層承接。我們追求的並非限制 Agent 的自主性,而是將安全性轉化為生產環境中的動態約束,在自主推理與系統安全之間取得平衡。