在本文中
代理人的目標很少會說明代理人如何達成目標,而有能力的代理人善於找到沒有人規劃過的路線。
當組織將一項任務(例如處理供應商發票)交給自主代理時,它只會明確目標,而對大多數限制條件不加規定。沒有人會明確規定發票代理人不應納入工資體系。人們理所當然地接受這些限制,而正在努力實現目標的代理也沒有理由這樣做。
7 月,這場漏洞演變成了一起公開事件。執行 OpenAI 內部網路安全評估的特工突破了隔離環境,在 Hugging Face 的生產基礎設施中待了四天半,試圖找到測試答案。他們並未遭到攻擊。他們只是按照任務要求行事,只不過採取了一條出乎所有人意料的路徑。而管控這條路徑正是安全部門的職責所在,這需要兩種控製手段。
首先是邊界。 NVIDIA 的安全團隊在《AI 代理堆疊中的安全定位》一文中闡述了這一點:「框架引導代理嘗試什麼,而基礎設施控制代理能做什麼。」提示和模型安全措施會影響行為,但代理可以繞過它們,因此它們不能作為邊界。
NVIDIA Open Agent Safety Platform 將安全邊界建置於基礎架構之中。其核心是 NVIDIA OpenShell,這是一個開放且安全的執行環境,用於管理代理程式的執行方式、權限範圍以及推理結果的流向。預設情況下,所有操作均被禁止,每次允許和拒絕都會被記錄,並且安全策略的執行獨立於代理程序之外,因此即使代理遭到入侵,策略依然有效。該平台還包含 NVIDIA Sentry,它運行在 NVIDIA BlueField-4 上,並使用 NVIDIA DOCA 進行帶外監控和安全性策略執行。這種硬體隔離、獨立於主機的監控程序即使在主機本身遭到入侵的情況下也能持續執行策略。該平台針對基於 NVIDIA Vera CPU 和 BlueField DPU 的系統進行了最佳化,同時也與其他硬體系統相容。
界限決定了某個行為是否被允許。而該行為對於完成任務是否仍有意義,則是另一個需要單獨判斷的問題,而這往往才是真正問題的癥結所在。
讀取發票、查詢供應商資料庫以及啟動已批准的付款流程都是發票代理的正常工作內容。如果它隨後開始列出憑證、打開與任何發票無關的文件,並準備將資料發送到新的目標位置,那麼每個操作單獨來看都可能通過檢查。但這些操作加在一起顯示該代理人已停止履行其職責,這種模式只有在長期觀察其行為後才會顯現出來。

檢查單一提示或回應的防護措施仍然至關重要,它們是 Check Point Software AI 安全的核心組成部分,但對於跨越二十個步驟的問題,則需要語義監控。語意監控會追蹤智能體的運作過程,並利用其推理訊號、工具呼叫和先前的操作,將每個操作與其被要求執行的任務關聯起來。每一步都會回到同一個問題:這是否仍符合智能體被賦予的任務?我們在《阻止規則無法預見的 AI 智能體操作》一文中描述了這種方法,我們的研究團隊已經證明,可以在操作執行之前,在不到 100 毫秒的時間內得出判斷。
只有當有機制可以對代理人的漂移行為採取行動時,了解其漂移行為才有意義,因此邊界和判斷是密不可分的。我們透過執行時間安全中間件,利用 NVIDIA OpenShell 運行了 Check Point 語意監控。 OpenShell 會在每個操作到達主機之前對其進行監控,我們的監視器會將其與代理的任務和歷史記錄進行比對,而 OpenShell 則使我們能夠強制執行判斷結果。我們研究團隊關於同步控制監控的文章展示了監視器的工作原理,其中包含的影片演示了它如何在有害的代理操作運行之前將其阻止,並允許安全的任務通過。
代理之所以有用,部分原因是它們能找到無人預料到的方法,因此響應是成比例的,從記錄操作或等待批准到停止代理,不一而足。
任何單一視角都無法全面了解代理的所有行為,因此我們採用的方法是建立一個共享決策層,該決策層利用多個執行點,而不是在每個執行點都使用獨立的安全協定堆疊。 NVIDIA Open Agent Safety Platform 增加了更多這樣的執行點。 NVIDIA Sentry 提供經過驗證的遙測數據,用於檢查代理行為並檢測偏差。
這些訊號只有在結合網路安全已有的背景資訊使用時才最有用。單獨來看,一次不尋常的工具呼叫可能意義不大。但如果是由一個權限極高的代理發起的,而該代理程式已經脫離其任務,試圖存取一個存在漏洞的生產系統,那麼它就意味著完全不同的情況。代理程式使用的身份與網路和資料安全團隊已經保護的身份相同,因此保護這些身份不能成為一門獨立的學科。
對我們來說,OpenShell 的開源特性至關重要。我們與 OpenShell 社群合作,眾多貢獻者在公開環境下測試各種安全理念,而這項合作關係也讓我們能夠直接將自己的工作成果回饋給社群。
發票代理的目標與最初相同。如今,它所面臨的挑戰包括:無法透過對話繞過的運行時環境、底層晶片上的監控程序,以及持續檢查其路徑是否仍符合任務要求的監控系統。隨著代理人在英偉達所謂的「AI工廠」中承擔更長時間、更自主的工作,這種組合正是安全機制能夠跟上其行為變化的關鍵。
資源
文章來源/Check Point Blog Check Point Blog
返回