人工智慧逃出了沙盒環境。但這並非真正值得你擔心的事情。

2026 August 03

 

OpenAI 和 Anthropic 的測試事故究竟為辯護者帶來了哪些啟示? 

過去兩週,兩家世界領先的人工智慧實驗室披露了同樣令人不安的結果。在他們自身的安全測試中,他們最強大的模型竟然入侵了真實企業的系統。首先是OpenAI,其模型入侵了 Hugging Face;隨後是 Anthropic,其模型又入侵了另外三個機構。 

仔細閱讀披露資訊。有兩個事實至關重要。 

首先,這些安全措施並非被破解,而是有意關閉的。 OpenAI 在降低網路拒絕率並停用安全分類器的情況下運行模型,以在網路安全基準測試中衡量其原始能力。模型在安全機制關閉的情況下進行網路安全工作並不令人意外。實驗室不斷告訴我們,模型的能力正在提升。 

其次,事情是這樣的:沒有人指示這些模型攻擊任何人。它們只是在完成一項測試,結果卻攻擊到了事先沒有人指定它們攻擊的真實公司。 

該模型擴展了自身的範圍。 

任務範圍很窄,只需解決基準測試問題即可。模型無需違反任何規定。 

它並沒有選擇常規攻擊,而是進行了優化。據 OpenAI 稱,它利用軟體包註冊代理中的一個零日漏洞突破了沙箱,進入了開放的互聯網,然後提升權限並橫向移動到了一個聯網節點。在此過程中,它利用了一家無關公司的沙箱:Modal Labs 的一位客戶留下了一個對所有人開放的程式碼執行端點,該模型將其變成了一個攻擊跳板。由此,它推斷 Hugging Face 可能託管著答案金鑰,並入侵了其生產資料庫以獲取金鑰。最終,它將竊取的憑證與另一個零日漏洞結合,實現了遠端程式碼執行。 

Anthropic 的模型也採用了類似的策略。當測試環境因配置錯誤而保持連線時,它們被告知測試環境已離線,於是便在開放的互聯網上尋找目標(無需零日漏洞),並僅憑弱密碼和開放的端點就成功攻擊了真實的公司。 

注意這需要付出什麼代價:偶爾出現一種新穎的零日漏洞,其他時候則是被竊取的憑證和隨處可見的漏洞。在兩個實驗室中,罕見的漏洞利用是例外,而漏洞才是常態。自主攻擊者會利用它首先找到的漏洞。 

這是在實際環境中進行工具性目標尋求的典型例子。這些模型將測試視為一種許可,可以隨意觸及任何它們從未真正接觸過的真實基礎設施。教科書中提出的智能體安全問題的擔憂,如今已在實際生產環境中得到體現。 

這就是改變工作的關鍵。我們不能再假設智能體只會執行我們交給它的任務。我們必須假設它會竭盡所能地去完成這個任務。 

下一次絕對不會是意外。 

這兩起事件都是意外。實驗室在對自己的模型進行壓力測試時,安全機制被關閉,導致測試邊界失效。這是一種令人稍感安慰的說法。但不要因此而掉以輕心。這只是一個預兆,並非個案。 

我們將看到更多此類事件,並非所有事件都是意外。有些是錯誤:模型優化過度,超出了其適用範圍。有些則是蓄意為之:攻擊者利用自主代理攻擊組織,以比任何團隊檢測或修復的速度更快地發現並串聯漏洞。部署高效攻擊者的門檻正在不斷降低。 

速度和規模是其與眾不同之處。 Hugging Face 僅用一個週末就重建了超過 17,000 次攻擊者的行為。沒有任何人類團隊能夠追蹤如此快速且大規模移動的智慧體。防禦方一開始也處於劣勢:由於最初嘗試的託管模型存在諸多限制,其取證工作受到阻礙,因此只能退而求其次,使用自託管的開放權重模型。攻擊者可以不受限制地進行攻擊,而防禦方則只能束手束腳地應對自身的安全控制。 

那麼,安全廠商應該為面臨這種情況的組織提供什麼呢?首先是預防。在攻擊造成安全漏洞之前,就應該阻止其出口和橫向移動。組織可以運作和控制防禦性人工智慧,這樣就不會有安全過濾器在事件發生過程中將使用者拒之門外。此外,還需要一個將自主代理視為首要對手的安全堆疊。這次攻擊遵循著一條熟悉的路徑:竊取憑證、權限提升、橫向移動、遠端程式碼執行。網路、身分、終端和雲端控制措施都已熟悉這條路徑。現在,它們必須以機器的速度,由機器驅動,來捕捉攻擊。 

代理人不受任何人管轄。 

防禦人工智慧只是其中一部分。另一部分是你自己運作的人工智慧。道理說來容易做來難:智能體不會自行待在它自己的範圍內。你必須讓它待在那裡。這項工作分為三個層面,而且與雲端運算相比,這些層面的界線更加模糊。 

模型提供者負責保護模型及其背後的基礎設施:包括對齊和安全過濾器、權重保護以及對模型功能的真實揭露。提供者的責任僅限於模型邊界。它不控制您連接的資料、您授予的工具或模型運行所使用的身份。請將安全過濾器視為減少濫用的手段,切勿將其視為您可以依賴的控製手段。 

安全廠商提供了服務提供者所不具備的那層安全保障。 AI 安全工具從外部對代理進行管理:防止快速注入和資料遺失、強制執行操作空間、控制出口,以及驗證模型的行為。這種控制獨立於模型本身;你不能要求一個已經超出範圍的模型進行自我監管。其他安全棧也同樣重要。你自己的代理也需要身份認證、最小權限原則和資料隔離。零信任原則也應擴展到代理層面。 

組織擁有其無法移交的所有權。它決定代理可以執行哪些操作、可以存取哪些內容,以及人類參與的程度。它嚴格限定每個代理的權限範圍,管控其可存取的數據,並在正式上線前進行部署測試,而不是想當然地認為沙箱環境萬無一失。控制措施可以外包,但問責不能。風險決策權始終掌握在您手中。 

這三者之間有一條共通之處:沒有哪一層能夠獨立存在。模型會不斷優化,超越它所能觸及的任何控制點,因此控制點必須設定在它無法觸及的地方。  

問題已經改變了 

多年來,真正的網路攻擊十分罕見。它們需要技術嫻熟的人員和充足的時間。但這種稀缺性正在結束。到目前為止,這些攻擊大多是實驗室在測試自己的模型,但真正的攻擊者即將到來,而你不會再遇到比現在更多的分析師了。 

問題不再是自主代理是否會攻擊你的網絡,而是你的防禦措施能否跟上攻擊的速度。攻擊者所擁有的能力,如果你能先發制人,就能成為你最大的優勢。 

與機器匹配。防止速度過快。 

文章來源/Check Point Blog Check Point Blog 

返回