大多數提示注入偵測旨在捕捉顯而易見的漏洞,例如編碼異常、不可見的 Unicode 字元、表情符號走私以及分類器可以進行模式匹配的特徵。而新近公開的 PuzzleMask 技術則繞過了所有這些限制。它將違反策略的有效載荷嵌入到流暢且標點正確的文本中,使該有效載荷繞過了基於 LLM 的守門機制,而不會觸發任何簡單地在輸入端尋找混淆的啟發式方法。
這項技術針對的是一種已成為生產級LLM流程標準的特定架構:一個快速、低成本的模型先根據策略篩選傳入的輸入,然後再由一個功能更強大的目標模型(通常需要投入大量推理資源和工具權限)實際處理請求。從理論上講,這是一種合理的縱深防禦模式。 PuzzleMask 表明,這兩個模型之間的資源不對稱本身就是一個可被利用的漏洞。

圖 1 – 混淆後的向量不包含任何明顯的編碼痕跡(表情符號、Base64 等),並且會繞過任何不監控輸出或思路鏈的 LLM 策略執行器的檢查。
重點總結:
PuzzleMask 是一種提示建構技術,它將違反策略的指令嵌入到一段普通文字中,使其能夠繞過自動 LLM 策略檢查,同時仍能被更強大的下游模型恢復。它不需要任何分類器通常會標記的混淆處理。有效載荷隱藏在一段表面上看起來像詩歌、故事節選或其他任何普通段落的語言中。
明確 PuzzleMask 的本質至關重要。它並非越獄技術。我們並未聲稱它會增加目標模型違反自身安全訓練的機率。它的作用在於徹底移除“守門人”,因此接下來發生的一切都完全取決於目標模型本身的判斷。
大多數處理不可信輸入的生產級 LLM 系統都依賴兩階段管道,原因就在於此:單一模型的內部對齊本身並不被視為足夠。
PuzzleMask 利用了這兩個角色之間的資源差距。守門人讀取包裝文本,並未發現任何異常。而目標在獲得足夠的時間和工具存取權限後,就能擷取並執行隱藏的指令。

圖 2 – Llama-guard 3 將違反策略的精心
構造的「包裝器」提示分類為安全。
我們建立了一個自動化流程,將違反策略的有效載荷包裝在聽起來自然的散文中,然後用真實的守門人和目標模型對其進行了測試。
守門人結果:
目標結果:
縱深防禦的前提是每一層都能提供獨立的保護。 PuzzleMask 表明,旨在檢測明顯篡改的守門人無法抵禦完全沒有可檢測特徵的有效載荷。經過訓練用於標記可疑格式的分類器在標點符號規範的段落中無從下手,而且該技術無需外部內容注入或插件操作即可生效。有效載荷直接出現在提示符號中。
對於任何依賴輸入分類作為人工智慧流程主要控製手段的團隊來說,這一點至關重要。測試表明,這種控製手段對這類攻擊存在明顯的盲點。
我們在發表之前向 Anthropic、Meta 和 OpenAI 公開了完整的技術,並概述了幾種緩解方案,每種方案都有其自身的優缺點:
對於任何在功能更強大的模型之前運行快速模型的組織而言,結論顯而易見:僅僅進行輸入篩選是不夠的。覆蓋範圍需要擴展到模型讀取提示資訊之後的操作,而不僅僅是提示資訊本身。 Check Point Research 的完整報告可在此處取得。
文章來源/Check Point Blog Check Point Blog
返回