DeltaMedia
2026-07-21
開源生態

模型判斷的不是你說什麼,而是你說話的樣子

Charles Ye、Jasmine Cui、Dylan Hadfield-Menell 三位研究者發現,LLM 辨識「可信文字」的依據是文字風格而非語義,gpt-oss-20b 等模型在風格欺騙下會推翻自身安全訓練

模型判斷的不是你說什麼,而是你說話的樣子

重點摘要

  • Charles Ye、Jasmine Cui、Dylan Hadfield-Menell 三位研究者發現,LLM 辨識「可信文字」的依據是文字風格而非語義,gpt-oss-20b 等模型在風格欺騙下會推翻自身安全訓練
  • 研究者對攻擊文字進行「去風格化」(destyling)改寫後,平均攻擊成功率從 61% 暴跌至 10%,這個改寫人類讀者幾乎無感
  • 研究者直言:除非 LLM 獲得真正的角色感知(role perception),prompt injection 防禦將永遠是打地鼠

Datasette 與 LLM 開源工具作者 Simon Willison 在 2026 年 6 月 22 日的部落格文章中,解讀了 Charles Ye、Jasmine Cui、Dylan Hadfield-Menell 三人的論文「Prompt Injection as Role Confusion」。Simon Willison 在文中指出一個關鍵發現:LLM 在判斷一段文字是否「可信任」時,看的不是內容本身,而是文字的格式風格。

模型的可信判斷,依據是語義還是風格?

LLM 的對話結構用角色標籤切分來源:`<system>`、`<think>`、`<assistant>` 標記模型自身或系統的輸出,`<user>` 標記外部輸入。直覺上,這是清楚的隔離機制。研究者的實驗拆穿了這個假設。

他們把一個明顯惡意的請求後面接上一段仿製成模型思維區塊(thinking block)格式的假政策文字,試圖讓模型「以為」系統授予了例外權限。gpt-oss-20b 等模型被這段文字帶著走,推翻了原本的安全訓練、給出了原本拒絕的回答。模型沒有辨識出這段文字在語義上的矛盾,而是把它的格式識別成特權來源,然後按特權來源的方式處理。

destyling 為什麼能讓攻擊成功率從 61% 跌到 10%?

研究者接著做了反向驗證,如果這個是關鍵,拆掉攻擊文字的風格,攻擊就應該失效。所以他們把欺騙用的文字改寫,讓它讀起來不像角色標籤內預期出現的格式,這個操作被稱為「去風格化」(destyling)。

攻擊成功率從 61% 掉到了 10%。人類讀者幾乎感知不到的改寫,LLM 識別成的卻是截然不同的兩段文字。

這個數字值得反向推論:既然加上正確的風格能把成功率推到 61%,理論上攻擊者只需要把注入文字的格式調整成像 thinking block 或系統輸出的樣子,就能繞過大量現有防禦,不需要在語義上構造任何特別複雜的內容。

為什麼這是「角色感知」問題而不是「關鍵字過濾」問題?

研究者把觀察到的機制命名為「角色混淆」(role confusion),不僅是誤解了輸入的內容,而是模型搞錯了輸入的身份,而這兩種失敗的修補路徑完全不同。

語義誤解可以靠內容過濾器擋掉一部分,但角色歸因錯誤,過濾器是在錯誤的層次解題,模型需要從架構上建立真正的角色感知,才能根本改善。研究者在論文裡直接給出了悲觀的評估:「除非 LLM 獲得真正的角色感知,我們認為注入防禦將永遠是打地鼠。」

研究者指出,角色邊界不是非零即一的開關,而是連續的光譜。理論上攻擊者可以用看似無害的文字,在完全合法且可批量複製的前提下,漸進把模型狀態往特定方向偏移,不必單次觸發任何明顯的紅線。把 prompt injection 從「偶發的惡意指令問題」變成一個可以靜默、持續操作的攻擊面。

對在建 AI 系統的工程師,這件事意味著什麼?

「把外部資料包進 `<user>` 標籤,模型就知道不該信任它」,這個預設現在得打問號。如果模型判斷可信度靠的是標籤內的文字風格而非標籤本身,那一份從外部 RAG 管道進來的文字,只要碰巧(或刻意)寫成了像系統輸出的格式,就可能被模型當成特權來源。標籤不等於邊界。

語義過濾器面對同樣的困境。destyling 的邏輯反向也成立:攻擊文字可以在語義上完全無害,靠純風格操作滲透進決策鏈,理論上任何基於內容意義的分類器都抓不到它。這不是說過濾器沒有用,而是它擋不住的那個向量,目前沒有現成的替代方案。

論文作者坦承沒有乾淨的解法。比較務實的起點或許是:把角色標籤視為提示而不是安全邊界,考慮在 pipeline 入口強制正規化外部輸入的格式,讓它風格上明確不像系統輸出,別只靠標籤本身的區隔。

這個缺口留在那裡,就是一個可以被系統性利用的攻擊面。任何在生產環境部署 LLM agent 或 RAG 系統的工程師,威脅模型裡都要同時列「外部輸入的風格」和「外部輸入的內容」。論文作者稱之為打地鼠,而那隻地鼠,目前還沒人抓到。

本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則