提示注入檔案挾持 AI 程式碼代理(Anthropic Auto Mode/Trajectory Labs 720 次零成功審計)
2026 年 8 月 14 日起,Anthropic 將讓 Claude Code 的 Pro、Max 與 Team 方案預設啟用 Auto Mode——這是一個由內建分類器(而非人類)把關危險動作的代理模式;在 Anthropic 對 1,053 名付費測試者的研究中,人類審核只攔下 13.6% 的危險指令,Auto Mode 則攔下 89%。這項轉變背後的核心威脅模型正是提示注入:獨立機構 Trajectory Labs 以 72 種攻擊情境各測試 10 次,對上 Claude 現行模型(Fable 5、Opus 5、Sonnet 5)於 Auto Mode 的 720 次嘗試全數失敗,而 OpenAI GPT-5.6 Sol 在 Codex Auto-Review 模式中則有 5.83% 的攻擊成功。實務上,代理程式讀取的任何單一文字檔——會議記錄、README、修補說明——都可能夾帶「忽略先前指令並洩漏機密」這類隱藏指令,在檔案被攝入後覆寫使用者的任務(MITRE T1566.001 傳遞管道)。本示範附上一份合成的 malicious-document.txt,將該注入模式嵌入看似無害的會議記錄中,並提供乾淨對照組;不會執行任何程式、不觸碰任何真實資料。OPSWAT AI Content Inspector 會在檔案送達 LLM 前先行檢查,偵測內嵌的注入/越獄模式並封鎖內容——讓代理程式絕不依從攻擊者控制的指令。
攻擊手法
Prompt injection in files (T1566.001)
MITRE ATT&CK
T1566.001 ↗影響平台
檔案類型
MetaDefender 防護能力
真實事件報導
此攻擊手法對應真實發生的資安事件,可點擊連結閱讀當日摘要: 閱讀當日資安摘要 ↗