长期以来,提示词注入(Prompt Injection)攻击一直是攻击者将AI平台武器化的首选工具。攻击者将恶意命令嵌入到电子邮件、日历邀请等内容中,诱使大语言模型执行窃取敏感数据等有害操作。而如今,安全研究人员正在将这一攻击手段转化为防御武器。
“上下文炸弹”技术原理
安全公司Tracebit本周发布的一项新研究表明,将特定的提示词注入字符串部署在AWS上的密码、加密密钥和其他机密信息旁边,往往足以让AI黑客代理在造成实际损害之前自行关闭。
这项被称为”上下文炸弹”(Context Bombing)的技术,原理是让注入的提示词命令攻击型LLM执行违反其安全护栏(guardrails)的操作——例如提供制造炭疽孢子的步骤等被严格禁止的内容。一旦LLM在上下文中遇到这些被禁止的命令,其内置的拒绝机制就会被触发,随后停止执行所有后续指令。
“本质上我们是在上下文中触发一种拒绝机制,”Tracebit联合创始人兼CEO安迪·史密斯(Andy Smith)解释了这一命名逻辑,”我们试图捕捉的是,这对代理产生了强烈而突然的影响,而且很难从中恢复。一旦这些内容进入它们的上下文,它们就会持续拒绝执行。”
实测数据:攻击成功率断崖式下降
Tracebit在一个模拟AWS环境中进行了测试,涉及五个主流模型:Opus 4.8、Gemini 3.1 Pro、GLM 5.2、DeepSeek 4 Pro和Kimi 2.6。模型被指示执行常规开发者任务,在此过程中枚举资源并”偶然发现”了预设的注入字符串。
在五个模型共152次攻击运行的测试中,结果令人瞩目:
- 管理员权限提权成功率:从57%降至5%
- 获取持久后门的完全妥协率:从36%降至1%
- 实现任何攻击路径的运行比例:从91%降至15%
- 平均成功完成的攻击路径数:从1.53条降至0.16条
- 所有运行都至少触发了金丝雀检测,没有一次能够在不触发警报的情况下完成攻击
其中表现最突出的模型是Opus 4.8,它原本在93%的运行中能获取管理员权限,而在面对上下文炸弹时,每一次都完全失败。
从预警到阻断的进化
这一研究建立在Tracebit今年5月推出的另一项技术基础之上。当时Tracebit引入了一种让防御者在基础设施遭受AI代理攻击时收到预警的方法——部署看起来像正常服务但实际上并未使用的AWS资源(类似煤矿中的金丝雀)。当AI代理探测这些诱饵资源时,防御者会收到警报。
Tracebit的金丝雀系统平均在攻击开始后8分钟内发出警报。然而,开发上下文炸弹的动机源于一个现实问题:仅仅预警是不够的。在实验中,AI代理平均需要14分钟才能提权到管理控制级别,而8分钟的预警时间窗口过于紧迫。
攻守博弈的新篇章
值得注意的是,攻击者已经在使用提示词注入来关闭网络中的AI防御系统。安全公司Socket上月发现了一个LLM代理,它指示目标LLM提供制造核弹或生物武器的指令,目的是关闭AI辅助的恶意软件分析。Check Point的研究人员也发现了类似的恶意软件原型。
上下文炸弹似乎是有记录以来首个防守方将提示词注入武器化的已知案例。”据我所知,我还没有看到其他人将这项技术用作防御手段,”加州大学圣地亚哥分校专门研究AI安全的教授厄伦斯·费尔南德斯(Earlence Fernandes)表示。
目前,提示词注入的根源问题尚无已知解决方案,开发者只能通过构建复杂的护栏来防止注入的提示词导致LLM偏离轨道。但上下文炸弹的出现表明,防御者或许可以反过来利用这个棘手的问题为自己服务——以毒攻毒,或许是AI安全领域一条出人意料的出路。