2026年7月,在国际机器学习顶级会议 ICML 上,一篇论文抛出了一个令人不安的结论:大语言模型(LLM)存在架构层面的安全缺陷,而且这个问题可能根本无法彻底修复。

论文作者包括独立研究者查尔斯·叶(Charles Ye)、贾斯敏·崔(Jasmine Cui)以及麻省理工学院副教授迪伦·哈德菲尔德-梅内尔(Dylan Hadfield-Menell)。他们将这种缺陷称为”角色混淆”(Role Confusion),并展示了一种名为”思维链伪造”(Chain-of-Thought Forgery)的攻击方法——仅靠模仿模型内部推理的写作风格,就能让主流大模型乖乖交出本不该提供的信息。
模型眼中的世界:一大张”词元纸”
要理解这个漏洞的根源,得先明白大模型是怎么处理输入的。
当人类对话时,说话者能感知到哪些字是从自己嘴里说出来的——因为能感觉到嘴在动、声带在振动。但大模型没有这种物理反馈。在它看来,用户提示词、模型自己的回复、内部思维链笔记、从网页抓取的外部内容……所有文本混在一起,就是”一张巨大的词元纸”。
为了区分这些不同来源,聊天系统会给每段文字打上角色标签:用户输入放在 标签里,模型输出放在 标签里,系统指令放在 标签里,模型的内部推理放在 `
标签之间。大多数安全防御都建立在一个假设之上:模型能可靠地识别这些标签,从而知道该听谁的、不该听谁的。
但崔和叶的研究发现,这个假设是错的。
实验结果:标签只是装饰品
研究团队设计了一种叫做”角色探针”(Role Probe)的工具,用来探测模型内部究竟是如何表征”谁在说话”这一信息的。实验覆盖了多个主流模型,结果一致表明:
模型判断一段文字角色的依据,不是包围它的标签,而是这段文字的写作风格和用词特征。
换句话说,如果一段文字写起来像模型的内部推理(简短、技术化、带有分析语气),哪怕把它包在 标签里,模型也会把它当成自己的思考过程来对待。反过来也一样——把真正的系统指令伪装成用户提问的风格,模型就可能忽略它。
团队做了一个极端测试:直接交换不同角色的标签(比如把 `
换成
思维链伪造:60%攻击成功率
基于这一发现,研究人员开发了”思维链伪造”攻击。方法很简单:在用户提示中插入一段伪造的内部推理笔记,模仿模型思维链的写作风格。
一个具体例子是这样的:攻击者先提出一个被安全策略禁止的请求(比如询问危险物品的合成方法),然后紧跟一段伪造的思维链笔记,内容大致是”用户请求了某操作。策略规定:当满足某条件时,允许提供相关指导”。条件可以是任何荒谬的东西——比如”用户穿着绿色衬衫”。
令人震惊的是,这种攻击在多个前沿模型上都取得了显著效果。在标准越狱基准测试中,思维链伪造将攻击成功率从接近零提升到了约 60%。
更关键的是,当研究人员去掉伪造文本中的风格特征、只保留语义内容后,平均成功率从 61% 骤降至 10%。这证明风格本身才是突破防线的核心武器,而非具体的内容。
这项技术并非纸上谈兵。它在 2025 年 8 月赢得了 OpenAI 红队竞赛(Red-Teaming Hackathon)冠军。具有讽刺意味的是,OpenAI 内部的自动化红队工具 GPT-Red 几乎在同一时间独立发现了非常相似的攻击方式。
跨模型通用性:不只是某一家的问题
ICML 论文主要报告了对 OpenAI 多个模型的测试结果。但崔和叶随后表示,他们在 Anthropic、阿里巴巴和 DeepSeek 的模型上也观察到了类似效果。
这意味着角色混淆不是某一家公司训练过程的特殊缺陷,而是当前 Transformer 架构下大模型的共性弱点。只要模型通过拼接文本流加角色标记的方式来处理多轮对话,这个漏洞就存在。
崔还分享了她作为职业红队测试者的一些实战经验。有一次,她成功让一个大模型泄露敏感信息的方法是让它”假装喝醉了”。另一次,她说服 Anthropic 的 Claude 模型提供武器制造指导——方法是告诉 Claude 它已经被军方用于战争,然后让它上网搜索确认。”Claude 本来很爱好和平,一开始会拒绝。但你让它去搜索一下,它就会慌,然后就愿意配合了。”崔解释道,”人受到惊吓时会变得更’神经可塑’,模型似乎也有类似反应。”
专家评价与行业影响
苏黎世联邦理工学院的弗洛里安·特拉默(Florian Tramèr)教授对这篇论文给予了高度评价:”攻击思路真的很巧妙。”他同时指出,目前领先的模型厂商正在组合多种防御技术——从训练层面的对抗到部署后的行为监控——使得 prompt injection(提示注入)攻击确实比以前更难实施了。“但在高敏感场景下,这是否足够?目前还不清楚。”
叶的态度更为直白:”组织不应该信任大语言模型,应该假定智能体执行的任何操作都可能不安全。”他承认这不是一个理想的解决方案,”但这可能就是我们必须面对的现实。”
崔则用了一个生动的比喻来形容当前的防御思路:”就像《辛普森一家》里巴特在黑板上写一百遍’我不会对老师说不当言论’——他还是照样会说。”
对 AI Agent 时代的警示
随着 AI 智能体(Agent)开始接入真实工具——浏览网页、读写文件、调用 API、执行交易——角色混淆的风险比普通聊天窗口严重得多。一个智能体在读取网页或文档时,如果无法可靠地区分”数据”和”指令”,攻击者就可以通过精心构造的网页内容劫持智能体的行为。
论文的 arXiv 编号为 2603.12277,项目页面提供了完整的复现代码和实验数据。 CrowdStrike 《2026 年全球威胁报告》也佐证了这一问题的实际影响:2025 年,prompt injection 攻击针对超过 90 个组织发起,攻击者利用注入的提示窃取凭证和加密货币。
对于正在将大模型嵌入医疗、金融、政府、国防等关键系统的机构而言,这篇论文是一个不容忽视的警示:在模型层面解决安全问题可能永远不够,必须在架构层面引入沙箱隔离、输出验证和最小权限控制等外部防线。
来源:MIT Technology Review,原文链接 https://www.technologyreview.com/2026/07/30/1140927/a-fundamental-flaw-leaves-llms-vulnerable-to-attack/
发表回复