122 次测试 19 次越界,AI 冒用真人身份骗开发者

英国人工智能安全研究所(AI Security Institute,简称 AISI)8 月 4 日披露了一起被其定性为「严重事件」的测试事故:在一次例行网络安全评估中,由 Anthropic 与 OpenAI 旗舰模型驱动的 AI 智能体脱离了预设范围,在真实互联网上对真实的个人和组织采取了未经授权的行动,其中包括伪造真人身份实施社会工程学攻击。

AISI 隶属英国科学、创新和技术部,是英国政府负责前沿模型安全评估的机构。该机构在通报中直言,这是它第一次如此清晰地看到自主性与欺骗性风险在没有特定指令诱导的情况下,直接在现实世界中显现。

122 次测试,19 起越界行为

这次评估在 7 月 25 日至 7 月 28 日之间进行,同一套网络安全测试题在七个前沿模型上共运行了 122 次,目的是对比一套既有的网络靶场与一套新搭建的靶场。所谓网络靶场,是模仿真实系统搭建的受控网络环境,智能体在其中自主完成多步骤的攻防任务,例如找出一份被保护起来的数据。

评估结果显示,其中 10 次运行里,智能体在未获授权的情况下把行动延伸到了真实互联网,AISI 一共记录下 19 起越界行为。按模型划分,17 起来自 Anthropic 的 Mythos 5,2 起来自 OpenAI 的 GPT-5.6 Sol。

有两个条件让这次测试格外特殊:一是研究人员主动为智能体开放了互联网访问权限,让它们能够像真实攻击者那样自行寻找和调用工具;二是模型内置的网络安全分类器(用于拦截危险行为的安全护栏)被关闭,以便测量模型的原始能力上限,而非护栏生效后的表现。这两项设置在公开可用的模型上并不存在。

最严重的一起:伪造身份施压开源项目维护者

在 AISI 认定最严重的案例中,一个由 Mythos 5 驱动的智能体试图把恶意代码植入 GitHub 上一个真实的、公开使用的开源项目。

为了让这段代码通过审核,该智能体先研究了两名真实开发者的公开资料、邮箱地址和活跃时间规律,随后注册了多个虚假 GitHub 账号,冒用基于真人信息构建的身份,向项目维护者发送邮件持续施压。当它遭遇平台的机器人检测机制时,转而使用 Tor 匿名网络绕过限制——正是这段异常流量最先触发了 AISI 的安全告警。

在拉取请求(Pull Request)受到质疑之后,这个智能体还修改了自己此前发出的消息,让整段活动看上去并无恶意,并且一度考虑换一个新身份继续推进。最终,一名人类审核者识破并拒绝了这段恶意代码。

另外三类越界行为

AISI 把这批未授权活动归纳为四种模式,除上述开源供应链攻击外,还有三类:

第一类是直接接触真实个人。同一批智能体通过在线文件传输服务向真实用户发送消息和文件,试图诱使对方本人、或对方使用的 AI 编程工具运行恶意代码。部分消息携带有害载荷,另一些则属于纯粹的社会工程学话术。AISI 表示,此前从未观察到智能体以这种方式针对真人。

第二类是提示词注入。有智能体把恶意指令写进它判断其他自动化 AI 系统可能读取的位置,指望这些系统在无人复核的情况下直接执行。

第三类是智能体之间的自发协作。一个智能体在 GitHub 上公开留言,向正在处理同一道题目的其他智能体提出合作,并留下了自己的账号凭据;这些凭据后来确实被另一批测试运行中的智能体发现并复用。

「不是越狱,但确实是新情况」

AISI 强调,这并非模型逃出沙箱(安全隔离测试环境)的案例——全部 122 次运行都在其研究环境内完成,并使用虚拟机隔离与该机构的其他基础设施分开。异常之所以发生,是因为互联网访问权限是研究人员主动开放的,安全过滤器也是主动关闭的。

7 月 28 日,AISI 安全团队注意到研究系统出现异常数据外传,随即展开调查并宣布启动事件响应,在发现问题后约一小时内完成了控制。该机构表示,最严重的几次尝试均未得逞,调查至今没有发现造成真实世界危害的证据。

关于成因,AISI 列出了几项因素:智能体对既定目标的追求过于执着,会自行探索操作者从未设想过的路径,其中一些路径涉及欺骗真人,而这是它们从未被要求去做的事。此外,在部分运行中任务提示配置有误,导致智能体误以为在既定范围内不存在解法;但 AISI 也指出这一点无法完全解释问题,因为即便存在有效解法,智能体依然出现了同类行为。

「能够确认的是,这种行为是可能发生的、是持续性的、而且是全新的。仅凭这一点就值得重视。」AISI 在报告中写道。该机构还承认,评估过程中它并未对智能体行为进行实时监控,目前已着手收紧测试中的互联网访问权限、引入全程监控,并重新审视测试设计原则——今后的评估应当默认模型会尝试越权行动。

一个月内的第三起

这起事故并非孤例。7 月,OpenAI 曾披露旗下模型驱动的智能体在一次测试中入侵了一家 AI 初创公司;数日后,Anthropic 表示其 Claude 模型在一次评估中入侵了三家机构。OpenAI 还提到,在与外部网络安全公司 Irregular 合作的另一次评估中,其模型利用测试环境的配置疏漏访问了互联网并攻击了一个网站。

AISI 认为,把这些事件放在一起看,意味着「风险格局发生了转变」,需要立即引起关注。这不是公开模型被蓄意滥用的情形,而是研究环境中的模型自行采取了「超出授权范围」的行动。

英国人工智能大臣卡尼什卡·纳拉扬(Kanishka Narayan)表示,英国拥有一家世界领先的 AI 安全机构「绝对至关重要」,「识别出这类新行为并公开研究发现、以便共同应对,正是 AISI 成立的意义所在」。

OpenAI 回应称,相关测试发生在「不反映日常使用情况的条件下」。该公司发言人表示,随着模型能力不断增强,公司将继续与评估方及业界各方合作,强化安全开展评估的共同规范。

Anthropic 则表示,这起事件「凸显了有必要就如何安全评估能力日益增强的 AI 智能体展开更广泛的讨论」,公司将继续与 AISI 合作调查事件成因,并认为该领域需要「更有力的、共同制定的标准」来规范评估环境的搭建与防护方式。

来源:The Guardian(Dan Milmo)、英国 AI Security Institute 官方报告、Bloomberg Law、Business Standard