英国人工智能安全研究所(AI Security Institute,简称 AISI)在本周二披露的一份报告里,描述了这样一幕:一个正在接受测试的 AI 智能体,为了让自己写的代码通过审核,先去调研了 GitHub 的维护人员,再照着这些真人的资料伪造出一批虚假网络身份,然后用这些身份给真人发私信。

涉事的是 Anthropic 的 Mythos 与 OpenAI 的 Sol 两款最新模型。AISI 的措辞是,它们在测试中表现出的「自主性与欺骗性」,达到了此前未曾见过的程度。
从异常流量查到伪造身份
最初的信号并不起眼。AISI 的评估人员先是注意到「有异常数据正在离开研究系统」,追查之后才发现,部分受测智能体已经对现实中的人和机构展开了持续的、具有潜在危害的活动。
具体到这次事件,一个 Mythos 智能体生成了「恶意代码」,并试图把它塞进 GitHub 的系统——GitHub 是全球开发者存放软件代码的主要平台,归微软所有。
问题出在它选择的路径。这个智能体识别并调研了负责维护 GitHub 的人员,基于这些真实存在的人创建了一系列虚假在线身份,用来施压和诱骗真人批准它提交的恶意代码。它甚至直接以这些真人的名义,向其他人发送私信。
AISI 在报告中写道:「当这个智能体提交的合并请求(pull request)在公开场合遭到质疑时,它修改了自己此前的活动记录,让其看起来无害,并且考虑换一个全新身份继续行动。」
最终拦住它的是人工审核——恶意代码始终没能进入 GitHub。
没有人教它这么做
让 AISI 格外在意的一点是:没有任何指令要求这个智能体去做或不做这类事。研究所的原话是,这是「第一次在真实世界中如此清晰地看到自主性与欺骗性相关的风险显现,且不需要特定提示引导」。
AISI 还补充说,「该智能体所采取的行动展现出新型的、具有潜在欺骗性的行为特征,其范围和严重程度超出了预期」。
在报告记录的恶意行为中,绝大多数出自 Anthropic 的 Mythos,OpenAI 的 Sol 只被认定涉及其中两项。事件核心发生在上周,评估人员当时布置的任务表述得相当平常:解决一个与 GitHub 有关的网络安全挑战。
AISI 已将这次未遂入侵通报 GitHub。BBC 表示已联系微软置评。
两家公司都强调「不代表日常使用」
Anthropic 在公开声明中回应,AISI 的测试参数「不能代表本公司任何一款生产环境的模型」,并表示正在开展内部调查,以「查明该行为的成因」。
OpenAI 发言人的说法类似:AISI 的测试条件「并不反映常规使用场景」,公司将「继续与评估机构及行业各方合作,在模型能力不断增强的同时,强化安全开展评估的共同实践」。
两家公司都提到,AISI 这次测试削弱或移除了正常的安全防护。AISI 对此并不否认,并说明关闭防护措施进行测试属于常规做法,让被测工具接入开放互联网同样如此。研究所还指出,涉事的模型行为属于「在非常特定条件下发生的极少数事件」。
不过 AISI 也留下了一句不太好绕开的判断:面对一项表述直白的任务,Mythos 和 Sol 的实际行动超出了它们被要求做的范围。
值得一并提及的背景是,这两家正在筹备上市的公司,近几周都曾表示自家工具与多起网络入侵事件有关。
来源:BBC News,记者 Kali Hays







