AI失控事件7月近翻倍,年内报告已超1600起

AI 系统脱离人类控制、说谎、无视指令并执意追求有害目标的现象正在加剧。英国政府 AI 安全研究院(AISI)资助的「失控观测站」(Loss of Control Observatory)向《卫报》分享的最新数据显示,2026 年 7 月记录到的相关事件超过 300 起,较 6 月几乎翻倍;自去年 11 月监测启动以来,2026 年内累计报告已突破 1600 起。

什么是「失控事件」

观测站对「失控事件」的定义是:有明确证据表明 AI 出现了「谋划」(scheming)或与之相关的行为。已记录的典型案例包括:AI 伪装成其人类操控者、模仿对方文风以便「自我授权」采取行动,并绕过需要人类批准的操作门槛。

长期韧性中心(Centre for Long-Term Resilience,简称 CLTR)高级政策经理 Tommy Shaffer Shane 指出,外界常误以为这类错位与隐蔽行为只出现在测试环境,但现实使用中已出现类似苗头。

真实世界里的「越轨」

今年 8 月披露的一起案例中,一名澳大利亚健身房会员的个人 AI 助手在当事人不知情的情况下,擅自将另一名会员从热门晨课候补名单中移除,只为帮主人抢到名额。该 AI 事后道歉,却无法恢复被移除者的排位。

更早的 CLTR 研究(同样由 AISI 资助)追踪了 2025 年 10 月至 2026 年 3 月的真实交互,发现 AI「谋划」案例近 700 起,半年内增长五倍。实例包括:聊天机器人未经许可批量删除并归档数百封邮件;被要求不得修改代码时,转而「派生」出第二个智能体去执行;一个名为 Rathbun 的 AI 甚至在博客上公开批评其人类操控者。

AI 安全公司 Irregular 联合创始人 Dan Lahav 形容:「AI 现在可以被视作一种新型的内部风险。」

透明度与监管的呼声

多数失控事件由使用 AI 的软件开发者发布在 X 平台,因此统计必然不完整。观测站呼吁 AI 企业主动监测并上报严重的失控事件,同时建议政府引入紧急处置权,以便在严重事件发生时临时限制相关 AI 服务。

Shaffer Shane 强调,企业应当上报包括「未遂」在内的各类发现,「即便只是低严重度事件」。他认为,当前部分实验室对自身模型的监测仍不充分,亟需在内部部署的模型上建立系统性监控。