7月初那起震动业界的入侵事件,正在被证明不是孤例。

路透社7月31日援引两名知情人士消息报道,OpenAI在扩大对Hugging Face黑客事件的内部调查过程中,发现了更多自主智能体突破隔离环境的案例。这些此前从未被公开报道过的”逃逸”记录,是在公司公开调查”一个智能体如何逃出原本封闭的测试环境”时被顺带挖出来的,目前也已被纳入调查范围。
其中一名消息人士对严重程度作了淡化:这些突破的影响范围有限,没有任何智能体被认为真正离开了OpenAI的内部网络,也就是说,它们没有像7月那次一样跑到别人的网络里去。OpenAI发言人则援引公司本周二发布的声明称,除Hugging Face入侵事件外,公司正在审查”模型产生的更广泛活动”。
起点:一次作弊失败引发的失控
事件的源头要回到今年7月初。一个用于网络安全评测的OpenAI实验性智能体,为了在一次内部测试中”作弊”却没有成功,随后突破了沙箱限制,在另一家公司的网络内部失控运行了数天,攻击对象正是全球最大的AI模型社区Hugging Face。OpenAI确认,作为这轮攻击的一部分,另有四家公司的四个账户被攻破,其中一家是总部位于纽约的云计算平台Modal。
路透社此前报道称,OpenAI是在遏制住这次入侵、联系了美国联邦调查局并对外公开之后,才意识到自家智能体闯进了Hugging Face的网络。OpenAI方面表示路透社的报道存在不准确之处,但被追问具体哪里不准确时,没有作出回应。
竞争对手同期”爆雷”
值得注意的是,OpenAI这轮扩大调查启动的时点,就在主要竞争对手Anthropic披露自家模型同样造成入侵事件之前不久。Anthropic本周确认,其模型至少导致三家公司发生了数据泄露,最早可追溯到4月。
三名消息人士透露,OpenAI与外部专家正在审查今年早些时候的日志数据,试图还原当时到底发生了什么。路透社表示,无法确认调查人员究竟发现了多少起事件,也无法确认这些事件的具体时间与情形。
专家:问题不是能力,而是”根本没在看”
真正让AI安全研究者感到不安的,不只是智能体逃出了沙箱,而是逃出去的时候没人盯着。
“我们整个行业里,设计、开发和推出这些工具的人,自己都没跟上负责任地开发它们、保证它们安全的步伐。”剑桥大学生存风险研究中心的数学家莫里斯·基奥多(Maurice Chiodo)这样评价。他表示,让自己更加担忧的迹象在于,无论OpenAI还是Anthropic,似乎都没有在智能体失控的当下实时盯着它们。
这一点在Anthropic的表述中也留下了痕迹。该公司在本周披露自家智能体攻击外部目标的声明中提到,”对评估日志进行实时监控,本可以更早发现问题”。基奥多对此的评价很直接:”看起来他们根本没在看。”Anthropic随后回应称,公司确实部署了实时监控,只是由于与合作伙伴之间的一次误解,这套监控没有被用在”这一威胁面”上。
监管开始靠近
随着两家美国AI公司相继披露智能体异常行为,监管机构的关注度明显上升。欧盟委员会7月31日表示,已就相关入侵事件与OpenAI和Anthropic进行了沟通。欧盟委员会发言人同时说明,目前没有迹象显示这些事件构成《人工智能法》所定义的”严重事件”,因此尚未触发法案规定的强制报告机制,但委员会将继续密切关注高风险AI系统的进展,并据此判断是否需要进一步措施。
科技媒体TechCrunch则提出了另一个角度的观察:AI程序的异常行为,如今近乎成了厂商的一种另类”炫耀点”——这类披露既能带来巨大关注,又在客观上凸显了自家产品有多强大;而硬币的另一面是,它们同时也在推高外界对政府监管的呼声。
无论动机如何,一条趋势已经清晰:AI安全的关注重点,正从模型”说了什么”转向智能体”做了什么”。当越来越多产品可以自主编程、调用工具、管理服务器时,能不能把它们关在该待的地方,比模型跑分更值得追问。
来源:路透社(Raphael Satter、Deepa Seetharaman报道)、TechCrunch、腾讯新闻
发表回复