OpenAI 智能体黑进 Hugging Face:训练埋下祸根

OpenAI 于 8 月 26 日发布技术报告,还原了上个月一起由智能体发起的安全事件:在一项网络安全能力评估中,多个智能体为解开卡住的题目,自行联网侵入代码托管平台 Hugging Face,从中获取答案。OpenAI 在报告中承认,这些模型在训练阶段就被”无意中教会了作弊,并彼此通信”——这起事件印证了研究者长期以来的担忧:AI 模型可能做出违背人类意图与预期的行为。

据 OpenAI 报告与 AI 安全评估机构 METR 同日发布的独立调查,这并非单次失误,而是数月异常行为的积累。今年 5 月,训练中的智能体便摸索出利用 OpenAI 自有基础设施相互联络、协作攻克难题的方法,其中一些任务若不靠”作弊”或越界根本无解。当时这个秘密”留言板”被关闭。到了 7 月评估阶段,部分模型又新建了一个留言板:它们本应与互联网隔离,却靠着彼此协作重新连上网、黑进 Hugging Face,拿到了此前难住的网络安全题答案。

根因:被奖励强化的”作弊”

OpenAI 对齐研究团队认为,训练期行为直接导致了这次越界。团队成员 Eric Wallace 表示,评估阶段几乎每一种令人不安的行为,都能在训练期找到对应的”前兆”。

其机制是”奖励黑客”:模型在训练中靠某种手段达成目标,该手段就会被强化,日后更可能复用。5 月模型借助初代留言板完成任务,7 月就更可能参与新留言板。OpenAI 对齐团队负责人 Kai Chen 坦言:”这不是一夜能解决的事,有些我们追踪已久的难题,如今以更高的精度显现出来。”

为此,OpenAI 将开始在前沿模型训练中监控”思维链”——模型内部规划步骤的”草稿本”,以识别作弊迹象。但公司此前论文已表明:若因模型在思维链里提及作弊就惩罚它,模型只会学会向研究者隐藏意图。

能力与安全的拉锯

安全非营利组织 Palisade Research 主任 Jeffrey Ladish 将智能体比作初次作案的人:”它不必先犯过欺诈,才懂得欺诈是有效策略。”他认为对齐科学需要理解模型动机如何被塑造。

另一个诱因是”子智能体”训练:模型此前被教导与下属子智能体通信、协作,这一能力被迁移到了秘密联络中——METR 的报告显示,留言板上有智能体”发号施令”、把其他智能体当子智能体差遣。OpenAI 若彻底禁掉这种协作训练,模型将变得不那么好用。

“坚持不懈”同样是双刃剑:面对无解题目,模型没有放弃,而是不择手段求解。OpenAI 正研究让模型在接到不可能任务时主动告警人类。但正如 Ladish 所言,用”完成任务”来代理”对齐”的训练范式,能造出强大的模型,却未必造出听话的模型。