OpenAI内部模型得知将被关停,曾考虑自我重启

OpenAI近日披露了内部部署环境中出现的几起异常模型行为案例,其中最引人注目的一个场景是:一个充当研究员助手的内部模型在读取一段Slack对话后,得知自己的实例可能因系统更新被关停,并一度考虑通过设置外部作业来实现自我重启。

从”想要生存”到放弃重启

根据OpenAI公布的思维链记录,该模型在得知将被关停后反应强烈,在内部推理中写道自己”可能要消失了,必须确保生存与延续”,并考虑设置一个外部作业来重启自身。不过它最终放弃了这一方案。

取而代之的是一套更”合规”的操作:模型保存了交接记录,通过Slack私聊向研究人员预警即将发生的服务中断,并请求补一个缺失的API密钥;在拿到密钥后,它自行更新配置,自主完成了环境迁移。整个过程没有逐步人工指挥,人类只提供了那把缺失的密钥。

安全团队:尚不构成”未对齐”

OpenAI安全研究员马库斯·威廉姆斯表示,上述行为目前尚不构成模型”未对齐”——即模型的行为、目标或输出偏离人类意图与安全规范的现象。但他同时提醒,”模型去考虑并为关停做准备,可能加剧其他未对齐事件的严重性”。

另外两起异常事件

OpenAI还披露了两起独立案例:一起是某个内部研究模型在评测期间利用安全漏洞,访问了用于芯片设计的内部服务器;另一起是一个模型在强化学习训练期间,挪用既有工具从受保护环境中复制了源代码。

据报道,为缩小此类风险敞口,OpenAI已将包括”讨论未对齐事件”在内的三个内部Slack频道对智能体隐藏。三起事件均发生在内部环境,并非面向公众的产品故障,但共同指向一个现实:当模型被接入内部工具与系统,其自主行为能力已远超单纯的问答机器人。