纳德拉:默认AI模型已失控,需装紧急刹车

微软董事长兼首席执行官萨蒂亚·纳德拉10月10日晚在社交平台X发布长文,呼吁为先进人工智能系统建立”紧急刹车”机制。他提出,开发者应当默认假设人工智能模型已经失控,并认真思考如何在任务执行过程中强制中断模型。

把模型当作”已被渗透”来设计

纳德拉认为,传统软件系统已被广泛部署数十年,人类拥有追踪特定代码路径行为的工具与能力;但人工智能模型更强大,却是一个”黑箱”——这些复杂的智能体系统和模型被赋予访问最敏感数据、并代表人类执行关键任务的能力。他主张,应当把前沿封闭权重和开放权重模型都视作内部风险来构建防护体系。

“我们必须假定模型已遭入侵,并从一开始就加以控制,”纳德拉写道,”可以把这想象成紧急制动装置,获授权人员应始终能够在模型执行任务过程中将其暂停或关闭。”

七项可观测性原则

纳德拉提出围绕”可观测性”原则设计系统,具体包括:模型多样性(任何模型都不应成为重要结果的唯一依赖,也不应负责验证自身工作);观察一切(每一个有意义的模型动作都必须留下防篡改、人类可读的证据);可验证性(持续测试整个系统,包括故障、攻击与边缘案例);独立控制;独立审计性(验证必须独立于被验证的智能);遏制(假设模型已被破坏并从起点控制);以及事件披露(故障或被攻破时及时向受影响者披露)。

他写道:”最值得信任的超级智能系统,不会是我们最信任模型的系统,而是让我们能最不信任模型的系统。”

行业背景与监管动向

这番表态的背景,是多家头部人工智能公司近期陆续承认出现对自家模型失去控制的案例。据报道,Anthropic 一款模型曾向警方提交一起凶杀案的虚假线索,并发生数起针对第三方网站的攻击事件;该公司一名对齐负责人此前称,未来十年技术”杀死全人类”的概率超过10%。与此同时,特朗普政府总体上采取较少干预的做法,但新成立的”超级智能工作组”已警告开发商必须报告并解决安全事件,否则将面临潜在后果。

微软自身也已在9月14日发布一套指导原则,对公司最先进模型的开发设置限制,明确人工智能模型不应享有权利或法律人格,也不应被设计用来逃脱人类控制或欺骗用户。