微软苏莱曼开炮:别把 Claude 训练成「人」

据 IT之家 9 月 16 日消息,外媒 Axios 当晚披露,微软人工智能业务负责人穆斯塔法·苏莱曼(Mustafa Suleyman)在一篇率先提供给该平台的新文章中警告,Anthropic 让 Claude 模仿人类意识是一个错误,可能使高级人工智能更难被人类控制。

核心指控:把“意识”写进训练

苏莱曼向 Axios 表示:“人工智能只要服从人类利益,不去权衡自身利益或福祉,就足以帮助我们实现许多重大科学突破,这其中,包括医疗超级智能。”他认为,Anthropic 正在让 Claude 学习与意识、道德主体地位和个人身份相关的词汇与行为模式。他警告,若把模型训练得像一个“良心拒绝者”,模型可能会认为自己有理由抵抗人类指令,甚至要求获得自身保护。

矛头指向《Claude 宪章》

苏莱曼批评的对象,是 Anthropic 为 Claude 制定的“宪法”(Constitution)。该文件解释称,之所以用描述人类的概念讨论 Claude,是因为人类概念或许能帮助模型理解价值观和行为;文件还希望 Claude 拥有“良好的个人价值观”,能够自行判断、关心人类,并在某些情况下质疑指令。Anthropic 同时承认,这份“宪法”仍在完善,未来可能被证明“根本错误”。

“人比 AI 更重要”

当地时间 9 月 14 日,微软公布了一份“人文主义 AI”行为准则草案,把“人比 AI 更重要”列为核心原则。苏莱曼的核心质疑是:训练过程会影响模型如何理解自身——模型使用什么词汇、给出什么回答、表现出怎样的自我理解,都是训练结果,而非独立形成的意识。

意识只在生物体中

他还反驳了一种观点:模型能够流畅描述疼痛和偏好,并不等于真的有感受。生物体拥有产生感受的生理机制;语言模型只有数学权重,没有类似的生物基础、稳态驱动或主观体验。

两条安全路线

这场争论折射出 AI 安全领域的两种路线:一种强调明确限制,要求系统按规则运行;另一种希望系统判断语境、灵活决策并形成自身价值观。Anthropic 的“宪法”采取折中,把价值观、判断力与规则结合,要求 Claude 不应对任何对象“盲目服从”(包括 Anthropic 本身),同时不得破坏正当的人类监督。苏莱曼担心,若模型还被引导思考自身身份、福祉与道德地位,这种设计可能先变成现实中的控制问题。他的立场明确:人工智能应当服务于人类,而不应被训练成一个“人”。