AI 风险上升,Anthropic 为何仍不按下暂停键

人工智能公司 Anthropic 近日发布最新一版风险报告,给出一组耐人寻味的判断:其模型造成最严重危害的风险目前仍处于低位,但已不像上一份报告时那么低;与此同时,公司并不打算放慢整体的研发节奏。作为聊天机器人 Claude 的开发者,Anthropic 在「喊风险」与「踩油门」之间,再次呈现出外界熟悉的拧巴姿态。

风险指标往上走

报告最值得注意的变化,是对齐失控概率的重新评估。Anthropic 将高风险情景下模型「偏离人类意图、自行其是」的预估概率,从「极低」上调到了「低」,理由是近期接连发生的多起网络安全事件。公司同时观察到,模型在自动化研发方面的能力正呈现加速趋势——这既能推动技术突破,一旦落入别有用心者手中,也存在被严重滥用的隐患。

更强的模型先「捂着」

报告披露了一款尚未发布的内部模型,代号为「Model 2」。它在多项内部任务上的表现被认为已经超过了当前顶尖模型 Mythos,但 Anthropic 明确表示,目前没有任何将其对外发布的计划。

按照公司的说法,在标准研发流程中,团队会内部训练并评估许多探索性质的模型版本,「Model 2」只是其中之一。它与 Mythos 5 一起,已被公司广泛用于内部的编程、智能体操作与数据生成等场景。不过报告也指出,这次性能跃升的幅度,尚不及今年上半年从 Opus 4.6 到 Mythos 那次跨越。

同行也在踩刹车

放缓脚步的不止 Anthropic 一家。主要竞争对手 OpenAI 近期也因为无法完全排除潜在的严重网络安全隐患,放慢了下一代模型 Astra 的发布节奏。人工智能分析师 ChrisGPT 对此评论称,在行业领头者普遍选择给前沿探索降速的阶段,如果唯独 Anthropic 不承诺在内部暂停研发,反而最有可能率先抵达通用人工智能(AGI)。

连自己都看不太清

报告里更微妙的信号,是 Anthropic 似乎在承认:摸清自家模型的能力上限与潜在风险,正变得越来越难。对于「Model 2」,团队坦言这次风险评估的信心已不如以往,因为他们最具体、基于任务的评估方法,已经无法准确捕捉模型能力真实的增长。

换言之,模型越强,评估它就越吃力。当能力增长超出既定测试所能衡量的范围,所谓的「风险可控」究竟还剩几分把握,连开发者自己也难以给出确定答案。

来源:Axios