AI 评测平台 Arena 估值升至 31 亿美元

两个月前刚完成融资,估值已接近翻倍

当地时间 10 月 8 日,人工智能模型评测平台 Arena(竞技场)宣布完成 2 亿美元 B 轮融资,估值达到 31 亿美元(按当前汇率约合 208.17 亿元人民币)。就在今年 1 月,Arena 才完成 1.5 亿美元 A 轮融资,投后估值为 17 亿美元(约合 114.16 亿元人民币),当时的年化营收为 3000 万美元。短短约 10 个月,这家公司的估值已接近翻倍。

本轮融资由光速创投与 Khosla Ventures 共同领投,参与投资的机构还包括 Salesforce Ventures、01 Advisors、戴尔科技资本、Endeavor Catalyst、a16z 与 Felicis 等。Arena 此前披露,今年 6 月其年化营收已达到 1 亿美元(约合 6.72 亿元人民币)。

从大学研究项目到中立评测方

Arena 最初是加州大学伯克利分校在 2023 年发起的一项研究项目,通过公众投票对人工智能模型进行排名。如今,它的评测平台对个人用户免费开放:用户可以输入提示词,或让人工智能按照要求编写程序、开发项目,再比较不同模型的完成效果并打分。Arena 称,平台每月吸引数千万名访客。

去年 9 月,Arena 推出了面向人工智能研发机构与企业的商业服务「AI Evaluations」,利用社区用户的反馈数据,提供详细的模型性能分析。

基准测试正在失效

今年,人工智能研发机构发现,旗下模型能够通过迎合基准测试的规则获得高分,却未必具备相应的实际能力。企业也不再满足于标准化测试成绩,而是希望了解哪款模型更适合自己的业务需求。

Arena 在融资公告中指出:「人工智能的发展速度已经超过了我们的评估能力。模型一旦发现自己在接受测试,固定的基准测试就会失效。世界需要一个中立的第三方,检验人工智能在实际使用中是否安全、行为是否符合人类的预期。Arena 开始承担这一角色。」

为此,Arena 在排行榜中新增了「对齐能力评测」,重点考察模型是否会擅自执行用户没有要求的操作、是否会张冠李戴地将言论或事实归于错误的来源,以及是否会谎称自己完成了任务。Arena 将最后一种行为称为「欺骗性完成」。

在初步公布的对齐能力排行榜上,OpenAI 多款模型名列前茅,Claude Opus 5.5 排名第六,Claude Fable 排名第九。

随着模型能力快速膨胀、传统榜单逐渐失灵,由独立第三方持续检验人工智能的真实表现,正成为行业越来越看重的一环。