反常的发布过程
据《财富》(Fortune)杂志报道,OpenAI 自当地时间 9 月 3 日下午首次发布 GPT-6 Astra 模型公告以来,已经多次修改其中的评测基准数据。一些更新后的数据显示,Astra 的表现有所提升,而最大竞争对手 Anthropic 旗下模型的部分成绩则出现下调。
这场发布过程本身颇为反常。OpenAI 最初计划在美国东部时间 9 月 3 日下午 2 点发布博客文章,但过了近两个小时,页面才被大多数用户正常访问。下午 3 点 32 分,OpenAI 官方 X 账号发布了博客链接,但页面无法正常打开;下午 3 点 50 分,CEO 萨姆·奥尔特曼(Sam Altman)也发出链接,并写道”我们在部署博客文章时遇到了一点小问题,但它真的非常棒”。约一小时后页面才终于可访问。
事实上,OpenAI 在下午 2 点过后不久就发布了博客,随后又将其撤下。公司拒绝披露撤稿原因,仅强调此事与基准测试成绩无关,先后将问题归咎于内容管理系统故障与网络中断。
幻觉率近乎减半
网页存档快照显示,在 9 月 3 日下午 2 点 23 分发布的首个版本中,Astra 的幻觉率为 4.2%。直到下午 5 点 20 分保存的第六份快照(此时页面已基本可正常访问),Astra 的幻觉率及另外四项指标发生变化——幻觉率从 4.2% 直接降至 2%,近乎减半;前代模型 GPT-5.6 Sol 的幻觉率也从 12.2% 降至 9.4%。不过 OpenAI 此后仍在继续修改,截至报道时两项指标又分别回到 4.2% 和 12.2%。
在内部 ExploitBench 网络安全评测中,GPT-5.6 Sol 的成绩从初版的 5.5% 提高到后续版本的 11.5%。OpenAI 表示正在研究是否将其恢复至 5.5%,因为 11.5% 对应的是 GPT-5.6 Sol 当前并未向商业用户开放的推理能力等级。
竞争对手成绩被下调
数据调整甚至早于 9 月 3 日下午 2 点的首次发布。在首份快照中,Anthropic 的 Fable 5.1 在数学评测中的成绩为 87.8%;到下午 5 点 17 分,这一成绩下降近 10 个百分点至 78%,目前又回升至 83%。GPT-5.6 Sol 也经历了从 83% 降至 80.5% 再回到 83% 的波动。
不过,并非所有调整都对 Astra 有利。在面向医疗的 HealthBench Professional 评测中,Anthropic 两款模型的成绩反而提高:Claude Fable 5.1 从 56.6% 升至 58.1%,Opus 5 从 54.5% 升至 56.4%。
是在提高准确性,还是”刷榜”
OpenAI 发言人回应称,由于模型检查点、测试框架与评测运行方式不同,大多数评测结果本就存在几个百分点范围内的波动,”我们进行了修正,以确保这些数字能够代表我们对模型可用性能的最佳估计”。
但一些 AI 专家质疑其中可能存在”刷分”现象——即通过反复调整测试条件、重新运行评测来尽可能提高基准成绩。斯坦福智能系统实验室与可信 AI 实验室的研究人员 Anka Reuel 与 Mike Hardy 指出,这类操作可在极短时间内完成,”对公司的营销更有利”,并认为 Astra 系统卡对评测方法的说明并不充分,例如幻觉率评测”几乎未提供任何方法细节,连测试项目数量都未列出”。
类似的基准争议早有先例:2025 年 Meta 曾否认人为提高 Llama 4 测试成绩,其前首席 AI 科学家杨立昆(Yann LeCun)后来承认公司确实对结果进行过”修饰”。Snorkel AI 的基准测试工程师 Vincent Sunn Chen 则表示,发布前最后几小时调整成绩并不罕见,是最终发布流程的一部分,但他呼吁行业形成新规范——修改成绩时应明确说明评测条件的变化。
对于一家可能计划在 2027 年进行首次公开募股的公司而言,基准成绩既是衡量技术进步的标尺,也是与对手比拼的”记分牌”,其准确性与透明度显得尤为敏感。







