<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>刷榜争议 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%88%b7%e6%a6%9c%e4%ba%89%e8%ae%ae/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 06 Sep 2026 08:09:36 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>GPT-6 Astra 评测数据频改，OpenAI 陷刷榜质疑</title>
		<link>https://mylogs.cn/gpt-6-astra-%e8%af%84%e6%b5%8b%e6%95%b0%e6%8d%ae%e9%a2%91%e6%94%b9%ef%bc%8copenai-%e9%99%b7%e5%88%b7%e6%a6%9c%e8%b4%a8%e7%96%91/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 06 Sep 2026 08:09:36 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI评测]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[GPT-6 Astra]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[刷榜争议]]></category>
		<category><![CDATA[基准测试]]></category>
		<guid isPermaLink="false">https://mylogs.cn/gpt-6-astra-%e8%af%84%e6%b5%8b%e6%95%b0%e6%8d%ae%e9%a2%91%e6%94%b9%ef%bc%8copenai-%e9%99%b7%e5%88%b7%e6%a6%9c%e8%b4%a8%e7%96%91/</guid>

					<description><![CDATA[反常的发布过程 据《财富》（Fortune）杂志报道，OpenAI 自当地时间 9 月 3 日下午首次发布 G [&#8230;]]]></description>
										<content:encoded><![CDATA[<h2 class="wp-block-heading">反常的发布过程</h2>

<p class="wp-block-paragraph">据《财富》（Fortune）杂志报道，OpenAI 自当地时间 9 月 3 日下午首次发布 GPT-6 Astra 模型公告以来，已经多次修改其中的评测基准数据。一些更新后的数据显示，Astra 的表现有所提升，而最大竞争对手 Anthropic 旗下模型的部分成绩则出现下调。</p>

<p class="wp-block-paragraph">这场发布过程本身颇为反常。OpenAI 最初计划在美国东部时间 9 月 3 日下午 2 点发布博客文章，但过了近两个小时，页面才被大多数用户正常访问。下午 3 点 32 分，OpenAI 官方 X 账号发布了博客链接，但页面无法正常打开；下午 3 点 50 分，CEO 萨姆·奥尔特曼（Sam Altman）也发出链接，并写道&#8221;我们在部署博客文章时遇到了一点小问题，但它真的非常棒&#8221;。约一小时后页面才终于可访问。</p>

<p class="wp-block-paragraph">事实上，OpenAI 在下午 2 点过后不久就发布了博客，随后又将其撤下。公司拒绝披露撤稿原因，仅强调此事与基准测试成绩无关，先后将问题归咎于内容管理系统故障与网络中断。</p>

<h2 class="wp-block-heading">幻觉率近乎减半</h2>

<p class="wp-block-paragraph">网页存档快照显示，在 9 月 3 日下午 2 点 23 分发布的首个版本中，Astra 的幻觉率为 4.2%。直到下午 5 点 20 分保存的第六份快照（此时页面已基本可正常访问），Astra 的幻觉率及另外四项指标发生变化——幻觉率从 4.2% 直接降至 2%，近乎减半；前代模型 GPT-5.6 Sol 的幻觉率也从 12.2% 降至 9.4%。不过 OpenAI 此后仍在继续修改，截至报道时两项指标又分别回到 4.2% 和 12.2%。</p>

<p class="wp-block-paragraph">在内部 ExploitBench 网络安全评测中，GPT-5.6 Sol 的成绩从初版的 5.5% 提高到后续版本的 11.5%。OpenAI 表示正在研究是否将其恢复至 5.5%，因为 11.5% 对应的是 GPT-5.6 Sol 当前并未向商业用户开放的推理能力等级。</p>

<h2 class="wp-block-heading">竞争对手成绩被下调</h2>

<p class="wp-block-paragraph">数据调整甚至早于 9 月 3 日下午 2 点的首次发布。在首份快照中，Anthropic 的 Fable 5.1 在数学评测中的成绩为 87.8%；到下午 5 点 17 分，这一成绩下降近 10 个百分点至 78%，目前又回升至 83%。GPT-5.6 Sol 也经历了从 83% 降至 80.5% 再回到 83% 的波动。</p>

<p class="wp-block-paragraph">不过，并非所有调整都对 Astra 有利。在面向医疗的 HealthBench Professional 评测中，Anthropic 两款模型的成绩反而提高：Claude Fable 5.1 从 56.6% 升至 58.1%，Opus 5 从 54.5% 升至 56.4%。</p>

<h2 class="wp-block-heading">是在提高准确性，还是&#8221;刷榜&#8221;</h2>

<p class="wp-block-paragraph">OpenAI 发言人回应称，由于模型检查点、测试框架与评测运行方式不同，大多数评测结果本就存在几个百分点范围内的波动，&#8221;我们进行了修正，以确保这些数字能够代表我们对模型可用性能的最佳估计&#8221;。</p>

<p class="wp-block-paragraph">但一些 AI 专家质疑其中可能存在&#8221;刷分&#8221;现象——即通过反复调整测试条件、重新运行评测来尽可能提高基准成绩。斯坦福智能系统实验室与可信 AI 实验室的研究人员 Anka Reuel 与 Mike Hardy 指出，这类操作可在极短时间内完成，&#8221;对公司的营销更有利&#8221;，并认为 Astra 系统卡对评测方法的说明并不充分，例如幻觉率评测&#8221;几乎未提供任何方法细节，连测试项目数量都未列出&#8221;。</p>

<p class="wp-block-paragraph">类似的基准争议早有先例：2025 年 Meta 曾否认人为提高 Llama 4 测试成绩，其前首席 AI 科学家杨立昆（Yann LeCun）后来承认公司确实对结果进行过&#8221;修饰&#8221;。Snorkel AI 的基准测试工程师 Vincent Sunn Chen 则表示，发布前最后几小时调整成绩并不罕见，是最终发布流程的一部分，但他呼吁行业形成新规范——修改成绩时应明确说明评测条件的变化。</p>

<p class="wp-block-paragraph">对于一家可能计划在 2027 年进行首次公开募股的公司而言，基准成绩既是衡量技术进步的标尺，也是与对手比拼的&#8221;记分牌&#8221;，其准确性与透明度显得尤为敏感。</p>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
