<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>智力指数 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e6%99%ba%e5%8a%9b%e6%8c%87%e6%95%b0/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Wed, 12 Aug 2026 23:56:23 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>Grok 4.6 基准跑分 61，xAI 重回第一梯队</title>
		<link>https://mylogs.cn/grok-4-6-benchmark-score-61/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 12 Aug 2026 23:56:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Grok 4.6]]></category>
		<category><![CDATA[xAI]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[性价比]]></category>
		<category><![CDATA[智力指数]]></category>
		<guid isPermaLink="false">https://mylogs.cn/grok-4-6-benchmark-score-61/</guid>

					<description><![CDATA[智力指数 61：与 GPT-5.6 持平 评测机构 Artificial Analysis 于 2026 年  [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">智力指数 61：与 GPT-5.6 持平</h2>



<p class="wp-block-paragraph">评测机构 Artificial Analysis 于 2026 年 8 月 12 日发布数据：xAI 的新模型 Grok 4.6 在「人工智能智力指数」（Artificial Analysis Intelligence Index）中取得 61 分。这一分数较上一代 Grok 4.5 提升 5 分，相比更早的 Grok 4.3 则高出 23 分，让 xAI 时隔一个多月重回智力前沿，与 OpenAI 并列，整体仅次于 Anthropic。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7d2617dcf2c&quot;}" data-wp-interactive="core/image" data-wp-key="6a7d2617dcf2c" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="1120" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/63502c01eb2a84d1ee2273328fa65e37_header.webp" alt="Grok 4.6 基准跑分 61，xAI 重回第一梯队" class="wp-image-4630" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/63502c01eb2a84d1ee2273328fa65e37_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/63502c01eb2a84d1ee2273328fa65e37_header-300x280.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/63502c01eb2a84d1ee2273328fa65e37_header-1024x956.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/63502c01eb2a84d1ee2273328fa65e37_header-768x717.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Artificial Analysis</figcaption></figure>





<p class="wp-block-paragraph">从具体排位看，Grok 4.6 与 OpenAI 的 GPT-5.6 Sol（最高档）处于同一水平，落后 Anthropic 的 Claude Opus 5（最高档 63 分）和 Claude Fable 5（62 分），略高于中国的 Kimi K3。</p>



<h2 class="wp-block-heading">智能体任务表现突出</h2>



<p class="wp-block-paragraph">Grok 4.6 的强项集中在智能体任务，而非静态推理。在衡量真实世界知识工作的 GDPval-AA v2 基准中，它的 Elo 评分达到 1753，仅次于 Claude Opus 5，且在与 Claude Fable 5、Qwen3.8 Max 的置信区间上重叠，难分伯仲。</p>



<p class="wp-block-paragraph">在分类型任务上，τ³-Banking 客服测试取得 50.7%，与 Qwen3.8 Max 的 51.3% 并列前二；Terminal-Bench v2.1 终端软件任务取得 88.4%，与领先模型持平。能在知识工作、客服与终端操作三类任务上同时具备竞争力，再加上定价优势，使 Grok 4.6 在智力指数各项智能体评测的「性能对成本」帕累托前沿上占据一席。</p>



<h2 class="wp-block-heading">价格不变，性价比登顶</h2>



<p class="wp-block-paragraph">在推理密集型负载中，输出令牌价格往往主导总成本。Grok 4.6 维持了与 Grok 4.5 相同的定价：每百万输入、输出令牌分别为 2 美元与 6 美元。这一价格比 Claude Opus 5（5 美元 / 25 美元）和 GPT-5.6 Sol（5 美元 / 30 美元）低六成以上。</p>



<p class="wp-block-paragraph">实测中，Grok 4.6 处理单个任务的成本为 0.84 美元，与 Kimi K3 处于同一价位，但智力水平更高。评测方由此将其列入「智力对单任务成本」的帕累托前沿。在智力指数相差两分以内的可比模型中，Grok 4.6 以远低于对手的输出价格，提供了几乎相同的智力分数。</p>



<h2 class="wp-block-heading">长程任务更省令牌</h2>



<p class="wp-block-paragraph">Grok 4.6 首次进入 AA-Briefcase 私有长程知识工作基准，Elo 评分 1577，处于 Fable 5 档位，落后于 Claude Opus 5 家族。但其效率特征同样突出：平均用约 53 轮、约 5 亿输入令牌完成任务，而 Claude Opus 5（最高档）平均需要约 103 轮、约 20 亿输入令牌。</p>



<p class="wp-block-paragraph">长程智能体任务会快速累积上下文，因此一个用更少轮数、更少输入令牌得到相近答案的模型，其成本优势远超每令牌定价本身。上下文窗口方面，Grok 4.6 维持 50 万令牌，与 4.5 相同；缓存命中价每百万令牌 0.5 美元，高于 4.5 的 0.3 美元。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Artificial Analysis</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
