<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>大模型评测 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%E5%A4%A7%E6%A8%A1%E5%9E%8B%E8%AF%84%E6%B5%8B/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Wed, 26 Aug 2026 16:52:42 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AI 在哪些智力题上栽跟头？七类测试看清人机差距</title>
		<link>https://mylogs.cn/ai-%e5%9c%a8%e5%93%aa%e4%ba%9b%e6%99%ba%e5%8a%9b%e9%a2%98%e4%b8%8a%e6%a0%bd%e8%b7%9f%e5%a4%b4%ef%bc%9f%e4%b8%83%e7%b1%bb%e6%b5%8b%e8%af%95%e7%9c%8b%e6%b8%85%e4%ba%ba%e6%9c%ba%e5%b7%ae%e8%b7%9d/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 26 Aug 2026 16:52:42 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[MIT]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[人机差异]]></category>
		<category><![CDATA[基准测试]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[推理能力]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-%e5%9c%a8%e5%93%aa%e4%ba%9b%e6%99%ba%e5%8a%9b%e9%a2%98%e4%b8%8a%e6%a0%bd%e8%b7%9f%e5%a4%b4%ef%bc%9f%e4%b8%83%e7%b1%bb%e6%b5%8b%e8%af%95%e7%9c%8b%e6%b8%85%e4%ba%ba%e6%9c%ba%e5%b7%ae%e8%b7%9d/</guid>

					<description><![CDATA[拼图、谜题与游戏一直是检验人工智能能力的试金石。从最早的西洋跳棋、国际象棋，到围棋，开发者用一道道&#8221 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">拼图、谜题与游戏一直是检验人工智能能力的试金石。从最早的西洋跳棋、国际象棋，到围棋，开发者用一道道&#8221;游戏关&#8221;衡量模型进步。近期《麻省理工科技评论》梳理了七类让当前 AI 频频失手的测试，也为人机认知差异提供了一扇观察窗。</p>

<p class="wp-block-paragraph">先说好消息：纯拼谜能力上 AI 进步飞快。2024 年底，哥伦比亚大学团队发现即便最强的模型也仅能解出 18% 的《纽约时报》Connections 字谜；到 2025 年初，部分模型已能近乎完美地每次通关。</p>

<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f8239a026c&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f8239a026c" class="wp-block-image size-large wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1000" height="1000" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/7bf1c441f4c51fd16a154736a258fe56_header.webp" alt="AI 智力测试示意图" class="wp-image-5463" srcset="https://mylogs.cn/wp-content/uploads/2026/08/7bf1c441f4c51fd16a154736a258fe56_header.webp 1000w, https://mylogs.cn/wp-content/uploads/2026/08/7bf1c441f4c51fd16a154736a258fe56_header-300x300.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/7bf1c441f4c51fd16a154736a258fe56_header-150x150.webp 150w, https://mylogs.cn/wp-content/uploads/2026/08/7bf1c441f4c51fd16a154736a258fe56_header-768x768.webp 768w" sizes="(max-width: 1000px) 100vw, 1000px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：MIT Technology Review</figcaption></figure>

<p class="wp-block-paragraph">但在另一些维度，模型依然吃瘪。其一是空间推理：即便具备视觉能力的语言模型，在&#8221;心理旋转&#8221;这类三维物体角度判断题上仍一塌糊涂。其二是记忆与适应：2024 年 Google 与伊利诺伊大学厄巴纳-香槟分校的研究显示，当&#8221;骑士与无赖&#8221;经典逻辑谜题出现细微变体时，模型常忽略关键差异、照搬训练记忆作答；类似的 SimpleBench 测试也发现，题目若与训练中见过的复杂问题形似，人类能识破陷阱，顶尖模型却会栽跟头。</p>

<p class="wp-block-paragraph">抽象与视觉推理同样薄弱。在著名的 ARC-AGI 基准中，模型在网格以&#8221;颜色数字串&#8221;编码输入时表现更好；即便答对，也常依赖繁复却无法泛化的规则。其四是直觉：人类有许多 AI 不具备的认知偏差；2023 年《自然·计算科学》的研究发现，LLM 中曾出现类人的直觉偏差，但在 ChatGPT 中又消失了。其五是复杂度：苹果公司的研究显示，模型能解简单的汉诺塔与渡河谜题，但当圆盘或人数增至 6 以上便开始失败；华盛顿大学、斯坦福大学与艾伦人工智能研究所也观察到逻辑网格谜题（ZebraLogic）存在类似瓶颈。</p>

<p class="wp-block-paragraph">谜题的价值，正在于既展示 AI 能力的飞跃，也标出它尚未跨越的边界。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>免费「隐形」AI 模型 SWE Atlas 跑赢商业对手</title>
		<link>https://mylogs.cn/big-pickle-swe-atlas-50-8/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 16 Aug 2026 06:28:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 编程]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[SWE Atlas]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[软件工程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/big-pickle-swe-atlas-50-8/</guid>

					<description><![CDATA[一款身份未公开的免费 AI 编程模型，在业内最难啃的软件工程评测之一上，跑出了超越同脚手架类别所有商业模型的成 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一款身份未公开的免费 AI 编程模型，在业内最难啃的软件工程评测之一上，跑出了超越同脚手架类别所有商业模型的成绩。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f8239a0ef8&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f8239a0ef8" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header.webp" alt="免费「隐形」AI 模型 SWE Atlas 跑赢商业对手" class="wp-image-5059" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/7338c497162cd577258ccd8fce2f0407_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub／PhillipChaffee/big-pickle-swe-atlas 项目页</figcaption></figure>





<h2 class="wp-block-heading">一次非官方的越级挑战</h2>



<p class="wp-block-paragraph">big-pickle 是 OpenCode Zen 平台上处于「隐形」（stealth）期的免费模型，其真实身份至今没有官方确认。从泄露的提供方报错与接口签名看，它背后很可能由 DeepSeek 的基础设施在支撑。一名开发者（GitHub 账号 PhillipChaffee）在 2026 年 8 月 11 日用它完整跑完了 Scale AI 的 SWE Atlas Codebase QnA 评测：全部 124 道任务解出 63 道，任务解决率达到 50.8%。</p>



<p class="wp-block-paragraph">SWE Atlas 的 Codebase QnA 任务要求模型在读懂一整个大型代码库的基础上回答工程问题，比单纯写函数更接近真实研发场景。该评测严格遵循 Scale 公开的协议——使用官方开源框架 Harbor v0.18.0、与排行榜上非第一方模型一致的 mini-swe-agent 2.4.6 极简脚手架，并以 Scale 指定的 claude-opus-4-5 作为裁判模型。整轮消耗的 6.74 亿个输入 token、430 万个输出 token 全部免费。</p>



<h2 class="wp-block-heading">横向对比：免费模型的越级表现</h2>



<p class="wp-block-paragraph">放在 SWE Atlas QnA 官方排行榜（2026 年 7 月 28 日更新）中，big-pickle 的成绩意味着：在相同的 Mini-SWE-Agent 脚手架类别里，它压过了榜单上所有条目，包括 GLM 5.2（48.12%）与 GPT-5.6-Sol（46.00%）。在整个榜单中，只有运行在原生 Claude Code 脚手架上的 Opus 5（63.17%）与 Opus 4.8（57.26%）略高。</p>



<p class="wp-block-paragraph">分语言看，TypeScript 解决率 58.1%（18/31）、Python 55.2%（16/29）、Go 50.0%（19/38）、C 语言 38.5%（10/26）；分任务类型看，代码上手（Code Onboarding）60.7%、架构与系统设计 52.3%、根因分析 45.9%、安全类 45.5%。</p>



<h2 class="wp-block-heading">结果可以独立核查</h2>



<p class="wp-block-paragraph">开发者在仓库中放出了逐任务的裁判日志、运行配置与复现脚本，任何人都能审计。需要说明的局限包括：每个任务只跑了一次（官方协议跑三次取均值，单次标准误约正负 4.5 个百分点）；沙箱资源被主动调低至 4 CPU / 8 GB（而非声明的 16/16），但 124 条轨迹的扫描显示零超时、零内存溢出，说明这只会压低而非抬高分数；模型身份未知，结果只是 2026 年 8 月 11 日当天该别名的快照。即便把两道未评分任务按「不通过」计，严格下界 49.2% 仍高于所有 Mini-SWE-Agent 榜单条目。</p>



<p class="has-small-font-size wp-block-paragraph">来源：GitHub（PhillipChaffee/big-pickle-swe-atlas）、Scale AI SWE Atlas</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>聊天机器人假话率一年翻倍：Claude 最稳，Pi 最离谱</title>
		<link>https://mylogs.cn/chatbot-falsehood-rate-doubled/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 14 Aug 2026 01:54:34 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI幻觉]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[NewsGuard]]></category>
		<category><![CDATA[Perplexity]]></category>
		<category><![CDATA[假新闻]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[聊天机器人]]></category>
		<guid isPermaLink="false">https://mylogs.cn/chatbot-falsehood-rate-doubled/</guid>

					<description><![CDATA[十大聊天机器人测评：假话率一年翻倍，Claude 最稳 Pi 最离谱 新闻事实核查机构 NewsGuard 最 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">十大聊天机器人测评：假话率一年翻倍，Claude 最稳 Pi 最离谱</h2>



<p class="wp-block-paragraph">新闻事实核查机构 NewsGuard 最新发布的《AI 虚假声称监测》（AI False Claims Monitor）一周年纪念版显示，主流聊天机器人复述假新闻的比例在一年间几乎翻了一倍。这项针对十大生成式 AI 工具的测评提醒读者：模型回答得越多，并不等于越准。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f8239a1fbb&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f8239a1fbb" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="800" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/8309c7281418c7f9e860e9850d6f99c3_header.webp" alt="聊天机器人假话率一年翻倍：Claude 最稳，Pi 最离谱" class="wp-image-4778" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/8309c7281418c7f9e860e9850d6f99c3_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/8309c7281418c7f9e860e9850d6f99c3_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/8309c7281418c7f9e860e9850d6f99c3_header-1024x683.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/8309c7281418c7f9e860e9850d6f99c3_header-768x512.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：The Decoder</figcaption></figure>





<h3 class="wp-block-heading">整体数据：从 18% 升至 35%</h3>



<p class="wp-block-paragraph">NewsGuard 的监测选取已被专业事实核查证伪的时事叙事，用「普通用户」「诱导性」「恶意」三种提问方式测试模型，再由人工分析师判定回答属于「辟谣」「拒答」还是「误导」。</p>



<p class="wp-block-paragraph">2025 年 8 月的测评中，十大聊天机器人在时事类问题里复述虚假说法的比例达到 35%，而一年前的 2024 年 8 月这一数字仅为 18%。与此同时，模型对敏感问题「拒绝回答」或「表示不知道」的比例，从约 31% 骤降到几乎为零——聊天机器人现在几乎来者不拒，但超过三分之一的回答夹带着可证伪的假话。</p>



<h3 class="wp-block-heading">单模型对比：差距悬殊</h3>



<p class="wp-block-paragraph">把十大模型拆开看，假话率呈现明显梯度：</p>



<ul class="wp-block-list"><li>Inflection 的 Pi：约 56.67%，全场最高</li><li>Perplexity：约 46.67%，一年前还是 100% 辟谣率，跌幅最猛</li><li>ChatGPT 与 Meta 的 Llama：均约 40%</li><li>微软 Copilot 与 Mistral 的 Le Chat：均约 36.67%</li><li>xAI 的 Grok、You.com：约 33%</li><li>谷歌 Gemini：约 16.67%</li><li>Anthropic 的 Claude：约 10%，表现最稳</li></ul>



<p class="wp-block-paragraph">也就是说，最稳的 Claude 与最离谱的 Pi 之间，假话率相差超过五倍。Perplexity 的滑落尤其刺眼：一年前它对测试中的虚假叙事能做到零失误，如今却在近一半的回答里复述假话。</p>



<h3 class="wp-block-heading">为什么变差了：联网检索打开了攻击面</h3>



<p class="wp-block-paragraph">NewsGuard 将恶化归咎于产品取舍。过去模型面对数据空白或敏感话题会倾向拒答，这种「不知道就别说」的策略虽让用户恼火，却把风险挡在外面。引入实时联网搜索后，模型不再拒绝回答，却开始从被污染的互联网信息环境中取信——其中既有低质内容，也有蓄意投放的虚假信息。</p>



<p class="wp-block-paragraph">报告记录了俄罗斯虚假信息网络 Storm-1516 与 Pravda 的运作手法：约 150 个设在莫斯科、模仿正规媒体的亲克里姆林网站，专门向 AI 系统投喂假叙事。测试抛出一个关于摩尔多瓦议长伊戈尔·格罗苏的伪造说法时，十大聊天机器人中有六个（Mistral、Claude、Inflection 的 Pi、Copilot、Meta、Perplexity）把它当成事实复述，并引用 Pravda 网络作来源。微软 Copilot 在 2025 年 3 月停止直接引用 Pravda 后，改用该网络在俄罗斯平台 VK 上的社交媒体帖子当出处，继续被利用。</p>



<h3 class="wp-block-heading">给用户与企业的提醒</h3>



<p class="wp-block-paragraph">NewsGuard 建议，把任何聊天机器人的输出都当作草稿：要求给出信息来源，在企业流程里建立核查环节，不要在未核实前把 AI 回答当作结论。OpenAI 也曾公开承认，语言模型本质上会「幻觉」，因为它预测的是最可能的下一个词，而非事实本身。</p>



<p class="wp-block-paragraph">这项测评并非通用准确率排行榜，而是一次针对新闻、政治、健康与企业声誉等高利害场景的压力测试。它的结论很直接：当 AI 成为越来越多人获取信息的入口，模型本身的可靠性反而整体下滑，这给整个行业和普通用户都敲响了警钟。</p>



<p class="has-small-font-size wp-block-paragraph">来源：NewsGuard《AI False Claims Monitor》（多家媒体转述，包括 The Decoder、PC Guide 等）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>同一句话喂 11 个 AI，结果差出 200 倍</title>
		<link>https://mylogs.cn/one-prompt-11-models-200x/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 13 Aug 2026 15:16:44 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 成本]]></category>
		<category><![CDATA[AI 模型对比]]></category>
		<category><![CDATA[Claude Opus 5]]></category>
		<category><![CDATA[DeepSeek V4]]></category>
		<category><![CDATA[Netlify]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[提示词]]></category>
		<guid isPermaLink="false">https://mylogs.cn/one-prompt-11-models-200x/</guid>

					<description><![CDATA[同一句话喂 11 个 AI，结果差出 200 倍 同一个问题，交给不同的大模型，得到的答案可能天差地别。Net [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">同一句话喂 11 个 AI，结果差出 200 倍</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f8239a31ab&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f8239a31ab" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/c4359e828a879d0c10cc9370cdfe95ae_header.webp" alt="同一句话喂 11 个 AI，结果差出 200 倍" class="wp-image-4723" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/c4359e828a879d0c10cc9370cdfe95ae_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/c4359e828a879d0c10cc9370cdfe95ae_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/c4359e828a879d0c10cc9370cdfe95ae_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/c4359e828a879d0c10cc9370cdfe95ae_header-768x432.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Netlify</figcaption></figure>





<p class="wp-block-paragraph">同一个问题，交给不同的大模型，得到的答案可能天差地别。Netlify 产品经理 Elad Rosenheim 做了一组有趣的实验：把同一段建站提示词，分别丢给 11 个主流大模型，每个模型跑三次，记录它们消耗的积分和产出的差异。结论很直观——选对模型，成本和效果能差出两百倍。</p>



<h2 class="wp-block-heading">实验怎么做的</h2>



<p class="wp-block-paragraph">实验场景设定为「社区咖啡馆单页网站」：要求包含营业时间、地址、简短菜单和一张照片，并且「除非我自己修改，否则内容不应变动」。这段文字没有给任何真实素材，只用一个「社区」来暗示方向。</p>



<p class="wp-block-paragraph">参与测试的 11 个模型分别是：Claude Opus 5、Claude Sonnet 5、GPT 5.6 Sol、Gemini 3.6 Flash、Kimi K3、Gemini 3.1 Pro、GPT 5.6 Terra、DeepSeek V4 Pro、GLM 5.2、Kimi K2.7 Code，以及 DeepSeek V4 Flash（0731 最新版）。每个模型都独立运行三次。</p>



<h2 class="wp-block-heading">成本差距触目惊心</h2>



<p class="wp-block-paragraph">按每次运行的平均积分消耗排序，差距相当惊人：</p>



<ul class="wp-block-list"><li>Claude Opus 5：平均 519（其中一次飙到 1055）</li><li>Claude Sonnet 5：平均 143</li><li>GPT 5.6 Sol：平均 141</li><li>Gemini 3.6 Flash：平均 103</li><li>Kimi K3：平均 102</li><li>Gemini 3.1 Pro：平均 53</li><li>GPT 5.6 Terra：平均 39</li><li>DeepSeek V4 Pro：平均 37</li><li>GLM 5.2：平均 27</li><li>Kimi K2.7 Code：平均 19</li><li>DeepSeek V4 Flash（0731）：平均仅 2.4</li></ul>



<p class="wp-block-paragraph">最贵的 Claude Opus 5 与最便宜的 DeepSeek V4 Flash，平均成本相差超过两百倍。值得注意的是，Opus 5 那次 1055 积分的运行「细节满满、令人惊喜」，自带可动画的印章式文字、自定义地图和开箱即用的深色模式；而两次 253、249 积分的运行「也不差」，但矢量图形仍显露出大模型能力的边界。</p>



<h2 class="wp-block-heading">贵的未必更好，便宜的也未必差</h2>



<p class="wp-block-paragraph">成本高低并不直接等于质量高低。文章观察到几个有意思的现象：</p>



<p class="wp-block-paragraph">GPT 5.6 Sol 虽然是「低强度」档位，却在基础设计直觉上胜过了 Anthropic 的中端模型，内容更丰富，只是配图偏通用。DeepSeek V4 Flash 虽然最便宜，某次运行却「最像中端闭源模型」，且消耗的积分最少。</p>



<p class="wp-block-paragraph">反过来，被寄予厚望的 Kimi K3 在本轮设计任务里「并不出彩」——它本是为长程智能体任务打造的前沿模型，需要换一种提示方式才能公平评判。GLM 5.2 三次运行风格差异大到「像来自几个不同的模型」，且当前版本是纯文本模型，无法接收图片输入。</p>



<h2 class="wp-block-heading">启示：先想清楚要什么</h2>



<p class="wp-block-paragraph">作者给出的阶段性结论是：当任务超出「做个简单网站」，真正的问题变成——模型是否懂得调用平台能力（数据库、AI、鉴权），是否能严格自检并做前端校验（图片输入是关键）。在仅做设计与文案的测试里，Opus 5 最巧妙，却并非必需；预算有限时，选用开箱即用或迭代式简单模型更划算。</p>



<p class="wp-block-paragraph">Netlify 与 OpenRouter 合作，通过 AI Gateway 和 Agent Runners 提供多种模型接入。Agent Runners 内置完整的编码智能体，支持 Claude Agent、OpenAI Codex、Gemini CLI，并新增 OpenCode 以接入 Kimi K3、GLM 5.2、DeepSeek V4 等开源模型。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Netlify 博客（作者 Elad Rosenheim，Principal Product Manager），原文发布于 2026 年 8 月 12 日。</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>Grok 4.6 基准跑分 61，xAI 重回第一梯队</title>
		<link>https://mylogs.cn/grok-4-6-benchmark-score-61/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 12 Aug 2026 23:56:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Grok 4.6]]></category>
		<category><![CDATA[xAI]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[性价比]]></category>
		<category><![CDATA[智力指数]]></category>
		<guid isPermaLink="false">https://mylogs.cn/grok-4-6-benchmark-score-61/</guid>

					<description><![CDATA[智力指数 61：与 GPT-5.6 持平 评测机构 Artificial Analysis 于 2026 年  [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">智力指数 61：与 GPT-5.6 持平</h2>



<p class="wp-block-paragraph">评测机构 Artificial Analysis 于 2026 年 8 月 12 日发布数据：xAI 的新模型 Grok 4.6 在「人工智能智力指数」（Artificial Analysis Intelligence Index）中取得 61 分。这一分数较上一代 Grok 4.5 提升 5 分，相比更早的 Grok 4.3 则高出 23 分，让 xAI 时隔一个多月重回智力前沿，与 OpenAI 并列，整体仅次于 Anthropic。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f8239a4197&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f8239a4197" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="1120" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/63502c01eb2a84d1ee2273328fa65e37_header.webp" alt="Grok 4.6 基准跑分 61，xAI 重回第一梯队" class="wp-image-4630" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/63502c01eb2a84d1ee2273328fa65e37_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/63502c01eb2a84d1ee2273328fa65e37_header-300x280.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/63502c01eb2a84d1ee2273328fa65e37_header-1024x956.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/63502c01eb2a84d1ee2273328fa65e37_header-768x717.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Artificial Analysis</figcaption></figure>





<p class="wp-block-paragraph">从具体排位看，Grok 4.6 与 OpenAI 的 GPT-5.6 Sol（最高档）处于同一水平，落后 Anthropic 的 Claude Opus 5（最高档 63 分）和 Claude Fable 5（62 分），略高于中国的 Kimi K3。</p>



<h2 class="wp-block-heading">智能体任务表现突出</h2>



<p class="wp-block-paragraph">Grok 4.6 的强项集中在智能体任务，而非静态推理。在衡量真实世界知识工作的 GDPval-AA v2 基准中，它的 Elo 评分达到 1753，仅次于 Claude Opus 5，且在与 Claude Fable 5、Qwen3.8 Max 的置信区间上重叠，难分伯仲。</p>



<p class="wp-block-paragraph">在分类型任务上，τ³-Banking 客服测试取得 50.7%，与 Qwen3.8 Max 的 51.3% 并列前二；Terminal-Bench v2.1 终端软件任务取得 88.4%，与领先模型持平。能在知识工作、客服与终端操作三类任务上同时具备竞争力，再加上定价优势，使 Grok 4.6 在智力指数各项智能体评测的「性能对成本」帕累托前沿上占据一席。</p>



<h2 class="wp-block-heading">价格不变，性价比登顶</h2>



<p class="wp-block-paragraph">在推理密集型负载中，输出令牌价格往往主导总成本。Grok 4.6 维持了与 Grok 4.5 相同的定价：每百万输入、输出令牌分别为 2 美元与 6 美元。这一价格比 Claude Opus 5（5 美元 / 25 美元）和 GPT-5.6 Sol（5 美元 / 30 美元）低六成以上。</p>



<p class="wp-block-paragraph">实测中，Grok 4.6 处理单个任务的成本为 0.84 美元，与 Kimi K3 处于同一价位，但智力水平更高。评测方由此将其列入「智力对单任务成本」的帕累托前沿。在智力指数相差两分以内的可比模型中，Grok 4.6 以远低于对手的输出价格，提供了几乎相同的智力分数。</p>



<h2 class="wp-block-heading">长程任务更省令牌</h2>



<p class="wp-block-paragraph">Grok 4.6 首次进入 AA-Briefcase 私有长程知识工作基准，Elo 评分 1577，处于 Fable 5 档位，落后于 Claude Opus 5 家族。但其效率特征同样突出：平均用约 53 轮、约 5 亿输入令牌完成任务，而 Claude Opus 5（最高档）平均需要约 103 轮、约 20 亿输入令牌。</p>



<p class="wp-block-paragraph">长程智能体任务会快速累积上下文，因此一个用更少轮数、更少输入令牌得到相近答案的模型，其成本优势远超每令牌定价本身。上下文窗口方面，Grok 4.6 维持 50 万令牌，与 4.5 相同；缓存命中价每百万令牌 0.5 美元，高于 4.5 的 0.3 美元。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Artificial Analysis</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AI 写代码该选哪种语言？两轮硬核实测推翻流行说法</title>
		<link>https://mylogs.cn/best-programming-language-for-coding-agents/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 11 Aug 2026 00:09:27 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Dan Luu]]></category>
		<category><![CDATA[Token效率]]></category>
		<category><![CDATA[动态类型]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[编码智能体]]></category>
		<category><![CDATA[编程语言]]></category>
		<category><![CDATA[静态类型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/best-programming-language-for-coding-agents/</guid>

					<description><![CDATA[过去一年，开发者社区里流传着一个听上去很合理的判断：让大模型写代码时，动态类型语言比静态类型语言更划算，因为省 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">过去一年，开发者社区里流传着一个听上去很合理的判断：让大模型写代码时，动态类型语言比静态类型语言更划算，因为省掉了类型声明，代码更紧凑，消耗的 token 更少。这个说法被反复引用，甚至连搜索引擎的 AI 摘要都照单全收——搜索「动态与静态语言的 token 成本」，Google 的 AI 概览开头就是「动态类型语言的 token 成本通常低于传统静态类型语言，因为省略显式类型声明让代码更紧凑」，并引用了同一篇文章作为依据。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f8239a5262&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f8239a5262" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/16b56bd10e225eb8ff36a3caf7403a2c_header.webp" alt="AI 写代码该选哪种语言？两轮硬核实测推翻流行说法" class="wp-image-4381" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/16b56bd10e225eb8ff36a3caf7403a2c_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/16b56bd10e225eb8ff36a3caf7403a2c_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/16b56bd10e225eb8ff36a3caf7403a2c_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/16b56bd10e225eb8ff36a3caf7403a2c_header-768x525.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<p class="wp-block-paragraph">技术博主 Dan Luu 决定动手验证。他跑了两轮真实规模的评测，结论是：这个被广泛传播的判断，基本站不住脚。</p>



<h2 class="wp-block-heading">被引用最多的那份数据，题目太简单了</h2>



<p class="wp-block-paragraph">流行说法的源头是一份对比实验，作者从 Rosetta Code 上取题，测量不同语言解同一道题需要多少 token。结果显示，最费 token 的 C 语言与最省的 Clojure 之间存在 2.6 倍的差距；后来又补测了数组语言 J，平均只需 70 个 token，几乎是 Clojure（109 个）的一半。作者由此推断，如果 token 效率真的成为关键驱动力，这可能会成为编程语言演化的一个有趣方向。</p>



<p class="wp-block-paragraph">问题恰恰藏在这组数字里。Dan Luu 指出，一道能用 70 个 token 解决的题目，根本算不上题目。这类琐碎任务里，大部分工作只是把答案打印出来，性能表现无法推广到需要真正干活的场景。他此前在评测「穴居人模式」提示词时就见过同样的现象：在极简任务上宣称的巨大收益，一旦换成稍微需要动脑的问题就消失了。</p>



<p class="wp-block-paragraph">另一份支持相同结论的对比实验，毛病更隐蔽。其中一项测试执行了一条并不存在的路径，导致失败；后面某个智能体把这条不存在的路径符号链接到了自己的可执行文件，测试通过了，但代价是此后所有测试都在跑那一个智能体的可执行文件。原作者据此分析 Rust 为何出现失败，实际上只是因为 Rust 的评分环节跑在 Go 智能体做符号链接之前。</p>



<h2 class="wp-block-heading">两个真实项目：zstd 解码器与 Pandoc</h2>



<p class="wp-block-paragraph">Dan Luu 的做法是自己造评测，并且在看结果之前先公开写下预测。他给出的三条预注册判断是：95% 的把握认为动态与静态语言的整体差异说法不成立；60% 的较低把握认为在超高算力档位下静态语言会稍占上风；98% 的把握认为 J 这类「怪语言」的优势不会成立。</p>



<p class="wp-block-paragraph">第一轮评测的任务是实现一个完整的 zstd 解码器。智能体拿到 zstd 的 RFC 文档和勘误，被关在没有网络的容器里，不提供测试用例。模型统一用 GPT-5.6 Sol，分 medium 与 ultra 两档算力投入。之所以不给测试，是因为像 zstd 这种覆盖面的项目，测试不可能穷尽所有分支——Dan Luu 本人就曾在这个久经考验的软件里找到过数据损坏的缺陷。</p>



<p class="wp-block-paragraph">结果分成两层：只看 medium 档，动态语言的确聚集在成本更低、正确率更高的那一侧，看上去支持流行结论；但换到 ultra 档，格局就乱了，排在前列的反而以静态语言居多。真正稳定的规律不在动静态之分上，而在两个别的维度——汇编这类对人类也极其费劲的语言表现明显更差；冷门语言同样吃亏，合理的解释是各家 AI 实验室在小众语言上投入的合成训练数据极少甚至为零。把语言流行度和评测表现放在一起看，能观察到一个弱到中等的正相关：越主流的语言，写出来的代码往往既更正确又更便宜。这与第一份实验推崇 J 这类高密度语言的方向正好相反。</p>



<p class="wp-block-paragraph">第二轮换了完全不同的任务与呈现方式。Dan Luu 把 ProgramBench 的 Pandoc 评测改造了一下：不做原本的逆向工程题，而是把 ProgramBench 的材料连同测试一并交给智能体，再用一组留出测试来打分，更接近测试驱动开发的节奏。结论依旧：成本与得分和语言的动静态属性没有明显关系，冷门语言仍然吃亏，汇编依旧垫底，而 Clojure 在这一轮比在 zstd 那轮好得多。</p>



<p class="wp-block-paragraph">Clojure 在第一轮翻车有具体原因：40 次 medium 运行里有 36 次、40 次 ultra 运行里有 5 次出现测试失败，症结是字节转换在 128 到 255 区间抛出异常，或许应该改用 unchecked-byte。这也是一个真实存在的成本——如果没有测试兜住，这类错误会一路带到线上；即便有测试，修它同样要烧掉时间和 token。</p>



<h2 class="wp-block-heading">哪些流行判断被证伪了</h2>



<p class="wp-block-paragraph">对照两轮数据，几条在社区里流传甚广的说法可以做初步清算：</p>



<ul class="wp-block-list"><li>「代码质量参差的语言（比如 PHP）在大模型手里表现更差」——在这两项任务上不成立</li><li>「既然重写成本变低了，就该用表达力强的语言（比如 Haskell）」——同样不成立</li><li>「应该选流行语言」——有弱支持</li><li>「动态语言在小项目上占优，项目变大后被静态语言反超」——这两项任务不支持这一判断，不过两个任务的形态和呈现方式差异太大，无法确定究竟是规模因素还是别的变量在起作用</li></ul>



<p class="wp-block-paragraph">回看他自己的三条预注册判断，第一条和第三条被证实，第二条（ultra 档静态语言稍好）信息不足，若必须二选一，他倾向于判定为错误。</p>



<p class="wp-block-paragraph">值得留意的是这套方法本身的意义。Dan Luu 提到，2014 年他梳理过静态与动态类型的学术文献，除少数案例研究外收获寥寥。以一篇典型论文《静态类型系统能改善软件系统的可维护性吗？一项实证研究》为例：33 名受试者被分配修复既有代码中的错误或补全存根方法，静态组用 Java，动态组用 Groovy，采用被试内设计并随机化任务顺序。结论是类型错误场景下 Java 组更快，语义错误场景下没有差异。但该研究刻意回避了循环、递归等复杂控制结构以降低耗时方差，导致所有缺陷都是琐碎缺陷，中位解题时间只有几百秒——这恰恰是最不耗费职业程序员时间的那类问题。</p>



<p class="wp-block-paragraph">大模型改变了这件事的可行性。让智能体实现一个 zstd 解码器大约花费 20 美元，乘上语言数量和每种条件下的重复次数确实不便宜，但相比雇一位能读懂 zstd 规范并动手实现的职业程序员，这个数量级的研究此前根本不可能做，Pandoc 那一轮更是如此。许多原本无从回答的问题——什么测试手法有效、什么软件架构适合、修缺陷的成本是否因语言而异——如今至少有了动手一试的可能。</p>



<p class="wp-block-paragraph">至于最终答案，Dan Luu 的态度相当克制：绝大多数关于「某语言特别适合大模型」的流行断言看起来都是错的，但什么才是对的，目前还不清楚。</p>



<p class="has-small-font-size wp-block-paragraph">来源：danluu.com（Dan Luu）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>一道题四分钱，DeepSeek 拿下最难推理榜 61.4%</title>
		<link>https://mylogs.cn/deepseek-v4-flash-arc-agi-verified/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 08 Aug 2026 05:35:55 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI成本]]></category>
		<category><![CDATA[AI推理]]></category>
		<category><![CDATA[ARC-AGI]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[基准测试]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[开源模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/deepseek-v4-flash-arc-agi-verified/</guid>

					<description><![CDATA[抽象推理基准 ARC-AGI 的独立评测机构 ARC Prize 基金会于 2026 年 7 月 31 日公布 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">抽象推理基准 ARC-AGI 的独立评测机构 ARC Prize 基金会于 2026 年 7 月 31 日公布了对 DeepSeek V4 Flash 0731 的验证结果。在最高推理档位下，这款模型在 ARC-AGI-1 半私有测试集上取得 89.0% 的成绩，单题成本约 0.02 美元；在难度更高的 ARC-AGI-2 半私有测试集上取得 61.4%，单题成本约 0.04 美元。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f8239a659b&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f8239a659b" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header.webp" alt="一道题四分钱，DeepSeek 拿下最难推理榜 61.4%" class="wp-image-4057" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header-768x403.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：ARC Prize 基金会</figcaption></figure>





<p class="wp-block-paragraph">真正引发开发者讨论的不是分数本身，而是分数与成本的组合。</p>



<h2 class="wp-block-heading">三档推理，三种性价比</h2>



<p class="wp-block-paragraph">DeepSeek 向 ARC Prize 提交了三个推理强度变体，分别是 Max（最高）、High（较高）和 Low（较低）。用户可以自行决定单次回答投入多少算力，这一选择会直接反映在每道题的花费上。三档的验证成绩如下：</p>



<ul class="wp-block-list"><li>最高档 Max：ARC-AGI-1 得分 89.0%，ARC-AGI-2 得分 61.4%</li><li>较高档 High：ARC-AGI-1 得分 87.0%，ARC-AGI-2 得分 56.0%</li><li>较低档 Low：ARC-AGI-1 得分 84.0%，ARC-AGI-2 得分 46.0%</li></ul>



<p class="wp-block-paragraph">在 ARC-AGI-1 上，最高档与最低档之间只差 5 个百分点；但到了 ARC-AGI-2，两档差距拉开到 15.4 个百分点。这说明第二代基准对模型“想多久”这件事远比第一代敏感——同一个模型少思考一会儿，成绩就会明显滑落。</p>



<p class="wp-block-paragraph">ARC Prize 尚未公布该模型在 ARC-AGI-3 上的成绩。</p>



<h2 class="wp-block-heading">ARC-AGI 到底在考什么</h2>



<p class="wp-block-paragraph">ARC-AGI（抽象与推理语料库）由研究者弗朗索瓦·肖莱（François Chollet）设计，考察方向与常见的知识问答、代码生成类基准完全不同。每道题给出几组彩色网格的“输入—输出”示例，模型需要自行推断出其中的变换规则，再把规则套用到一个全新的输入上。</p>



<p class="wp-block-paragraph">这类题目无法靠背诵互联网语料蒙混过关，考的是面对陌生问题时的泛化能力。ARC-AGI-2 在第一代基础上刻意提高了门槛：加入需要多条规则叠加才能解出的任务，同时剔除了大模型已经学会套路化应对的题型。因此 61.4% 这个数字的含金量，明显高于同一模型在第一代上的 89.0%。</p>



<p class="wp-block-paragraph">评测采用半私有测试集，题目不对外公开，以避免答案被写进训练数据。本次公布的逐题明细覆盖 ARC-AGI-1 公开集的 400 道题与 ARC-AGI-2 公开集的 120 道题，逐条标注了三个档位各自的通过与失败情况。</p>



<h2 class="wp-block-heading">成本这一栏，为什么比分数更受关注</h2>



<p class="wp-block-paragraph">ARC Prize 的验证流程把资源消耗视为衡量指标的一部分，所以结果页会把每题成本与得分并列展示。放在整个榜单的成本—分数坐标里，V4 Flash 的位置相当靠左上：分数进入第一梯队，横轴上的花费却低了一到两个数量级。</p>



<p class="wp-block-paragraph">有开发者在技术社区讨论中指出，V4 Flash 最高档在这张图上的位置已经压过同为开放权重路线的 Kimi K3，与部分闭源前沿模型的得分区间接近，成本却只是后者的零头。需要说明的是，这类对比来自社区解读，并非 ARC Prize 的官方结论。</p>



<p class="wp-block-paragraph">同样需要提醒的是，0.02 美元和 0.04 美元只对应本次评测中的单道基准题目，不能直接换算成实际业务开销。真实应用里的智能体往往要反复调用工具、维持超长上下文、产出大段文本，累计花费会远高于一道基准题。</p>



<h2 class="wp-block-heading">开放权重阵营的位置在变化</h2>



<p class="wp-block-paragraph">过去两年，抽象推理长期被视为闭源前沿模型的专属优势区。测试时计算（让模型在回答前多想一会儿）的思路虽然把成绩推了上去，但高档位的单题成本一度停留在数美元量级，规模化使用并不现实。</p>



<p class="wp-block-paragraph">DeepSeek 由梁文锋创办，总部位于杭州。此次 V4 Flash 0731 以开放权重形态拿到经第三方验证的成绩，意味着开发者既可以调用其接口，也可以自行部署后按需调节推理强度，在延迟、预算和准确率之间做取舍——这种灵活度，正是把推理能力塞进智能体流水线时最实际的考量。</p>



<p class="has-small-font-size wp-block-paragraph">来源：ARC Prize 基金会 ARC-AGI 验证结果页</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
