<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Epoch AI &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/epoch-ai/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sat, 26 Sep 2026 11:21:18 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>GPT-6 Astra 识破宜家装错：准确率冲到 80%</title>
		<link>https://mylogs.cn/gpt-6-astra-%e8%af%86%e7%a0%b4%e5%ae%9c%e5%ae%b6%e8%a3%85%e9%94%99%ef%bc%9a%e5%87%86%e7%a1%ae%e7%8e%87%e5%86%b2%e5%88%b0-80/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 26 Sep 2026 11:21:18 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Epoch AI]]></category>
		<category><![CDATA[GPT-6 Astra]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[多模态模型]]></category>
		<category><![CDATA[家具组装基准测试]]></category>
		<category><![CDATA[视觉推理]]></category>
		<guid isPermaLink="false">https://mylogs.cn/gpt-6-astra-%e8%af%86%e7%a0%b4%e5%ae%9c%e5%ae%b6%e8%a3%85%e9%94%99%ef%bc%9a%e5%87%86%e7%a1%ae%e7%8e%87%e5%86%b2%e5%88%b0-80/</guid>

					<description><![CDATA[装家具装到一半才发现板子装反了——这类让人抓狂的体验，未来或许会有 AI 来兜底。人工智能评测机构 Epoch [&#8230;]]]></description>
										<content:encoded><![CDATA[<figure data-wp-context="{&quot;imageId&quot;:&quot;6ab7d118518bc&quot;}" data-wp-interactive="core/image" data-wp-key="6ab7d118518bc" class="wp-block-image wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/gpt6astra-fab_header.webp" alt="Epoch AI 家具组装基准测试示意图" title="图片来源：IT之家" style="max-width:100%;height:auto;"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button></figure>
<p class="wp-block-paragraph">装家具装到一半才发现板子装反了——这类让人抓狂的体验，未来或许会有 AI 来兜底。人工智能评测机构 Epoch AI 于当地时间 9 月 23 日发布了一项名为「家具组装基准测试」的新评测，专门考察多模态模型能否通过照片对照说明书，发现宜家家具在组装过程中出现的错误。</p>
<h2 class="wp-block-heading">测试怎么考</h2>
<p class="wp-block-paragraph">该基准测试准备了三款宜家家具，研究人员故意进行错误组装，并在不同阶段拍摄共 60 张过程照片。参测模型会同时拿到组装照片、官方 PDF 说明书、图片放大工具以及 Python 解释器，需要判断是否存在错误，并定位具体出错步骤、说明问题所在。评分采用多阶段验证：只要模型能正确找到错误步骤并大致描述问题，即可得分。</p>
<h2 class="wp-block-heading">准确率一年涨近三倍</h2>
<p class="wp-block-paragraph">结果显示，OpenAI 最新的 GPT-6 Astra 以 80% 的准确率位居榜首。Anthropic 的 Claude Fable 5.1 和 Claude Opus 5 分别达到 70% 和 61%。作为对比，2025 年 11 月时的领先模型 Claude Opus 4.5 准确率仅为 28%——前沿模型在约 10 个月内实现了近三倍的提升。</p>
<p class="wp-block-paragraph">除了准确率，GPT-6 Astra 的推理效率也明显改善。其完成单张照片分析的中位耗时约为 3 分钟，是研究中速度最快的模型，比此前领先模型快约 2 至 10 倍。不过研究人员也指出，这一速度距离真正意义上的实时组装指导仍有差距。</p>
<h2 class="wp-block-heading">不同模型的「翻车」方式</h2>
<p class="wp-block-paragraph">研究还归纳了模型的典型错误模式：谷歌 Gemini 和阿里 Qwen 系列模型几乎总是先假定存在错误，再去找错；而早期 Anthropic 和 OpenAI 模型则相反，经常完全找不到错误。研究者认为，错误是否隐蔽、拍摄视角以及出错后继续组装的程度，比家具本身的复杂度更能影响难度。</p>
<h2 class="wp-block-heading">中国模型的表现</h2>
<p class="wp-block-paragraph">在中国模型中，目前表现最好的开源权重模型 Kimi K3 相比国际前沿约落后 7 个月，这一差距比其在综合能力评估中约 4.4 个月的差距更大。研究指出，精细视觉推理仍是中国部分模型的相对薄弱方向，而 DeepSeek V4 Pro、GLM 5.3 等热门模型暂时未提供图像理解能力。</p>
<h2 class="wp-block-heading">意义不止于家具</h2>
<p class="wp-block-paragraph">Epoch AI 认为，这类任务结合了图像理解、空间推理与多步骤指令匹配，能够较好地反映多模态模型处理现实问题的水平。随着相关能力提升，未来 AI 有望在汽车维修、家电检修、设备安装等需要结合图像与技术说明进行判断的场景中，提供更具针对性的实时辅助；制造质检、远程技术支持等流程也有望受益。</p>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
