<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>人机差异 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e4%ba%ba%e6%9c%ba%e5%b7%ae%e5%bc%82/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Wed, 26 Aug 2026 16:52:42 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AI 在哪些智力题上栽跟头？七类测试看清人机差距</title>
		<link>https://mylogs.cn/ai-%e5%9c%a8%e5%93%aa%e4%ba%9b%e6%99%ba%e5%8a%9b%e9%a2%98%e4%b8%8a%e6%a0%bd%e8%b7%9f%e5%a4%b4%ef%bc%9f%e4%b8%83%e7%b1%bb%e6%b5%8b%e8%af%95%e7%9c%8b%e6%b8%85%e4%ba%ba%e6%9c%ba%e5%b7%ae%e8%b7%9d/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 26 Aug 2026 16:52:42 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[MIT]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[人机差异]]></category>
		<category><![CDATA[基准测试]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[推理能力]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-%e5%9c%a8%e5%93%aa%e4%ba%9b%e6%99%ba%e5%8a%9b%e9%a2%98%e4%b8%8a%e6%a0%bd%e8%b7%9f%e5%a4%b4%ef%bc%9f%e4%b8%83%e7%b1%bb%e6%b5%8b%e8%af%95%e7%9c%8b%e6%b8%85%e4%ba%ba%e6%9c%ba%e5%b7%ae%e8%b7%9d/</guid>

					<description><![CDATA[拼图、谜题与游戏一直是检验人工智能能力的试金石。从最早的西洋跳棋、国际象棋，到围棋，开发者用一道道&#8221 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">拼图、谜题与游戏一直是检验人工智能能力的试金石。从最早的西洋跳棋、国际象棋，到围棋，开发者用一道道&#8221;游戏关&#8221;衡量模型进步。近期《麻省理工科技评论》梳理了七类让当前 AI 频频失手的测试，也为人机认知差异提供了一扇观察窗。</p>

<p class="wp-block-paragraph">先说好消息：纯拼谜能力上 AI 进步飞快。2024 年底，哥伦比亚大学团队发现即便最强的模型也仅能解出 18% 的《纽约时报》Connections 字谜；到 2025 年初，部分模型已能近乎完美地每次通关。</p>

<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f3f7876171&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f3f7876171" class="wp-block-image size-large wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1000" height="1000" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/7bf1c441f4c51fd16a154736a258fe56_header.webp" alt="AI 智力测试示意图" class="wp-image-5463" srcset="https://mylogs.cn/wp-content/uploads/2026/08/7bf1c441f4c51fd16a154736a258fe56_header.webp 1000w, https://mylogs.cn/wp-content/uploads/2026/08/7bf1c441f4c51fd16a154736a258fe56_header-300x300.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/7bf1c441f4c51fd16a154736a258fe56_header-150x150.webp 150w, https://mylogs.cn/wp-content/uploads/2026/08/7bf1c441f4c51fd16a154736a258fe56_header-768x768.webp 768w" sizes="(max-width: 1000px) 100vw, 1000px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：MIT Technology Review</figcaption></figure>

<p class="wp-block-paragraph">但在另一些维度，模型依然吃瘪。其一是空间推理：即便具备视觉能力的语言模型，在&#8221;心理旋转&#8221;这类三维物体角度判断题上仍一塌糊涂。其二是记忆与适应：2024 年 Google 与伊利诺伊大学厄巴纳-香槟分校的研究显示，当&#8221;骑士与无赖&#8221;经典逻辑谜题出现细微变体时，模型常忽略关键差异、照搬训练记忆作答；类似的 SimpleBench 测试也发现，题目若与训练中见过的复杂问题形似，人类能识破陷阱，顶尖模型却会栽跟头。</p>

<p class="wp-block-paragraph">抽象与视觉推理同样薄弱。在著名的 ARC-AGI 基准中，模型在网格以&#8221;颜色数字串&#8221;编码输入时表现更好；即便答对，也常依赖繁复却无法泛化的规则。其四是直觉：人类有许多 AI 不具备的认知偏差；2023 年《自然·计算科学》的研究发现，LLM 中曾出现类人的直觉偏差，但在 ChatGPT 中又消失了。其五是复杂度：苹果公司的研究显示，模型能解简单的汉诺塔与渡河谜题，但当圆盘或人数增至 6 以上便开始失败；华盛顿大学、斯坦福大学与艾伦人工智能研究所也观察到逻辑网格谜题（ZebraLogic）存在类似瓶颈。</p>

<p class="wp-block-paragraph">谜题的价值，正在于既展示 AI 能力的飞跃，也标出它尚未跨越的边界。</p>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
