AI 在哪些智力题上栽跟头?七类测试看清人机差距

拼图、谜题与游戏一直是检验人工智能能力的试金石。从最早的西洋跳棋、国际象棋,到围棋,开发者用一道道”游戏关”衡量模型进步。近期《麻省理工科技评论》梳理了七类让当前 AI 频频失手的测试,也为人机认知差异提供了一扇观察窗。

先说好消息:纯拼谜能力上 AI 进步飞快。2024 年底,哥伦比亚大学团队发现即便最强的模型也仅能解出 18% 的《纽约时报》Connections 字谜;到 2025 年初,部分模型已能近乎完美地每次通关。

但在另一些维度,模型依然吃瘪。其一是空间推理:即便具备视觉能力的语言模型,在”心理旋转”这类三维物体角度判断题上仍一塌糊涂。其二是记忆与适应:2024 年 Google 与伊利诺伊大学厄巴纳-香槟分校的研究显示,当”骑士与无赖”经典逻辑谜题出现细微变体时,模型常忽略关键差异、照搬训练记忆作答;类似的 SimpleBench 测试也发现,题目若与训练中见过的复杂问题形似,人类能识破陷阱,顶尖模型却会栽跟头。

抽象与视觉推理同样薄弱。在著名的 ARC-AGI 基准中,模型在网格以”颜色数字串”编码输入时表现更好;即便答对,也常依赖繁复却无法泛化的规则。其四是直觉:人类有许多 AI 不具备的认知偏差;2023 年《自然·计算科学》的研究发现,LLM 中曾出现类人的直觉偏差,但在 ChatGPT 中又消失了。其五是复杂度:苹果公司的研究显示,模型能解简单的汉诺塔与渡河谜题,但当圆盘或人数增至 6 以上便开始失败;华盛顿大学、斯坦福大学与艾伦人工智能研究所也观察到逻辑网格谜题(ZebraLogic)存在类似瓶颈。

谜题的价值,正在于既展示 AI 能力的飞跃,也标出它尚未跨越的边界。