同一个游戏让 AI 做两遍:Astra 更快,Fable 更好玩

“通用人工智能(AGI)出现了。祝贺 OpenAI 团队!”当地时间 9 月 9 日,英伟达 CEO 黄仁勋在 X 平台上为 OpenAI 新发布的 GPT-6 Astra 背书。他同时透露,这款模型是在超过 10 万块他家的 Grace Blackwell GPU 上训练的,另外还有 40 万块即将上线。

AGI 真的来了吗?科技频道 Fireship 当天发布了一段实测视频,把 Astra 与 Anthropic 的 Claude Fable 5.1 放在同一张考卷上正面交锋——让两个模型做同一款游戏,看看”AGI 认证”的成色如何。结果颇有意思:一个更快更好看,一个却更好玩。

同一道考题:火箭发射模拟器

测试方法很简单:给两个模型完全相同的提示词——”做一个火箭发射模拟器,可以定制火箭并把它发射入轨”,同时开跑。

Astra 大约 26 分钟交卷。成品 3D 图形精美、界面干净,错误极少,火箭绕着地球飞行的画面相当惊艳。但问题也很明显:玩法单薄,界面设计则带着一股熟悉的”AI 味”——和社交平台上其他 AI 生成游戏如出一辙的公式化模板。

Fable 5.1 交卷要晚得多。图形不如 Astra 精致,界面甚至有点像老式的 Bootstrap 风格。但游戏本身明显更扎实:火箭定制选项更复杂,内置了真实的科学计算,玩起来更像一个”正经的模拟器”,成功与失败的可能性更多样,爆炸动画也更酷。

谁来当裁判?视频里让孩子们试玩后投票:3 岁的孩子更喜欢 Astra 的简单版本,8 岁的孩子则一眼相中了 Fable 的复杂版本。

3D 生成能力的惊人一跃

这次对比中最令人吃惊的其实是 Astra 的 3D 生成能力。仅仅两个月前的 7 月,让当时的 OpenAI 模型画一张机械手表的拆解结构图,得到的结果被形容为”没用的垃圾”;而如今用 Astra 重跑同样的提示词,几秒钟就能产出一张人类 3D 设计师需要数百小时才能完成的三维结构图。

这也引出了一个担忧:如果 AI 能轻松复制这类高强度 3D 解说内容,视频平台上或将迎来一波低质量模仿内容潮——那些以精工细作著称的 3D 科普创作者,可能会被批量生成的”速食复制品”淹没。

“HorseTinder”测试:差几个像素的 AGI

为了验证 AGI 之说,Fireship 还设计了一道”试金石”题目:让 Astra 无错误地复刻一个名为”HorseTinder”( tinder 式的选马应用)的应用。21 分钟后,Astra 交出了比 Fable 几个月前同类作品更干净优雅的设计,经过反复代码审查竟然一个错误都没找到——那一刻,结论似乎已经指向”黄仁勋是对的”。

转折出现在最后一刻:胡萝卜图案上有几个像素错位了。于是视频的最终结论变成了玩笑式的反转——Astra 只是”又一个聪明的 AI 模型”,而非 AGI。

从公开基准看,两个模型的缠斗远未分出胜负:Astra 登顶了 ARC-AGI 榜单(旨在测试泛化智能而非记忆),不过伯克利团队此前曾用 Opus 4.8 加 Fable 5 配合自建测试框架拿到过 99% 的成绩——”框架”才是关键变量。在第三方评测中,AutomationBench 上 Astra 以 41.4% 对 31.4% 领先 Fable 5.1;终端基准 Terminal-Bench 4.0 两者接近(57.9% 对 55.8%);而独立机构 Artificial Analysis 的编程智能体指数则是 Fable 5.1 以 70 对 67 反超,Cursor 团队也独立确认 Fable 5.1 是其 CursorBench 上首日得分最高的模型。成本方面,OpenAI 宣称 Astra 完成单个编程智能体任务的成本约为 Fable 5 的一半。

怎么选:没有绝对赢家

这场同题对决的实际结论相当务实:两个模型各有所长,按需求选即可。

追求速度和视觉效果——比如快速搭一个能跑的游戏原型、3D 展示、界面驱动型任务——Astra 的表现更出色;而看重玩法深度、多文件复杂逻辑的一致性、长时间编程会话的稳定性,Fable 5.1 依然是更稳妥的选择。已经在用某一家的开发团队,也不必急着”迁移”,更合理的做法是拿自己的真实任务做一次 A/B 测试再决定。

至于 AGI,至少从这场测试看,”更快、更好看”和”真正好玩”之间,还隔着一道人类审美与游戏设计的鸿沟。

]]>