李飞飞Atlas世界模型:一张照片生成3D世界

李飞飞创立的 World Labs 于 9 月 1 日发布 Atlas,官方称其为“全球首个多模态世界模型”。它的核心能力是:输入一张或几张普通照片,就能生成带像素级相机控制、最长 1 分钟 1440p 的可探索视频,并重建出包含点云与 3D Gaussian 显式表示的真实 3D 场景。这意味着 AI 从“生成一段好看的画面”迈向“生成一个可以走进去、用起来的世界”。

Atlas 和普通视频生成模型有何不同?

过去两年的 AI 视频工具(如 Sora、可灵、Runway)本质是“像素预测”:模型学习“下一帧长什么样”,但不一定理解画面背后的几何、物理与空间结构,一旦要求复杂运镜就容易变形穿帮。

Atlas 的官方口号直白地划清了边界:建模世界(Model worlds)、移动相机(Move cameras)、模拟空间和时间(Simulate space and time)。它不学习“下一帧”,而是学习“一个可由移动相机观察的三维世界”。其架构为“多模态自回归扩散 Transformer”,从零预训练;关键设计是“空间上下文”——把相机位姿、3D 深度图作为原生输入,空间成为模型的先验,而非像素的附庸。

Atlas 能做哪四件事?

相机控制生成:输入 1 至 6 张图片并指定相机轨迹(推近、环绕、摇移),生成带像素级相机控制的视频,最长 1 分钟、1440p 分辨率。相比传统视频模型“靠提示词猜运镜”,这里是用户直接给定坐标。- 空间重建:基于输入图像重建真实场景,典型场景 2 至 3 张图即可保真,最多可接受 100 张以上输入;输出点云与 3D Gaussian Splats。官方演示中,斯坦福校园仅用 2 至 25 张地面照片就生成了航拍漫游路径。- 时空模拟:输入一段视频,同时建模其中的空间与时间,转换观察视角、制作戏剧性运镜,相当于给已有素材一个“虚拟导演”。- 图像与全景生成:文本生成图片与 360° 全景图,能准确渲染画面中的文字并覆盖多种视觉风格(官方称这并非主攻方向,而是“每个图像都是一扇通往可能世界的窗口”的自然副产品)。

评测表现如何?

以下为 World Labs 官方自报数据(第三方人类评分 + 官方复现基线),供参考:

评测维度 Atlas 结果 对比基线
相机控制人类评分胜率 75%–94% 优于 MiniMax H3、Gemini Omni Flash、FLUX 3、Seedance 2.5
稀疏视角 3D 重建 AbsRel 误差(×10⁻³) 25.3 低于 Pi3X(28.7)、π³(34.7)、VGGT-Ω(36.4)、Depth Anything 3(39.3)

需要说明的是,Atlas 的参数量、训练数据与算力规模目前均未公开,上述基准属于厂商自报,独立验证仍待进行。

它最大的价值在哪里?

Atlas 最受关注的落点在具身智能(Embodied AI)。机器人训练的最大瓶颈是缺乏廉价、可控、可规模化的真实经验——真实数据采集成本极高且难覆盖多样场景。Atlas 打通了一条路径:几张照片即可生成逼真的 RGB 与深度数据,让机器人在多样化的模拟空间中训练与测试。这正是英伟达机器人业务负责人 Jim Fan 所称“机器人 Real-to-Sim(真实到仿真)的一大步”,也是李飞飞团队 7 月底发布的 Real-to-Sim-to-Real 系统闭环的关键一环。对影视行业同样意义重大:传统特效需数百机位采集、人工建模,而 Atlas 用几张照片就能补全可探索的三维场景。

和谁在竞争?

世界模型赛道已不孤单。Google DeepMind 的 Genie 3(2025 年 8 月发布)可生成 20 至 24 帧每秒、720p 的交互世界;NVIDIA 的 Cosmos 世界基础模型直指机器人与自动驾驶,下载量已超 200 万次。学术路线也存在分歧:Yann LeCun 主张表征派(I-JEPA),认为生成式像素预测是“幻觉”,应预测抽象状态表征;World Labs 则押注“持久、可编辑、物理一致的显式 3D 空间”。批评者指出,Atlas 目前公开的评测只覆盖相机条件生成与 3D 重建,流体、布料等复杂物理仍是全行业未解难题。

现在能用吗?

Atlas 目前处于早期访问(early access)阶段,优先面向合作伙伴,开发者可通过官网提交申请;它将成为未来 Marble 及 World Labs 其他产品的底层基础模型。World Labs 累计融资约 12.3 亿美元(投资方含英伟达、AMD、Autodesk、富达等),估值约 52.9 亿美元。

结语

Atlas 未必是终点,但它是“空间智能”路线一次有说服力的落地:用一张照片撑起一个可观察、可重建、可模拟的三维世界。它能否真正改变机器人与内容生产的范式,取决于复杂物理的建模进度与开放节奏,但其方向已经足够清晰。

本文由科技观察团队整理,事实依据 World Labs 官方博客及多家媒体报道,文中公司名、模型名、评测名保留英文原名。