在 2026 世界机器人大会(WRC 2026)上,国产人工智能公司生数科技(ShengShu Technology)公布了通用世界模型(General World Models,简称 GWM)的五级路线图,把”理解世界、想象可能的未来、采取动作”串成一条闭环路径,并宣称其研发与部署已经覆盖其中前三级。
从”理解世界”到”行动于世界”
生数科技创始人兼首席科学家朱军(Jun Zhu)是清华大学人工智能研究院副院长,也是 ACM、IEEE、AAAI 三院 Fellow。他在大会论坛演讲中把通用世界模型定义为一种闭环系统:持续整合对世界的理解、对未来的想象,以及物理或数字层面的动作执行。在他看来,当前的人工智能系统虽然单点能力突出,但整体上仍处在”割裂”状态——有的擅长生成,有的擅长理解,有的负责执行,很少能统一完成这三件事。通用世界模型因此被视为通往通用人工智能(AGI)的重要方向,也是连接数字世界与物理世界的桥梁。
五级路线图:L1 到 L5
路线图的五个级别并非彼此独立的产品方向,而是能力逐级递进的演化过程:
- L1 世界生成(World Generation):生成连贯的世界轨迹。视频帮助模型学习物体、运动、空间关系与时间动态,为更深层的理解与想象打底。
- L2 交互世界(Interactive World):在生成基础上接收实时输入,根据语言、语音或控制信号持续改变后续发生的内容,从一次性生成走向连续交互。
- L3 可行动世界(Actionable World):模型从数字世界进入物理世界,环境理解、未来预测与动作生成协同,产出可执行的机器人动作并依据真实反馈优化决策。
- L4 自主世界智能体(Autonomous World Agent):迈向自主决策,主动感知环境、拆解任务、探索未知状态,并围绕长期目标持续规划动作。
- L5 世界编排器(World Orchestrator):超越单一智能体,协调机器人、数字智能体、人类、工具等资源,实现复杂任务分配与多智能体协作。
生数科技表示,其研究与部署已覆盖前三级:L1 由 2024 年发布的视频生成基础模型 Vidu 初步实现;L2 由 2026 年 7 月发布的 Vidu S1 推进到实时交互,用户可通过语音干预并持续影响后续生成;L3 则由 Motus 与 Motubrain 承担,把能力从视频生成推向物理动作。
从视频到机器人:Motubrain 的关键数据
Motus 于 2025 年 12 月发布并完全开源,标志着生数科技从视频生成走向物理动作。Motubrain 则在 2026 年 4 月发布,基于 Mixture-of-Transformers(MoT,混合专家Transformer)架构,将环境理解、世界状态预测与动作轨迹生成统一进单一模型,把通用世界模型从视觉模拟推向物理决策。
据披露,相比 Motus,Motubrain 的推理速度约快 10 倍,并且只需 50 至 100 个人类演示就能适配新的机器人本体。在 RoboTwin 2.0 基准测试中,Motubrain 取得 96.1 分的成绩,排名排行榜第一,并已在 Galaxea AI 等多种机器人本体上完成验证,展现出长程任务、多任务场景与跨本体泛化能力。
三大支柱:数据、架构与算力
生数科技把构建通用世界模型拆成三个基本要素。其一是数据:需要一层层递进的数据金字塔,从网络规模视频、精选教学视频、第一视角人类视频,到人类演示动作、真实机器人交互;合成数据可增强每一层,而”不完美”数据(失败尝试、纠正动作、恢复轨迹)同样提供宝贵的学习信号。其二是架构:必须在统一框架内处理图像、视频、语言和机器人动作,MoT 通过分配模态特定参数并保留共享注意力来实现跨模态交互。其三是算力:大规模预训练与实时部署都依赖训练基础设施、推理加速、模型蒸馏与高效注意力。
通往 L4/L5 的六道关卡
尽管前三级已有具体落地,生数科技也坦承,迈向更高层级的世界智能仍有显著差距,并列出六项关键挑战:跨理解、想象、动作与迁移的联合评估;学习接触、摩擦、力等物理动态及其干预后果;持久且可修订的记忆;通过真实交互进行在线学习与自我改进;在延迟与资源约束下实现高效闭环部署;以及更强的安全性与可控性。
国产 AI 的世界模型布局
生数科技是国产 AI 视频大模型 Vidu 的研发方。Vidu 于 2024 年 4 月由清华大学与生数科技联合发布,基于原创的 U-ViT 架构,是全球首个融合 Diffusion 与 Transformer 技术的视频生成模型。从视频模型到世界模型,从数字空间到物理空间,生数科技正在探索一条更完整的通用智能路径。随着相关技术持续演进,通用世界模型有望加快走向真实产业场景,在制造、物流与服务机器人等领域释放价值。








