1.3B 世界模型开源:蚂蚁灵波让单卡跑实时交互世界

1.3B 世界模型正式开源:蚂蚁灵波把实时交互世界模型的运行门槛,从服务器级算力拉到一张消费级显卡。个人开发者无需集群,也能在本地实时生成可交互的虚拟世界。

继今年 7 月发布 14B 主模型后,蚂蚁灵波科技本周再开源三款模型:LingBot-World 2.0 Small(1.3B)、Bidirectional(双向教师模型)与 Causal Pretrain(因果预训练底座)。其中 1.3B 版本面向消费级单卡 GPU 设计,可在单卡上实现实时生成。

LingBot-World 2.0 是一个实时交互世界模型,支持小时级连续生成,可响应攻击、射箭、施法、射击等角色动作,以及下雪、下雨等环境事件。在更高算力与相应推理配置下,可达到 720P / 60FPS 的高清实时体验。技术架构上,模型接收相机位姿与文本指令两类控制信息:相机位姿通过位姿编码与自适应层归一化调整画面生成;文本指令通过交叉注意力机制关联不同视频片段的提示词,实现剧情动态更新。团队采用分布匹配蒸馏(DMD)应对长时生成中的累计漂移。系统还接入“导演—执行”框架,由视觉语言模型观察场景并提出事件,视频模型负责生成后续画面。其基础模型基于万相(Wan)开发,推理代码已适配 SGLang。值得注意的是,1.3B 版本采用商用开源协议,而 14B 版本为非商用,对中小企业更友好。

14B 与 1.3B 到底差在哪

>

规格 14B 版本 1.3B 版本
输出规格 720P / 60FPS 720P / 60FPS
开源协议 非商用 商用
部署硬件 服务器级 消费级独立显卡

真正让一项技术扩散开的,往往不是最强的版本,而是第一个足够小、便宜、能被拿来尝试的版本。1.3B 的意义不在于参数少,而在于它把“能否跑起来”这个硬门槛拆掉了。过去世界模型更多停留在论文 demo 与在线体验,开发者只能“看”,不能“改”;现在可以本地运行、修改输入、测试交互设计、搭建原型。这对机器人仿真、游戏资产生成、具身智能训练数据的低成本合成,都是直接利好。

与 Google Genie、Meta 及英伟达 Cosmos 等世界模型相比,LingBot-World 2.0 的差异化在于“实时交互 + 开源可商用 + 单卡可跑”三者同时成立。多数同类模型要么闭源,要么需要集群,要么仅支持离线生成。蚂蚁灵波同步开源 Causal Pretrain 与 Bidirectional,等于把后训练、评测、蒸馏、压缩、推理加速到场景适配的完整二次开发链路都交给了社区,降低了垂直场景小模型蒸馏的起步成本。

从行业节奏看,世界模型正从“研究玩具”走向“生产力底座”。当单次生成能在消费级显卡上实时完成,它就不只是演示视频,而可以成为游戏引擎的素材生成器、机器人训练的仿真器、影视预演的草图工具。蚂蚁灵波用 1.3B 商用版把这条路铺到了个人开发者的桌面上,后续若能补齐动作多样性与长时序一致性,实用价值会进一步放大。

什么是世界模型?

>

世界模型是一类能够基于当前状态与控制指令,实时生成后续画面与事件的生成式模型,常用于机器人仿真、游戏与具身智能训练。

1.3B 版本和 14B 版本有什么不同?

>

核心差异在部署门槛与授权:1.3B 面向消费级单卡、采用商用协议;14B 需服务器级算力、仅限非商用,但生成质量与稳定性更高。

个人开发者现在能做什么?

>

可在 Hugging Face 与魔搭社区下载 1.3B 模型,本地运行实时交互世界,并基于 Causal Pretrain 做后训练,或蒸馏出更小的垂直场景模型。

本文基于蚂蚁灵波官方技术报告(arXiv:2607.07534)、IT之家公开报道及行业公开分析撰写。