宇树全开源人形机器人基座模型:单模型统筹64个任务

9月10日,宇树科技宣布完全开源 UnifoLM-WLA-1.0 具身基座模型。这是该公司全新一代通用人形机器人基础模型,代码、模型与数据集同步开放,项目主页已上线。

官方称,该模型在多项具身推理评测中领先国内外开源模型,亦可比肩头部闭源模型,刷新了全球开源模型多项评测的最好成绩。

6B参数,5M+样本与约2500小时真机数据

据介绍,UnifoLM-WLA-1.0 依托大规模通用多模态感知与理解数据训练,并融合以交互为中心的世界建模,全面提升空间感知与理解能力。

关键参数方面,模型参数量为 6B,使用了 500万以上 ER(具身推理)训练样本,以及约 2500 小时真机数据。

真机评测显示,该模型可以由单一模型统筹 64 个任务,覆盖桌面操作与全身移动操作两类场景,具备跨任务、跨末端执行器的泛化能力,做到一模驱动、全身协同。

VLA与WMA两条路线,构建开源体系

此次开源是宇树通用人形基础模型的一次全面升级。在此之前,宇树科技已先后开源 UnifoLM-VLA-0 视觉-语言-动作大模型,以及 UnifoLM-WMA-0 世界模型-动作架构,形成了覆盖 VLA 与 WMA 两条技术路线的具身智能开源体系。

其中,UnifoLM-VLA-0 在 LIBERO 仿真基准测试中取得 98.7 分的成绩,在空间、物体、目标和长序列四个子项上的得分分别为 99.0、100、99.4 和 96.2。

开源意味着什么

通用人形机器人一直面临一个现实难题:真实世界的物理数据获取成本高、场景碎片化,单一实验室很难覆盖足够多的任务与本体形态。把基础模型连同数据集一起开放,相当于把这一层公共基础设施交给了整个行业。

对开发者和研究者而言,直接收益是研发门槛的下降——不必从零构建感知与世界模型模块,可以把精力放在具体场景的适配与精细化调优上。对宇树自身而言,开源也是扩大生态、吸引更多人在其硬件与软件栈上做开发的方式。

从技术路线上看,”世界模型-动作”(WMA)架构强调让模型先学会预测环境如何随动作变化,再据此决策。此前多家机构都在探索把世界模型引入机器人控制,宇树此次选择将这条路线的基础模型完整开源,为业界提供了一个可直接复现和比较的基准。

至于这套模型在真实机器人上的长期表现如何、跨本体迁移的实际效果如何,还需要更多第三方在真实场景中的验证。