<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Vidu &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/vidu/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Mon, 24 Aug 2026 18:52:08 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>生数科技发布通用世界模型五级路线图</title>
		<link>https://mylogs.cn/%e7%94%9f%e6%95%b0%e7%a7%91%e6%8a%80%e5%8f%91%e5%b8%83%e9%80%9a%e7%94%a8%e4%b8%96%e7%95%8c%e6%a8%a1%e5%9e%8b%e4%ba%94%e7%ba%a7%e8%b7%af%e7%ba%bf%e5%9b%be/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 24 Aug 2026 18:52:08 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Vidu]]></category>
		<category><![CDATA[世界模型]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[具身智能]]></category>
		<category><![CDATA[生数科技]]></category>
		<category><![CDATA[通用世界模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e7%94%9f%e6%95%b0%e7%a7%91%e6%8a%80%e5%8f%91%e5%b8%83%e9%80%9a%e7%94%a8%e4%b8%96%e7%95%8c%e6%a8%a1%e5%9e%8b%e4%ba%94%e7%ba%a7%e8%b7%af%e7%ba%bf%e5%9b%be/</guid>

					<description><![CDATA[在 2026 世界机器人大会（WRC 2026）上，国产人工智能公司生数科技（ShengShu Technol [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">在 2026 世界机器人大会（WRC 2026）上，国产人工智能公司生数科技（ShengShu Technology）公布了通用世界模型（General World Models，简称 GWM）的五级路线图，把&#8221;理解世界、想象可能的未来、采取动作&#8221;串成一条闭环路径，并宣称其研发与部署已经覆盖其中前三级。</p>

<h2 class="wp-block-heading">从&#8221;理解世界&#8221;到&#8221;行动于世界&#8221;</h2>

<p class="wp-block-paragraph">生数科技创始人兼首席科学家朱军（Jun Zhu）是清华大学人工智能研究院副院长，也是 ACM、IEEE、AAAI 三院 Fellow。他在大会论坛演讲中把通用世界模型定义为一种闭环系统：持续整合对世界的理解、对未来的想象，以及物理或数字层面的动作执行。在他看来，当前的人工智能系统虽然单点能力突出，但整体上仍处在&#8221;割裂&#8221;状态——有的擅长生成，有的擅长理解，有的负责执行，很少能统一完成这三件事。通用世界模型因此被视为通往通用人工智能（AGI）的重要方向，也是连接数字世界与物理世界的桥梁。</p>

<h2 class="wp-block-heading">五级路线图：L1 到 L5</h2>

<p class="wp-block-paragraph">路线图的五个级别并非彼此独立的产品方向，而是能力逐级递进的演化过程：</p>

<ul class="wp-block-list"><li><strong>L1 世界生成（World Generation）</strong>：生成连贯的世界轨迹。视频帮助模型学习物体、运动、空间关系与时间动态，为更深层的理解与想象打底。</li><li><strong>L2 交互世界（Interactive World）</strong>：在生成基础上接收实时输入，根据语言、语音或控制信号持续改变后续发生的内容，从一次性生成走向连续交互。</li><li><strong>L3 可行动世界（Actionable World）</strong>：模型从数字世界进入物理世界，环境理解、未来预测与动作生成协同，产出可执行的机器人动作并依据真实反馈优化决策。</li><li><strong>L4 自主世界智能体（Autonomous World Agent）</strong>：迈向自主决策，主动感知环境、拆解任务、探索未知状态，并围绕长期目标持续规划动作。</li><li><strong>L5 世界编排器（World Orchestrator）</strong>：超越单一智能体，协调机器人、数字智能体、人类、工具等资源，实现复杂任务分配与多智能体协作。</li></ul>

<p class="wp-block-paragraph">生数科技表示，其研究与部署已覆盖前三级：L1 由 2024 年发布的视频生成基础模型 Vidu 初步实现；L2 由 2026 年 7 月发布的 Vidu S1 推进到实时交互，用户可通过语音干预并持续影响后续生成；L3 则由 Motus 与 Motubrain 承担，把能力从视频生成推向物理动作。</p>

<h2 class="wp-block-heading">从视频到机器人：Motubrain 的关键数据</h2>

<p class="wp-block-paragraph">Motus 于 2025 年 12 月发布并完全开源，标志着生数科技从视频生成走向物理动作。Motubrain 则在 2026 年 4 月发布，基于 Mixture-of-Transformers（MoT，混合专家Transformer）架构，将环境理解、世界状态预测与动作轨迹生成统一进单一模型，把通用世界模型从视觉模拟推向物理决策。</p>

<p class="wp-block-paragraph">据披露，相比 Motus，Motubrain 的推理速度约快 10 倍，并且只需 50 至 100 个人类演示就能适配新的机器人本体。在 RoboTwin 2.0 基准测试中，Motubrain 取得 96.1 分的成绩，排名排行榜第一，并已在 Galaxea AI 等多种机器人本体上完成验证，展现出长程任务、多任务场景与跨本体泛化能力。</p>

<h2 class="wp-block-heading">三大支柱：数据、架构与算力</h2>

<p class="wp-block-paragraph">生数科技把构建通用世界模型拆成三个基本要素。其一是数据：需要一层层递进的数据金字塔，从网络规模视频、精选教学视频、第一视角人类视频，到人类演示动作、真实机器人交互；合成数据可增强每一层，而&#8221;不完美&#8221;数据（失败尝试、纠正动作、恢复轨迹）同样提供宝贵的学习信号。其二是架构：必须在统一框架内处理图像、视频、语言和机器人动作，MoT 通过分配模态特定参数并保留共享注意力来实现跨模态交互。其三是算力：大规模预训练与实时部署都依赖训练基础设施、推理加速、模型蒸馏与高效注意力。</p>

<h2 class="wp-block-heading">通往 L4/L5 的六道关卡</h2>

<p class="wp-block-paragraph">尽管前三级已有具体落地，生数科技也坦承，迈向更高层级的世界智能仍有显著差距，并列出六项关键挑战：跨理解、想象、动作与迁移的联合评估；学习接触、摩擦、力等物理动态及其干预后果；持久且可修订的记忆；通过真实交互进行在线学习与自我改进；在延迟与资源约束下实现高效闭环部署；以及更强的安全性与可控性。</p>

<h2 class="wp-block-heading">国产 AI 的世界模型布局</h2>

<p class="wp-block-paragraph">生数科技是国产 AI 视频大模型 Vidu 的研发方。Vidu 于 2024 年 4 月由清华大学与生数科技联合发布，基于原创的 U-ViT 架构，是全球首个融合 Diffusion 与 Transformer 技术的视频生成模型。从视频模型到世界模型，从数字空间到物理空间，生数科技正在探索一条更完整的通用智能路径。随着相关技术持续演进，通用世界模型有望加快走向真实产业场景，在制造、物流与服务机器人等领域释放价值。</p>

<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8c99dc63cd9&quot;}" data-wp-interactive="core/image" data-wp-key="6a8c99dc63cd9" class="wp-block-image size-large wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="676" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/9ae6d8f61bb38f64493e231b5142d367_header.webp" alt="生数科技通用世界模型五级路线图" class="wp-image-5394" srcset="https://mylogs.cn/wp-content/uploads/2026/08/9ae6d8f61bb38f64493e231b5142d367_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/9ae6d8f61bb38f64493e231b5142d367_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/9ae6d8f61bb38f64493e231b5142d367_header-1024x577.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/9ae6d8f61bb38f64493e231b5142d367_header-768x433.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：生数科技（via CNA）</figcaption></figure>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
