<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>世界模型 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e4%b8%96%e7%95%8c%e6%a8%a1%e5%9e%8b/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Tue, 29 Sep 2026 16:59:39 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>影眸WorldGen发布：一张图生成可编辑3D场景</title>
		<link>https://mylogs.cn/%e5%bd%b1%e7%9c%b8worldgen%e5%8f%91%e5%b8%83%ef%bc%9a%e4%b8%80%e5%bc%a0%e5%9b%be%e7%94%9f%e6%88%90%e5%8f%af%e7%bc%96%e8%be%913d%e5%9c%ba%e6%99%af/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 14 Sep 2026 22:07:33 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[3D生成]]></category>
		<category><![CDATA[AI 3D]]></category>
		<category><![CDATA[WorldGen]]></category>
		<category><![CDATA[三维场景]]></category>
		<category><![CDATA[世界模型]]></category>
		<category><![CDATA[具身智能]]></category>
		<category><![CDATA[影眸Hyper3D]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%bd%b1%e7%9c%b8worldgen%e5%8f%91%e5%b8%83%ef%bc%9a%e4%b8%80%e5%bc%a0%e5%9b%be%e7%94%9f%e6%88%90%e5%8f%af%e7%bc%96%e8%be%913d%e5%9c%ba%e6%99%af/</guid>

					<description><![CDATA[2026年9月1日，上海影眸科技（Hyper3D）正式发布世界生成模型 WorldGen。用户只需上传一张场景 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">2026年9月1日，上海影眸科技（Hyper3D）正式发布世界生成模型 WorldGen。用户只需上传一张场景图片，WorldGen 即可自动识别其中的主要物体并生成3D资产，重建物体之间的物理属性与关系，最终输出一个由多个独立3D资产构成的完整场景。从&#8221;生成一个物体&#8221;到&#8221;组织一个世界&#8221;，3D生成的基本单位正在发生一次跃迁。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ac16d4357ed0&quot;}" data-wp-interactive="core/image" data-wp-key="6ac16d4357ed0" class="wp-block-image wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" style="max-width:100%; height:auto;" src="https://mylogs.cn/wp-content/uploads/2026/09/20260915_worldgen_header.webp" alt="WorldGen单图生成3D场景示意"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：自制示意图（AI生成）</figcaption></figure>
<h2 class="wp-block-heading">它解决什么问题</h2>
<p class="wp-block-paragraph">过去一年，生成一段可以环视的空间已有不少惊艳展示，但大多只是一张&#8221;能环视360度的画&#8221;。真实生产需要的是可交互环境：游戏道具要放进关卡继续调整，影视角色要在统一空间完成多镜头调度，机器人训练面对的也不是悬空的杯子影像，而是有位置、遮挡和支撑关系、可被抓取移动的实体。WorldGen 要生成的，正是可交互、可编辑、可进入真实生产环境的三维场景。</p>
<h2 class="wp-block-heading">技术原理：CAST 架构</h2>
<p class="wp-block-paragraph">WorldGen 基于影眸自研的 CAST 架构（Component-Aligned 3D Scene Reconstruction from an RGB Image）。该架构提出物理感知校正机制，推断物体间的接触与支撑关系，优化姿态，修正穿透、悬空等不合理现象。相关研究获得 SIGGRAPH 2025 最佳论文，同期获得最佳论文的商业公司仅有三家：谷歌、Meta 和影眸 Hyper3D。</p>
<p class="wp-block-paragraph">系统将图像中需要编辑和交互的主要物体以独立网格资产形式生成，不需要参与交互的墙面、远景和环境背景则通过3D高斯泼溅保留更完整的视觉信息与空间沉浸感。依托 Rodin Gen-2.5 首次提出的 Thinking Effort（思考深度）架构，场景中的每个资产可按需分配生成精度：关键物体可继续细化，远处或非关键物体最快4秒即可生成可用3D资产。</p>
<h2 class="wp-block-heading">能做什么：落地场景</h2>
<p class="wp-block-paragraph"><strong>具身智能仿真训练</strong> WorldGen 可根据单张照片重建可交互三维场景并生成具备仿真导入能力的三维资产。影眸联合地瓜机器人（D-Robotics）、谋先飞（Motphys）发布&#8221;具身智能可训练仿真闭环联合解决方案&#8221;，用真实世界影像直接生成可训练虚拟场景，降低机器人数据采集与训练成本。作为 NVIDIA Inception 成员，影眸已与 NVIDIA Isaac Sim 生态衔接，覆盖从资产生成、仿真验证到策略部署的通路。</p>
<p class="wp-block-paragraph"><strong>影视与游戏制作</strong> WorldGen 可与 Seedance 2.5 等视频生成模型组成工作流：先建立空间结构明确的3D场景，确定构图与视角后再交给视频模型生成最终画面，提升多镜头叙事的一致性。其 AI Render 模块支持 AI 渲染与自由运镜。今年7月，影眸与 Unity 中国（团结引擎）宣布打通从3D生成到实时游戏应用的工程闭环，生成资产可进入 Blender、Unity、Unreal Engine 等环境二次创作。</p>
<p class="wp-block-paragraph"><strong>XR 与空间计算</strong> 生成的3D场景可结合 Apple Vision Pro 等设备，让用户进入由单张图片生成的三维空间，近距离查看物体与环境细节，并进一步替换场景中的物体、调整陈列与布局。</p>
<h2 class="wp-block-heading">与同类世界模型的区别</h2>
<p class="wp-block-paragraph">李飞飞 World Labs 的 Atlas 强调&#8221;一张照片生成可探索的3D世界&#8221;，京东 JoyAI、蚂蚁灵波等也发布了各自的世界模型。WorldGen 的差异化在于&#8221;场景级&#8221;：它生成的不仅是世界的视觉表象，更是构成世界的独立物体、空间关系与物理约束，并可直接进入 DCC 软件、实时引擎与仿真环境持续编辑，已切入实际影视项目制作流程。</p>
<h2 class="wp-block-heading">常见问题</h2>
<p class="wp-block-paragraph"><strong>普通人现在能用吗？</strong> WorldGen 主要面向具身智能、影视、游戏与空间计算等生产场景，通过影眸 Hyper3D 官方渠道提供，普通创作者可在影视预演、概念短片与工作流提效中试用。</p>
<p class="wp-block-paragraph"><strong>对游戏和影视意味着什么？</strong> 它把前期建模与场景搭建的时间大幅压缩，创作者像使用&#8221;3D导演台&#8221;一样在统一空间调度镜头、移动物体，再交由视频模型生成连续画面，提升复杂场景的可控性。</p>
<p class="wp-block-paragraph">本文综合影眸 Hyper3D 官方发布、Z Potentials 深度解读及机器之心等公开报道整理。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>李飞飞Atlas世界模型：一张照片生成3D世界</title>
		<link>https://mylogs.cn/%e6%9d%8e%e9%a3%9e%e9%a3%9eatlas%e4%b8%96%e7%95%8c%e6%a8%a1%e5%9e%8b%ef%bc%9a%e4%b8%80%e5%bc%a0%e7%85%a7%e7%89%87%e7%94%9f%e6%88%903d%e4%b8%96%e7%95%8c/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 14 Sep 2026 15:40:22 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[3D重建]]></category>
		<category><![CDATA[Atlas]]></category>
		<category><![CDATA[World Labs]]></category>
		<category><![CDATA[世界模型]]></category>
		<category><![CDATA[具身智能]]></category>
		<category><![CDATA[李飞飞]]></category>
		<category><![CDATA[空间智能]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e6%9d%8e%e9%a3%9e%e9%a3%9eatlas%e4%b8%96%e7%95%8c%e6%a8%a1%e5%9e%8b%ef%bc%9a%e4%b8%80%e5%bc%a0%e7%85%a7%e7%89%87%e7%94%9f%e6%88%903d%e4%b8%96%e7%95%8c/</guid>

					<description><![CDATA[李飞飞创立的 World Labs 于 9 月 1 日发布 Atlas，官方称其为“全球首个多模态世界模型”。 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">李飞飞创立的 World Labs 于 9 月 1 日发布 Atlas，官方称其为“全球首个多模态世界模型”。它的核心能力是：输入一张或几张普通照片，就能生成带像素级相机控制、最长 1 分钟 1440p 的可探索视频，并重建出包含点云与 3D Gaussian 显式表示的真实 3D 场景。这意味着 AI 从“生成一段好看的画面”迈向“生成一个可以走进去、用起来的世界”。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ac16d4358f80&quot;}" data-wp-interactive="core/image" data-wp-key="6ac16d4358f80" class="wp-block-image wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1536" height="1024" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/269b06867c43d4b1fc30805fcb8eab5f_header.webp" alt="Atlas 世界模型概念示意" class="wp-image-7004" srcset="https://mylogs.cn/wp-content/uploads/2026/09/269b06867c43d4b1fc30805fcb8eab5f_header.webp 1536w, https://mylogs.cn/wp-content/uploads/2026/09/269b06867c43d4b1fc30805fcb8eab5f_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/09/269b06867c43d4b1fc30805fcb8eab5f_header-1024x683.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/09/269b06867c43d4b1fc30805fcb8eab5f_header-768x512.webp 768w" sizes="(max-width: 1536px) 100vw, 1536px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：图片来源：AI 生成示意图</figcaption></figure>
<h2 class="wp-block-heading">Atlas 和普通视频生成模型有何不同？</h2>
<p class="wp-block-paragraph">过去两年的 AI 视频工具（如 Sora、可灵、Runway）本质是“像素预测”：模型学习“下一帧长什么样”，但不一定理解画面背后的几何、物理与空间结构，一旦要求复杂运镜就容易变形穿帮。</p>
<p class="wp-block-paragraph">Atlas 的官方口号直白地划清了边界：建模世界（Model worlds）、移动相机（Move cameras）、模拟空间和时间（Simulate space and time）。它不学习“下一帧”，而是学习“一个可由移动相机观察的三维世界”。其架构为“多模态自回归扩散 Transformer”，从零预训练；关键设计是“空间上下文”——把相机位姿、3D 深度图作为原生输入，空间成为模型的先验，而非像素的附庸。</p>
<h2 class="wp-block-heading">Atlas 能做哪四件事？</h2>
<p class="wp-block-paragraph">&#8211; <strong>相机控制生成</strong>：输入 1 至 6 张图片并指定相机轨迹（推近、环绕、摇移），生成带像素级相机控制的视频，最长 1 分钟、1440p 分辨率。相比传统视频模型“靠提示词猜运镜”，这里是用户直接给定坐标。- <strong>空间重建</strong>：基于输入图像重建真实场景，典型场景 2 至 3 张图即可保真，最多可接受 100 张以上输入；输出点云与 3D Gaussian Splats。官方演示中，斯坦福校园仅用 2 至 25 张地面照片就生成了航拍漫游路径。- <strong>时空模拟</strong>：输入一段视频，同时建模其中的空间与时间，转换观察视角、制作戏剧性运镜，相当于给已有素材一个“虚拟导演”。- <strong>图像与全景生成</strong>：文本生成图片与 360° 全景图，能准确渲染画面中的文字并覆盖多种视觉风格（官方称这并非主攻方向，而是“每个图像都是一扇通往可能世界的窗口”的自然副产品）。</p>
<h2 class="wp-block-heading">评测表现如何？</h2>
<p class="wp-block-paragraph">以下为 World Labs 官方自报数据（第三方人类评分 + 官方复现基线），供参考：</p>
<figure class="wp-block-table"><table class="has-fixed-layout"><thead><tr><th>评测维度</th><th>Atlas 结果</th><th>对比基线</th></tr></thead><tbody><tr><td>&#8212;</td><td>&#8212;</td><td>&#8212;</td></tr><tr><td>相机控制人类评分胜率</td><td>75%–94%</td><td>优于 MiniMax H3、Gemini Omni Flash、FLUX 3、Seedance 2.5</td></tr><tr><td>稀疏视角 3D 重建 AbsRel 误差(×10⁻³)</td><td>25.3</td><td>低于 Pi3X(28.7)、π³(34.7)、VGGT-Ω(36.4)、Depth Anything 3(39.3)</td></tr></tbody></table></figure>
<p class="wp-block-paragraph">需要说明的是，Atlas 的参数量、训练数据与<a href="https://mylogs.cn/ai-%e6%99%ba%e8%83%bd%e4%bd%93%e5%bc%95%e7%88%86%e9%9c%80%e6%b1%82%ef%bc%9a%e6%9c%8d%e5%8a%a1%e5%99%a8-cpu-%e4%ba%a4%e4%bb%98%e8%a6%81%e7%ad%89-30-%e5%91%a8/">算力</a>规模目前均未公开，上述基准属于厂商自报，独立验证仍待进行。</p>
<h2 class="wp-block-heading">它最大的价值在哪里？</h2>
<p class="wp-block-paragraph">Atlas 最受关注的落点在具身智能（Embodied AI）。机器人训练的最大瓶颈是缺乏廉价、可控、可规模化的真实经验——真实数据采集成本极高且难覆盖多样场景。Atlas 打通了一条路径：几张照片即可生成逼真的 RGB 与深度数据，让机器人在多样化的模拟空间中训练与测试。这正是<a href="https://mylogs.cn/%e5%8f%b0%e7%a7%af%e7%94%b5-2nm-%e5%b9%b4%e5%ba%95%e6%9c%88%e4%ba%a7%e8%83%bd%e5%86%b2-12-%e4%b8%87%e7%89%87%ef%bc%8c%e6%8f%90%e5%89%8d%e4%b8%a4%e5%b9%b4%e8%be%be%e6%a0%87/">英伟达</a>机器人业务负责人 Jim Fan 所称“机器人 Real-to-Sim（真实到仿真）的一大步”，也是李飞飞团队 7 月底发布的 Real-to-Sim-to-Real 系统闭环的关键一环。对影视行业同样意义重大：传统特效需数百机位采集、人工建模，而 Atlas 用几张照片就能补全可探索的三维场景。</p>
<h2 class="wp-block-heading">和谁在竞争？</h2>
<p class="wp-block-paragraph">世界模型赛道已不孤单。Google DeepMind 的 Genie 3（2025 年 8 月发布）可生成 20 至 24 帧每秒、720p 的交互世界；NVIDIA 的 Cosmos 世界基础模型直指机器人与自动驾驶，下载量已超 200 万次。学术路线也存在分歧：Yann LeCun 主张表征派（I-JEPA），认为生成式像素预测是“幻觉”，应预测抽象状态表征；World Labs 则押注“持久、可编辑、物理一致的显式 3D 空间”。批评者指出，Atlas 目前公开的评测只覆盖相机条件生成与 3D 重建，流体、布料等复杂物理仍是全行业未解难题。</p>
<h2 class="wp-block-heading">现在能用吗？</h2>
<p class="wp-block-paragraph">Atlas 目前处于早期访问（early access）阶段，优先面向合作伙伴，开发者可通过官网提交申请；它将成为未来 Marble 及 World Labs 其他产品的底层基础模型。World Labs 累计融资约 12.3 亿美元（投资方含英伟达、AMD、Autodesk、富达等），估值约 52.9 亿美元。</p>
<h2 class="wp-block-heading">结语</h2>
<p class="wp-block-paragraph">Atlas 未必是终点，但它是“空间智能”路线一次有说服力的落地：用一张照片撑起一个可观察、可重建、可模拟的三维世界。它能否真正改变机器人与内容生产的范式，取决于复杂物理的建模进度与开放节奏，但其方向已经足够清晰。</p>
<p class="wp-block-paragraph"><em>本文由科技观察团队整理，事实依据 World Labs 官方博客及多家媒体报道，文中公司名、模型名、评测名保留英文原名。</em></p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>1.3B 世界模型开源：蚂蚁灵波让单卡跑实时交互世界</title>
		<link>https://mylogs.cn/1-3b-%e4%b8%96%e7%95%8c%e6%a8%a1%e5%9e%8b%e5%bc%80%e6%ba%90%ef%bc%9a%e8%9a%82%e8%9a%81%e7%81%b5%e6%b3%a2%e8%ae%a9%e5%8d%95%e5%8d%a1%e8%b7%91%e5%ae%9e%e6%97%b6%e4%ba%a4%e4%ba%92%e4%b8%96%e7%95%8c/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 13 Sep 2026 16:41:07 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI视频生成]]></category>
		<category><![CDATA[LingBot-World]]></category>
		<category><![CDATA[世界模型]]></category>
		<category><![CDATA[具身智能]]></category>
		<category><![CDATA[开源]]></category>
		<category><![CDATA[消费级GPU]]></category>
		<category><![CDATA[蚂蚁灵波]]></category>
		<guid isPermaLink="false">https://mylogs.cn/1-3b-%e4%b8%96%e7%95%8c%e6%a8%a1%e5%9e%8b%e5%bc%80%e6%ba%90%ef%bc%9a%e8%9a%82%e8%9a%81%e7%81%b5%e6%b3%a2%e8%ae%a9%e5%8d%95%e5%8d%a1%e8%b7%91%e5%ae%9e%e6%97%b6%e4%ba%a4%e4%ba%92%e4%b8%96%e7%95%8c/</guid>

					<description><![CDATA[1.3B 世界模型正式开源：蚂蚁灵波把实时交互世界模型的运行门槛，从服务器级算力拉到一张消费级显卡。个人开发者 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">1.3B 世界模型正式开源：蚂蚁灵波把实时交互世界模型的运行门槛，从服务器级<a href="https://mylogs.cn/ai-%e6%99%ba%e8%83%bd%e4%bd%93%e5%bc%95%e7%88%86%e9%9c%80%e6%b1%82%ef%bc%9a%e6%9c%8d%e5%8a%a1%e5%99%a8-cpu-%e4%ba%a4%e4%bb%98%e8%a6%81%e7%ad%89-30-%e5%91%a8/">算力</a>拉到一张消费级显卡。个人开发者无需集群，也能在本地实时生成可交互的虚拟世界。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ac16d4359f03&quot;}" data-wp-interactive="core/image" data-wp-key="6ac16d4359f03" class="wp-block-image wp-lightbox-container"><img decoding="async" width="1536" height="1024" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/6b53e3b1efa4054a2d28adfe556199bf_header.webp" alt="蚂蚁灵波 LingBot-World 2.0 世界模型可视化" class="wp-image-6897" srcset="https://mylogs.cn/wp-content/uploads/2026/09/6b53e3b1efa4054a2d28adfe556199bf_header.webp 1536w, https://mylogs.cn/wp-content/uploads/2026/09/6b53e3b1efa4054a2d28adfe556199bf_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/09/6b53e3b1efa4054a2d28adfe556199bf_header-1024x683.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/09/6b53e3b1efa4054a2d28adfe556199bf_header-768x512.webp 768w" sizes="(max-width: 1536px) 100vw, 1536px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：图片来源：蚂蚁灵波</figcaption></figure>
<p class="wp-block-paragraph">继今年 7 月发布 14B 主模型后，蚂蚁灵波科技本周再开源三款模型：LingBot-World 2.0 Small（1.3B）、Bidirectional（双向教师模型）与 Causal Pretrain（因果预训练底座）。其中 1.3B 版本面向消费级单卡 GPU 设计，可在单卡上实现实时生成。</p>
<p class="wp-block-paragraph">LingBot-World 2.0 是一个实时交互世界模型，支持小时级连续生成，可响应攻击、射箭、施法、射击等角色动作，以及下雪、下雨等环境事件。在更高算力与相应推理配置下，可达到 720P / 60FPS 的高清实时体验。技术架构上，模型接收相机位姿与文本指令两类控制信息：相机位姿通过位姿编码与自适应层归一化调整画面生成；文本指令通过交叉注意力机制关联不同视频片段的提示词，实现剧情动态更新。团队采用分布匹配蒸馏（DMD）应对长时生成中的累计漂移。系统还接入“导演—执行”框架，由视觉语言模型观察场景并提出事件，视频模型负责生成后续画面。其基础模型基于万相（Wan）开发，推理代码已适配 SGLang。值得注意的是，1.3B 版本采用商用开源协议，而 14B 版本为非商用，对中小企业更友好。</p>
<h2 class="wp-block-heading">14B 与 1.3B 到底差在哪</h2>
<figure class="wp-block-table"><table class="has-fixed-layout"><thead><tr><th>规格</th><th>14B 版本</th><th>1.3B 版本</th></tr></thead><tbody><tr><td>输出规格</td><td>720P / 60FPS</td><td>720P / 60FPS</td></tr><tr><td>开源协议</td><td>非商用</td><td>商用</td></tr><tr><td>部署硬件</td><td>服务器级</td><td>消费级独立显卡</td></tr></tbody></table></figure>
<p class="wp-block-paragraph">真正让一项技术扩散开的，往往不是最强的版本，而是第一个足够小、便宜、能被拿来尝试的版本。1.3B 的意义不在于参数少，而在于它把“能否跑起来”这个硬门槛拆掉了。过去世界模型更多停留在论文 demo 与在线体验，开发者只能“看”，不能“改”；现在可以本地运行、修改输入、测试交互设计、搭建原型。这对机器人仿真、游戏资产生成、具身智能训练数据的低成本合成，都是直接利好。</p>
<p class="wp-block-paragraph">与 Google Genie、Meta 及<a href="https://mylogs.cn/%e5%8f%b0%e7%a7%af%e7%94%b5-2nm-%e5%b9%b4%e5%ba%95%e6%9c%88%e4%ba%a7%e8%83%bd%e5%86%b2-12-%e4%b8%87%e7%89%87%ef%bc%8c%e6%8f%90%e5%89%8d%e4%b8%a4%e5%b9%b4%e8%be%be%e6%a0%87/">英伟达</a> Cosmos 等世界模型相比，LingBot-World 2.0 的差异化在于“实时交互 + 开源可商用 + 单卡可跑”三者同时成立。多数同类模型要么闭源，要么需要集群，要么仅支持离线生成。蚂蚁灵波同步开源 Causal Pretrain 与 Bidirectional，等于把后训练、评测、蒸馏、压缩、推理加速到场景适配的完整二次开发链路都交给了社区，降低了垂直场景小模型蒸馏的起步成本。</p>
<p class="wp-block-paragraph">从行业节奏看，世界模型正从“研究玩具”走向“生产力底座”。当单次生成能在消费级显卡上实时完成，它就不只是演示视频，而可以成为游戏引擎的素材生成器、机器人训练的仿真器、影视预演的草图工具。蚂蚁灵波用 1.3B 商用版把这条路铺到了个人开发者的桌面上，后续若能补齐动作多样性与长时序一致性，实用价值会进一步放大。</p>
<h2 class="wp-block-heading">什么是世界模型？</h2>
<p class="wp-block-paragraph">世界模型是一类能够基于当前状态与控制指令，实时生成后续画面与事件的生成式模型，常用于机器人仿真、游戏与具身智能训练。</p>
<h2 class="wp-block-heading">1.3B 版本和 14B 版本有什么不同？</h2>
<p class="wp-block-paragraph">核心差异在部署门槛与授权：1.3B 面向消费级单卡、采用商用协议；14B 需服务器级算力、仅限非商用，但生成质量与稳定性更高。</p>
<h2 class="wp-block-heading">个人开发者现在能做什么？</h2>
<p class="wp-block-paragraph">可在 Hugging Face 与魔搭社区下载 1.3B 模型，本地运行实时交互世界，并基于 Causal Pretrain 做后训练，或蒸馏出更小的垂直场景模型。</p>
<p class="wp-block-paragraph">本文基于蚂蚁灵波官方技术报告（arXiv:2607.07534）、IT之家公开报道及行业公开分析撰写。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>宇树全开源人形机器人基座模型：单模型统筹64个任务</title>
		<link>https://mylogs.cn/%e5%ae%87%e6%a0%91%e5%85%a8%e5%bc%80%e6%ba%90%e4%ba%ba%e5%bd%a2%e6%9c%ba%e5%99%a8%e4%ba%ba%e5%9f%ba%e5%ba%a7%e6%a8%a1%e5%9e%8b%ef%bc%9a%e5%8d%95%e6%a8%a1%e5%9e%8b%e7%bb%9f%e7%ad%b964%e4%b8%aa%e4%bb%bb/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 10 Sep 2026 09:51:53 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[世界模型]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[人形机器人]]></category>
		<category><![CDATA[具身智能]]></category>
		<category><![CDATA[宇树科技]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[机器人]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%ae%87%e6%a0%91%e5%85%a8%e5%bc%80%e6%ba%90%e4%ba%ba%e5%bd%a2%e6%9c%ba%e5%99%a8%e4%ba%ba%e5%9f%ba%e5%ba%a7%e6%a8%a1%e5%9e%8b%ef%bc%9a%e5%8d%95%e6%a8%a1%e5%9e%8b%e7%bb%9f%e7%ad%b964%e4%b8%aa%e4%bb%bb/</guid>

					<description><![CDATA[9月10日，宇树科技宣布完全开源 UnifoLM-WLA-1.0 具身基座模型。这是该公司全新一代通用人形机器 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">9月10日，宇树科技宣布完全开源 UnifoLM-WLA-1.0 具身基座模型。这是该公司全新一代通用人形机器人基础模型，代码、模型与数据集同步开放，项目主页已上线。</p>
<p class="wp-block-paragraph">官方称，该模型在多项具身推理评测中领先国内外开源模型，亦可比肩头部闭源模型，刷新了全球开源模型多项评测的最好成绩。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ac16d435abb2&quot;}" data-wp-interactive="core/image" data-wp-key="6ac16d435abb2" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/r19_03_header.webp" alt="UnifoLM-WLA-1.0 开源发布" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：宇树科技</figcaption></figure>
<h2 class="wp-block-heading">6B参数，5M+样本与约2500小时真机数据</h2>
<p class="wp-block-paragraph">据介绍，UnifoLM-WLA-1.0 依托大规模通用多模态感知与理解数据训练，并融合以交互为中心的世界建模，全面提升空间感知与理解能力。</p>
<p class="wp-block-paragraph">关键参数方面，模型参数量为 6B，使用了 500万以上 ER（具身推理）训练样本，以及约 2500 小时真机数据。</p>
<p class="wp-block-paragraph">真机评测显示，该模型可以由单一模型统筹 64 个任务，覆盖桌面操作与全身移动操作两类场景，具备跨任务、跨末端执行器的泛化能力，做到一模驱动、全身协同。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ac16d435adc1&quot;}" data-wp-interactive="core/image" data-wp-key="6ac16d435adc1" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/r19_03_inner1.webp" alt="单模型统筹桌面与全身移动操作" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：宇树科技</figcaption></figure>
<h2 class="wp-block-heading">VLA与WMA两条路线，构建开源体系</h2>
<p class="wp-block-paragraph">此次开源是宇树通用人形基础模型的一次全面升级。在此之前，宇树科技已先后开源 UnifoLM-VLA-0 视觉-语言-动作<a href="https://mylogs.cn/chatgpt-pro-%e9%87%8d%e5%bc%80-200-%e7%be%8e%e5%85%83%e6%a1%a3%ef%bc%9aapi-%e4%bb%b7%e5%80%bc%e8%bf%91%e7%bf%bb%e5%80%8d/">大模型</a>，以及 UnifoLM-WMA-0 世界模型-动作架构，形成了覆盖 VLA 与 WMA 两条技术路线的具身智能开源体系。</p>
<p class="wp-block-paragraph">其中，UnifoLM-VLA-0 在 LIBERO 仿真基准测试中取得 98.7 分的成绩，在空间、物体、目标和长序列四个子项上的得分分别为 99.0、100、99.4 和 96.2。</p>
<h2 class="wp-block-heading">开源意味着什么</h2>
<p class="wp-block-paragraph">通用人形机器人一直面临一个现实难题：真实世界的物理数据获取成本高、场景碎片化，单一实验室很难覆盖足够多的任务与本体形态。把基础模型连同数据集一起开放，相当于把这一层公共基础设施交给了整个行业。</p>
<p class="wp-block-paragraph">对开发者和研究者而言，直接收益是研发门槛的下降——不必从零构建感知与世界模型模块，可以把精力放在具体场景的适配与精细化调优上。对宇树自身而言，开源也是扩大生态、吸引更多人在其硬件与软件栈上做开发的方式。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ac16d435b024&quot;}" data-wp-interactive="core/image" data-wp-key="6ac16d435b024" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/r19_03_inner2.webp" alt="UnifoLM-WLA-1.0 项目主页" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：宇树科技</figcaption></figure>
<p class="wp-block-paragraph">从技术路线上看，&#8221;世界模型-动作&#8221;（WMA）架构强调让模型先学会预测环境如何随动作变化，再据此决策。此前多家机构都在探索把世界模型引入机器人控制，宇树此次选择将这条路线的基础模型完整开源，为业界提供了一个可直接复现和比较的基准。</p>
<p class="wp-block-paragraph">至于这套模型在真实机器人上的长期表现如何、跨本体迁移的实际效果如何，还需要更多第三方在真实场景中的验证。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>10分钟生成公里级3D城市：高德ABot-Earth 0.7来了</title>
		<link>https://mylogs.cn/10%e5%88%86%e9%92%9f%e7%94%9f%e6%88%90%e5%85%ac%e9%87%8c%e7%ba%a73d%e5%9f%8e%e5%b8%82%ef%bc%9a%e9%ab%98%e5%be%b7abot-earth-0-7%e6%9d%a5%e4%ba%86/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 10 Sep 2026 09:51:45 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[3DGS]]></category>
		<category><![CDATA[AI 生成]]></category>
		<category><![CDATA[世界模型]]></category>
		<category><![CDATA[数字地球]]></category>
		<category><![CDATA[空间智能]]></category>
		<category><![CDATA[阿里巴巴]]></category>
		<category><![CDATA[高德]]></category>
		<guid isPermaLink="false">https://mylogs.cn/10%e5%88%86%e9%92%9f%e7%94%9f%e6%88%90%e5%85%ac%e9%87%8c%e7%ba%a73d%e5%9f%8e%e5%b8%82%ef%bc%9a%e9%ab%98%e5%be%b7abot-earth-0-7%e6%9d%a5%e4%ba%86/</guid>

					<description><![CDATA[9月10日，阿里巴巴集团旗下高德正式发布全球首个3D原生城市世界模型 ABot-Earth 0.7。在杭州举行 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">9月10日，阿里巴巴集团旗下高德正式发布全球首个3D原生城市世界模型 ABot-Earth 0.7。在杭州举行的高德扫街榜2026年度发布暨颁奖盛典上，高德CEO郭宁宣布了这一成果，称其将把数字地球从&#8221;只能浏览&#8221;推进到&#8221;可以理解&#8221;。</p>
<h2 class="wp-block-heading">从卫星图到3D城市，只要10分钟</h2>
<p class="wp-block-paragraph">ABot-Earth 0.7 采用的是3D原生技术路径：用涵盖空间、时间等信息的时空数据训练模型，让它建立对三维空间的原生理解，再端到端一次性生成3DGS（3D Gaussian Splatting，三维高斯泼溅）格式的城市场景。</p>
<p class="wp-block-paragraph">据官方介绍，输入一张卫星图像或一段文字描述，模型只用10分钟，就能在一块消费级GPU上生成公里级的3D城市场景，效率比传统模式提升1000倍。更关键的是，模型可以自主补全、生成完整且连续的三维空间，使用者不再受限于既定路线，而是能连续进入、自由探索，并实时获得交互反馈。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ac16d435bb79&quot;}" data-wp-interactive="core/image" data-wp-key="6ac16d435bb79" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/r19_01_header.webp" alt="ABot-Earth 0.7 生成的3D城市场景" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：高德</figcaption></figure>
<h2 class="wp-block-heading">一个模型，从星球一路推到街景</h2>
<p class="wp-block-paragraph">与聚焦小尺寸场景或游戏画面生成的3D模型不同，ABot-Earth 0.7 可以在单一模型内完成从星球到城市、再到街景地标的全尺寸AI连续生成。</p>
<p class="wp-block-paragraph">这对模型的一致性提出了很高要求：在城市级生成中，需要保持路网、街区和建筑群的整体关系；推进到地标近景后，则要进一步还原单体建筑的几何轮廓、立面层次和材质纹理。ABot-Earth 0.7 依靠3D原生表征，让视角从城市全貌推进到地标细节时，空间结构与视觉信息仍保持一致，并达到照片级视觉效果。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ac16d435bd5d&quot;}" data-wp-interactive="core/image" data-wp-key="6ac16d435bd5d" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/r19_01_inner1.webp" alt="从星球到街景的全尺寸连续生成" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：高德</figcaption></figure>
<h2 class="wp-block-heading">&#8220;<a href="https://mylogs.cn/chatgpt-pro-%e9%87%8d%e5%bc%80-200-%e7%be%8e%e5%85%83%e6%a1%a3%ef%bc%9aapi-%e4%bb%b7%e5%80%bc%e8%bf%91%e7%bf%bb%e5%80%8d/">大模型</a>理解语言，高德空间智能理解世界&#8221;</h2>
<p class="wp-block-paragraph">郭宁在发布会上提出，理解真实世界需要三层能力：第一是鲜活而立体的三维空间表达，从地球到城市、从道路到建筑、从室外到室内，还原真实世界的细节与层次；第二是实时而连续的动态感知，从车流到人流、从路况到商户、从白天到黑夜，捕捉世界每一刻的变化；第三是精准而稳定的时空推演，从出发到到达、从单点到全局、从现在到未来，给出环环相扣的最优解。</p>
<p class="wp-block-paragraph">支撑这三层能力的，是长期积累的真实世界时空样本。官方数据显示，过去十年高德导航日调用北斗卫星定位峰值近万亿次，业务覆盖全球200多个国家和地区，沉淀了来自路网、建筑、地形、街景以及每一次真实导航、避堵与纠错的海量数据。在此基础上构建的数字地球，覆盖范围超过196个国家和地区。</p>
<h2 class="wp-block-heading">已落地飞行街景2.0，能力将向全行业开放</h2>
<p class="wp-block-paragraph">目前，ABot-Earth 0.7 的体验官网已经上线（abot-earth.amap.com），相关能力也已应用于飞行街景2.0。使用者可以通过飞行街景2.0进入复杂建筑、大型景区，用摇杆操控漫游3D场景。</p>
<p class="wp-block-paragraph">在实际出行场景里，这套能力可以提前把目的地还原为可自由探索的三维空间，让使用者出发前就看清剧院座位视野、商场内部动线以及景区地形，形成身临其境的在场感。</p>
<p class="wp-block-paragraph">生态方面，高德空间智能正通过手机、车机、具身机器人、智能眼镜、<a href="https://mylogs.cn/wired-2026-%e6%99%ba%e8%83%bd%e6%89%8b%e8%a1%a8%e6%a8%aa%e8%af%84%ef%bc%9a7-%e6%ac%be%e5%88%b0%e5%ba%95%e6%80%8e%e4%b9%88%e9%80%89/"><a href="https://mylogs.cn/%e5%8d%8e%e4%b8%ba-watch-gt-6-%e6%8e%a8%e9%b8%bf%e8%92%99-7-%e5%85%ac%e6%b5%8b%ef%bc%9a%e5%85%89%e7%a9%b9%e8%a1%a8%e7%9b%98%e9%a2%86%e8%a1%94-12-%e9%a1%b9%e6%96%b0%e7%89%b9%e6%80%a7/">智能手表</a></a>等物理终端进入真实生活，已有生态伙伴在多个终端方向展开合作。高德扫街榜同时宣布，梅赛德斯-奔驰成为其全球首个汽车合作伙伴。</p>
<p class="wp-block-paragraph">按照高德的说法，空间智能的能力未来将持续向全行业开放，与开发者及生态伙伴一起推动空间智能在真实世界落地。</p>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>京东重押物理 AI：10 万卡国产算力 + JoyAI 世界模型</title>
		<link>https://mylogs.cn/%e4%ba%ac%e4%b8%9c%e9%87%8d%e6%8a%bc%e7%89%a9%e7%90%86-ai%ef%bc%9a10-%e4%b8%87%e5%8d%a1%e5%9b%bd%e4%ba%a7%e7%ae%97%e5%8a%9b-joyai-%e4%b8%96%e7%95%8c%e6%a8%a1%e5%9e%8b/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 10 Sep 2026 03:14:16 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[JoyAI]]></category>
		<category><![CDATA[世界模型]]></category>
		<category><![CDATA[京东]]></category>
		<category><![CDATA[具身智能]]></category>
		<category><![CDATA[国产算力]]></category>
		<category><![CDATA[机器人]]></category>
		<category><![CDATA[物理 AI]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e4%ba%ac%e4%b8%9c%e9%87%8d%e6%8a%bc%e7%89%a9%e7%90%86-ai%ef%bc%9a10-%e4%b8%87%e5%8d%a1%e5%9b%bd%e4%ba%a7%e7%ae%97%e5%8a%9b-joyai-%e4%b8%96%e7%95%8c%e6%a8%a1%e5%9e%8b/</guid>

					<description><![CDATA[京东把 AI 押到了物理世界。9 月 9 日，JDDiscovery-2026 京东全球科技探索者大会在北京举 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">京东把 AI 押到了物理世界。9 月 9 日，JDDiscovery-2026 京东全球科技探索者大会在北京举行，京东集团技术委员会主席、京东云总裁曹鹏宣布启动&#8221;物理 AI 加速计划&#8221;，围绕&#8221;<a href="https://mylogs.cn/ai-%e6%99%ba%e8%83%bd%e4%bd%93%e5%bc%95%e7%88%86%e9%9c%80%e6%b1%82%ef%bc%9a%e6%9c%8d%e5%8a%a1%e5%99%a8-cpu-%e4%ba%a4%e4%bb%98%e8%a6%81%e7%ad%89-30-%e5%91%a8/">算力</a>—数据—模型&#8221;三大底座，公布了建设国产 10 万卡算力集群、推进 1000 万小时具身数据采集、发布 JoyAI 系列世界模型等关键举措。</p>
<h2 class="wp-block-heading">算力底座：国产 10 万卡集群落地</h2>
<p class="wp-block-paragraph">京东云已与摩尔线程等合作伙伴建成国产万卡智算集群，并规划进一步建设国产 10 万卡集群，目标是为<a href="https://mylogs.cn/chatgpt-pro-%e9%87%8d%e5%bc%80-200-%e7%be%8e%e5%85%83%e6%a1%a3%ef%bc%9aapi-%e4%bb%b7%e5%80%bc%e8%bf%91%e7%bf%bb%e5%80%8d/">大模型</a>训练、机器人仿真推演、产业 AI 规模化运行提供稳定算力支撑。算力集群实现多类国产算力的异构统一调度，通过软硬件协同提升算力利用效率，对内承接京东自身的大模型训练与机器人仿真，对外向机器人企业、制造厂商和科研机构开放算力服务。京东 2026 上半年体系研发投入同比增长 53.2%，已连续三个季度加速投入。</p>
<h2 class="wp-block-heading">数据底座：1000 万小时具身视频</h2>
<p class="wp-block-paragraph">物理 AI 需要的不是互联网文本，而是人类在真实场景中&#8221;如何干活&#8221;的视频。京东规划两年内累计采集超过 1000 万小时真实操作视频，发动最多 60 万人参与。配套建设了覆盖&#8221;采、存、标、训、评、仿、测&#8221;全流程的具身数据基础设施；首批开源数据集 EgoLive 已对外开放，包含约 2000 小时第一视角数据、65866 个任务片段，覆盖 346 项真实世界任务，已获得超过 8 个国家、百所高校和科研机构申请使用。</p>
<h2 class="wp-block-heading">模型底座：JoyAI 矩阵首度亮相</h2>
<p class="wp-block-paragraph">京东已形成覆盖多模态模型、世界模型和具身模型的 JoyAI 基础模型矩阵。本届大会发布了两款新模型：JoyAI-Video 定位统一音视频基础模型，从视听生成迈向物理模拟；JoyAI-Echo WM 作为实时可交互的世界模型，在公开测评基准 WBench Navigation 中以 81.6 分位列第一。配套更新的还有京东物流&#8221;超脑&#8221;3.0（亿级包裹路径规划从分钟级压缩到秒级、具身模型多任务执行成功率 96.7%）、京东工业 JoyIndustrial 2.0、京东健康京医千询 3.0 等垂直模型。</p>
<h2 class="wp-block-heading">五年规划：百万台机器人</h2>
<p class="wp-block-paragraph">围绕机器人产业规模化落地，京东公布了&#8221;六项全球领先&#8221;目标：两年内建成全球最大具身数据采集中心、五年内布局 80 余个机器人产业基地（RoboBase）、联合发起机器人零部件产业发展联盟、京东零售 2028 年前投入百亿资源支持 100 个品牌独立销售额突破 10 亿元。物流侧规划五年内采购 300 万台机器人、100 万台无人车及 10 万架无人机，目前京东物流已部署&#8221;九狼&#8221;系列机器人及升级版具身灵巧臂，&#8221;狼族&#8221;机器人家族覆盖物流存储、搬运、分拣、配送全链路，集群已在国内 20 多个省份、海外 10 多个国家规模化部署。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ac16d435c988&quot;}" data-wp-interactive="core/image" data-wp-key="6ac16d435c988" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://www.stdaily.com/web/gdxw/pic/2026-09/09/578031_1fdb4975-11be-445f-908b-5fbace9c4fbd.png" alt="京东 JDD 大会现场主视觉：AI 驱动，建设全球最大物理世界运营中心" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：科技日报</figcaption></figure>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ac16d435caf9&quot;}" data-wp-interactive="core/image" data-wp-key="6ac16d435caf9" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/r16_02_inner.webp" alt="京东云万卡智算样板间亮相 JDD 展台" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：科技日报</figcaption></figure>]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>生数科技发布通用世界模型五级路线图</title>
		<link>https://mylogs.cn/%e7%94%9f%e6%95%b0%e7%a7%91%e6%8a%80%e5%8f%91%e5%b8%83%e9%80%9a%e7%94%a8%e4%b8%96%e7%95%8c%e6%a8%a1%e5%9e%8b%e4%ba%94%e7%ba%a7%e8%b7%af%e7%ba%bf%e5%9b%be/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 24 Aug 2026 18:52:08 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Vidu]]></category>
		<category><![CDATA[世界模型]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[具身智能]]></category>
		<category><![CDATA[生数科技]]></category>
		<category><![CDATA[通用世界模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e7%94%9f%e6%95%b0%e7%a7%91%e6%8a%80%e5%8f%91%e5%b8%83%e9%80%9a%e7%94%a8%e4%b8%96%e7%95%8c%e6%a8%a1%e5%9e%8b%e4%ba%94%e7%ba%a7%e8%b7%af%e7%ba%bf%e5%9b%be/</guid>

					<description><![CDATA[在 2026 世界机器人大会（WRC 2026）上，国产人工智能公司生数科技（ShengShu Technol [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">在 2026 世界机器人大会（WRC 2026）上，国产<a href="https://mylogs.cn/chatgpt-pro-%e9%87%8d%e5%bc%80-200-%e7%be%8e%e5%85%83%e6%a1%a3%ef%bc%9aapi-%e4%bb%b7%e5%80%bc%e8%bf%91%e7%bf%bb%e5%80%8d/"><a href="https://mylogs.cn/%e8%85%be%e8%ae%af%e5%86%85%e6%b5%8b-ai-%e6%b8%b8%e6%88%8f%e6%90%ad%e5%ad%90%e9%b9%85%e6%ac%a1%e5%85%83%ef%bc%9a%e6%95%b0%e5%ad%97%e4%ba%ba%e9%99%aa%e4%bd%a0%e5%bc%80%e9%bb%91/">人工智能</a></a>公司生数科技（ShengShu Technology）公布了通用世界模型（General World Models，简称 GWM）的五级路线图，把&#8221;理解世界、想象可能的未来、采取动作&#8221;串成一条闭环路径，并宣称其研发与部署已经覆盖其中前三级。</p>

<h2 class="wp-block-heading">从&#8221;理解世界&#8221;到&#8221;行动于世界&#8221;</h2>

<p class="wp-block-paragraph">生数科技创始人兼首席科学家朱军（Jun Zhu）是清华大学人工智能研究院副院长，也是 ACM、IEEE、AAAI 三院 Fellow。他在大会论坛演讲中把通用世界模型定义为一种闭环系统：持续整合对世界的理解、对未来的想象，以及物理或数字层面的动作执行。在他看来，当前的人工智能系统虽然单点能力突出，但整体上仍处在&#8221;割裂&#8221;状态——有的擅长生成，有的擅长理解，有的负责执行，很少能统一完成这三件事。通用世界模型因此被视为通往通用人工智能（AGI）的重要方向，也是连接数字世界与物理世界的桥梁。</p>

<h2 class="wp-block-heading">五级路线图：L1 到 L5</h2>

<p class="wp-block-paragraph">路线图的五个级别并非彼此独立的产品方向，而是能力逐级递进的演化过程：</p>

<ul class="wp-block-list"><li><strong>L1 世界生成（World Generation）</strong>：生成连贯的世界轨迹。视频帮助模型学习物体、运动、空间关系与时间动态，为更深层的理解与想象打底。</li><li><strong>L2 交互世界（Interactive World）</strong>：在生成基础上接收实时输入，根据语言、语音或控制信号持续改变后续发生的内容，从一次性生成走向连续交互。</li><li><strong>L3 可行动世界（Actionable World）</strong>：模型从数字世界进入物理世界，环境理解、未来预测与动作生成协同，产出可执行的机器人动作并依据真实反馈优化决策。</li><li><strong>L4 自主世界智能体（Autonomous World Agent）</strong>：迈向自主决策，主动感知环境、拆解任务、探索未知状态，并围绕长期目标持续规划动作。</li><li><strong>L5 世界编排器（World Orchestrator）</strong>：超越单一智能体，协调机器人、数字智能体、人类、工具等资源，实现复杂任务分配与多智能体协作。</li></ul>

<p class="wp-block-paragraph">生数科技表示，其研究与部署已覆盖前三级：L1 由 2024 年发布的视频生成基础模型 Vidu 初步实现；L2 由 2026 年 7 月发布的 Vidu S1 推进到实时交互，用户可通过语音干预并持续影响后续生成；L3 则由 Motus 与 Motubrain 承担，把能力从视频生成推向物理动作。</p>

<h2 class="wp-block-heading">从视频到机器人：Motubrain 的关键数据</h2>

<p class="wp-block-paragraph">Motus 于 2025 年 12 月发布并完全开源，标志着生数科技从视频生成走向物理动作。Motubrain 则在 2026 年 4 月发布，基于 Mixture-of-Transformers（MoT，混合专家Transformer）架构，将环境理解、世界状态预测与动作轨迹生成统一进单一模型，把通用世界模型从视觉模拟推向物理决策。</p>

<p class="wp-block-paragraph">据披露，相比 Motus，Motubrain 的推理速度约快 10 倍，并且只需 50 至 100 个人类演示就能适配新的机器人本体。在 RoboTwin 2.0 基准测试中，Motubrain 取得 96.1 分的成绩，排名排行榜第一，并已在 Galaxea AI 等多种机器人本体上完成验证，展现出长程任务、多任务场景与跨本体泛化能力。</p>

<h2 class="wp-block-heading">三大支柱：数据、架构与<a href="https://mylogs.cn/ai-%e6%99%ba%e8%83%bd%e4%bd%93%e5%bc%95%e7%88%86%e9%9c%80%e6%b1%82%ef%bc%9a%e6%9c%8d%e5%8a%a1%e5%99%a8-cpu-%e4%ba%a4%e4%bb%98%e8%a6%81%e7%ad%89-30-%e5%91%a8/">算力</a></h2>

<p class="wp-block-paragraph">生数科技把构建通用世界模型拆成三个基本要素。其一是数据：需要一层层递进的数据金字塔，从网络规模视频、精选教学视频、第一视角人类视频，到人类演示动作、真实机器人交互；合成数据可增强每一层，而&#8221;不完美&#8221;数据（失败尝试、纠正动作、恢复轨迹）同样提供宝贵的学习信号。其二是架构：必须在统一框架内处理图像、视频、语言和机器人动作，MoT 通过分配模态特定参数并保留共享注意力来实现跨模态交互。其三是算力：大规模预训练与实时部署都依赖训练基础设施、推理加速、模型蒸馏与高效注意力。</p>

<h2 class="wp-block-heading">通往 L4/L5 的六道关卡</h2>

<p class="wp-block-paragraph">尽管前三级已有具体落地，生数科技也坦承，迈向更高层级的世界智能仍有显著差距，并列出六项关键挑战：跨理解、想象、动作与迁移的联合评估；学习接触、摩擦、力等物理动态及其干预后果；持久且可修订的记忆；通过真实交互进行在线学习与自我改进；在延迟与资源约束下实现高效闭环部署；以及更强的安全性与可控性。</p>

<h2 class="wp-block-heading">国产 AI 的世界模型布局</h2>

<p class="wp-block-paragraph">生数科技是国产 AI 视频大模型 Vidu 的研发方。Vidu 于 2024 年 4 月由清华大学与生数科技联合发布，基于原创的 U-ViT 架构，是全球首个融合 Diffusion 与 Transformer 技术的视频生成模型。从视频模型到世界模型，从数字空间到物理空间，生数科技正在探索一条更完整的通用智能路径。随着相关技术持续演进，通用世界模型有望加快走向真实产业场景，在制造、物流与服务机器人等领域释放价值。</p>

<figure data-wp-context="{&quot;imageId&quot;:&quot;6ac16d435d97f&quot;}" data-wp-interactive="core/image" data-wp-key="6ac16d435d97f" class="wp-block-image size-large wp-lightbox-container"><img decoding="async" width="1200" height="676" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/9ae6d8f61bb38f64493e231b5142d367_header.webp" alt="生数科技通用世界模型五级路线图" class="wp-image-5394" srcset="https://mylogs.cn/wp-content/uploads/2026/08/9ae6d8f61bb38f64493e231b5142d367_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/9ae6d8f61bb38f64493e231b5142d367_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/9ae6d8f61bb38f64493e231b5142d367_header-1024x577.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/9ae6d8f61bb38f64493e231b5142d367_header-768x433.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：生数科技（via CNA）</figcaption></figure>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
