从一句开放式文字描述出发,生成一个可以自由漫游的大规模三维世界,一直是三维内容生成里最难的一类任务。难点不在单个物体做得够不够精细,而在于系统必须同时守住三件事:全局空间连贯、局部内容足够丰富,以及产出的资产是显式的、能被下游流程继续编辑和复用。腾讯混元团队近期公开的 WorldClaw 给出的解法,是把整个搭建流程交给一套智能体来协同完成。

该项目的论文编号为 arXiv:2608.05248,8 月 5 日提交,属于计算机科学人工智能分类,作者为 Guo Chunchao、Li Jinpeng、Li Yang、Huang Zilong。同一天建立的 GitHub 仓库 Tencent-Hunyuan/Hunyuan3D-WorldClaw 于 8 月 7 日随项目页与论文一并公开,目前已累积 501 个星标和 26 次分叉,并在 Hacker News 上被推上讨论列表。
由粗到精,把世界搭建拆成流水线
WorldClaw 被定义为一个完全由智能体驱动的、由粗到精的开放世界三维场景生成框架。第一步由规划智能体负责,把一段文字提示翻译成结构化规格,明确区域划分、地形、资产、材质以及彼此的空间关系。
拿到规格之后,系统先搭全局地形底座,输入包括语义布局图、可复用资产、生成式或程序化材质,以及一张区域感知的高度场。对那些需要细节的重点区域,框架会在地形条件约束下生成区域构图,把其中的物体重建为可编辑的带贴图网格,再还原它们在地形上的准确摆放。最后由基于渲染的智能体做二次精修,逐项调整地形、物体、外观表现以及物体与地面的接触关系。
论文特别强调,全局地形与区域物体在最终成果里始终是各自独立、可单独管理的带贴图网格。对游戏和影视流程而言,这一点比画面观感更关键——能拆开改的场景才有工业价值。
底座模型清单与运行环境
WorldClaw 本身不是一个从头训练的大模型,而是一套调度体系,其能力边界由所调用的基础模型决定。论文的实现细节一节列出了完整清单:
- 底层智能体模型为 Claude Opus 4.8,团队为其开发了一组任务专用技能,用于接入外部基础模型和三维工具链
- 语义布局图与区域物体构图由 GPT-Image-2 生成
- 二维实例分割采用文本引导的 SAM3,除全图推理外还叠加重叠滑窗推理,以提升不同尺度物体的召回率
- 三维相关环节由 SAM3D 与 Hunyuan3D 承担,大物体输出 2048×2048 的 PBR 贴图,小物体为 1024×1024
- 全部实验运行在一台配备 4 张 NVIDIA H20 显卡的服务器上,地形生成、物体生成与摆放、场景精修与图像渲染均在 Blender 5.1.1 中完成
- 地形精修智能体由 BlenderMCP 驱动,从预设视角重新渲染场景,检查几何、材质、散布结果与渲染配置,再按检测到的问题做局部修正
与同类方案的差异
论文将 WorldClaw 与 SynCity、Marble、MajutsuCity、WorldGen、GPT-5.6 Sol 做了定性对比,每种方法都展示了覆盖世界不同部分的四个沉浸式漫游视角。对比结论集中在地形几何表达力和区域空间组织两点上:SynCity 靠分块三维隐变量支持场景级合成,但生成区域的长程组织较弱,不同地形类型之间的过渡不够清晰;Marble 在单个视角内视觉丰富度很高,展示出的地形却缺少显式的区域级组织;MajutsuCity 的建筑与资产排布结构化程度不错,但其面向城市的设计偏重实例排列而非大尺度地貌构建,地面几何相对规整;WorldGen 生成的村落环境连贯且可通行,视野内地形则偏平坦均质。
局限被写得很清楚
论文第五节没有回避问题。首先是对底座模型的高度依赖:WorldClaw 把世界构建拆给多个异质模型协同,分阶段可控性提升了,但对底层模型的泛化能力要求极高。实验中,当前的开源语言模型经常难以生成既可执行又符合用户要求的程序化地形与材质;开源图像生成模型则频繁做不出可用的语义布局图,或者在物体图像生成与提取过程中丢失外观与姿态。最终场景的视觉质量还直接受三维生成骨干的上限约束,几何与贴图保真度不足会明显削弱沉浸感。结论是现阶段要完整验证这套解耦流水线,仍然离不开 Claude Opus 4.8、GPT-Image-2、Hunyuan3D 这类能力较强的模型。
第二个风险来自代码生成的稳定性。地形构建、程序化材质生成、资产摆放和局部精修等多个阶段都依赖大模型直接产出的程序,而把高层自然语言要求稳定翻译成具体程序始终不容易,尺度估计、数值参数或节点连接上的差错都会传导到最终结果。
来源:arXiv(论文编号 2608.05248)、GitHub Tencent-Hunyuan/Hunyuan3D-WorldClaw、Hacker News

