影眸WorldGen发布:一张图生成可编辑3D场景

2026年9月1日,上海影眸科技(Hyper3D)正式发布世界生成模型 WorldGen。用户只需上传一张场景图片,WorldGen 即可自动识别其中的主要物体并生成3D资产,重建物体之间的物理属性与关系,最终输出一个由多个独立3D资产构成的完整场景。从”生成一个物体”到”组织一个世界”,3D生成的基本单位正在发生一次跃迁。

它解决什么问题

过去一年,生成一段可以环视的空间已有不少惊艳展示,但大多只是一张”能环视360度的画”。真实生产需要的是可交互环境:游戏道具要放进关卡继续调整,影视角色要在统一空间完成多镜头调度,机器人训练面对的也不是悬空的杯子影像,而是有位置、遮挡和支撑关系、可被抓取移动的实体。WorldGen 要生成的,正是可交互、可编辑、可进入真实生产环境的三维场景。

技术原理:CAST 架构

WorldGen 基于影眸自研的 CAST 架构(Component-Aligned 3D Scene Reconstruction from an RGB Image)。该架构提出物理感知校正机制,推断物体间的接触与支撑关系,优化姿态,修正穿透、悬空等不合理现象。相关研究获得 SIGGRAPH 2025 最佳论文,同期获得最佳论文的商业公司仅有三家:谷歌、Meta 和影眸 Hyper3D。

系统将图像中需要编辑和交互的主要物体以独立网格资产形式生成,不需要参与交互的墙面、远景和环境背景则通过3D高斯泼溅保留更完整的视觉信息与空间沉浸感。依托 Rodin Gen-2.5 首次提出的 Thinking Effort(思考深度)架构,场景中的每个资产可按需分配生成精度:关键物体可继续细化,远处或非关键物体最快4秒即可生成可用3D资产。

能做什么:落地场景

具身智能仿真训练 WorldGen 可根据单张照片重建可交互三维场景并生成具备仿真导入能力的三维资产。影眸联合地瓜机器人(D-Robotics)、谋先飞(Motphys)发布”具身智能可训练仿真闭环联合解决方案”,用真实世界影像直接生成可训练虚拟场景,降低机器人数据采集与训练成本。作为 NVIDIA Inception 成员,影眸已与 NVIDIA Isaac Sim 生态衔接,覆盖从资产生成、仿真验证到策略部署的通路。

影视与游戏制作 WorldGen 可与 Seedance 2.5 等视频生成模型组成工作流:先建立空间结构明确的3D场景,确定构图与视角后再交给视频模型生成最终画面,提升多镜头叙事的一致性。其 AI Render 模块支持 AI 渲染与自由运镜。今年7月,影眸与 Unity 中国(团结引擎)宣布打通从3D生成到实时游戏应用的工程闭环,生成资产可进入 Blender、Unity、Unreal Engine 等环境二次创作。

XR 与空间计算 生成的3D场景可结合 Apple Vision Pro 等设备,让用户进入由单张图片生成的三维空间,近距离查看物体与环境细节,并进一步替换场景中的物体、调整陈列与布局。

与同类世界模型的区别

李飞飞 World Labs 的 Atlas 强调”一张照片生成可探索的3D世界”,京东 JoyAI、蚂蚁灵波等也发布了各自的世界模型。WorldGen 的差异化在于”场景级”:它生成的不仅是世界的视觉表象,更是构成世界的独立物体、空间关系与物理约束,并可直接进入 DCC 软件、实时引擎与仿真环境持续编辑,已切入实际影视项目制作流程。

常见问题

普通人现在能用吗? WorldGen 主要面向具身智能、影视、游戏与空间计算等生产场景,通过影眸 Hyper3D 官方渠道提供,普通创作者可在影视预演、概念短片与工作流提效中试用。

对游戏和影视意味着什么? 它把前期建模与场景搭建的时间大幅压缩,创作者像使用”3D导演台”一样在统一空间调度镜头、移动物体,再交由视频模型生成连续画面,提升复杂场景的可控性。

本文综合影眸 Hyper3D 官方发布、Z Potentials 深度解读及机器之心等公开报道整理。