0
9月1日,国际领先的3D生成大模型公司影眸Hyper3D正式发布全新世界生成模型 WorldGen,推动3D生成从“单个资产”向“完整场景”迈出重要一步。
据雷峰网了解,用户只需上传一张场景图片,WorldGen即可自动识别其中的主要物体生成3D资产,也可以根据用户手动框选的内容完成生成;并通过影眸Hyper3D团队自研的CAST架构重构图像中物体之间的物理属性与关系,最终构建出由多个可编辑、可替换、可交互资产组成的完整3D场景。
CAST(《CAST:基于单张RGB图像的组件对齐式3D场景重建》)是影眸Hyper3D团队在2025年发布的场景级生成研究成果,荣获当年国际图形学顶会SIGGRAPH最佳论文。
为了同时兼顾视觉完整性与场景可用性,WorldGen采用Mesh与3D Gaussian Splatting相结合的混合表达:场景中需要编辑和交互的物体由Hyper3D Rodin生成,成为具有完整几何结构与物理属性的独立Mesh资产;背景环境则通过3D Gaussian Splatting进行表达,以保留更完整的环境信息和沉浸感。
同时, WorldGen会预测各资产的几何位置、尺度、朝向与摆放关系,并估计碰撞体、质量、摩擦等物理属性。因此,生成结果不再只是可观看的三维画面,而是一个包含独立物体、空间关系与物理约束,能够继续编辑、运行和交互的完整3D场景。
从“生成一个物体”到“生成一个世界”,这是影眸Hyper3D在3D生成方向上的又一次关键跨越。更重要的是,WorldGen并非一项停留在Demo中的技术,其生成能力已经进入具身智能仿真训练、影视制作、游戏开发与空间计算等真实生产场景,推动场景级3D生成从视觉展示走向产业工作流。

让AI学会物理规律,生成可运行、可编辑的世界
过去两年,3D生成技术围绕“如何生成一个能用的三维资产”,完成了持续技术演进。当单资产生成逐步跨过质量与可用性门槛后,3D生成面临的下一个问题,已经不再只是继续提升单个模型的精度,而是如何把多个资产组织成具有空间结构与物理关系的完整场景。
对游戏、影视、具身智能仿真训练等生产场景而言,仅有单个3D资产,或一幅视觉上完整的三维画面远远不够。以“可用”为最终标准,场景级3D生成真正困难的地方,并不只是生成更多物体,而是要让模型从静态二维画面中,理解并还原现实世界中的物理规律。

一张图片能看到杯子放在桌面上,却无法直接判断杯子的重心、所受摩擦力以及它所在位置是否容易倾倒;能看到两本书在书架上斜靠在一起,却很难判断它们是否真实接触、由哪本书或书架提供支撑,以及抽出其中一本后会发生什么。
大量决定场景是否保持物理合理、能否稳定存在并发生真实交互的信息,在图像中并没有直接明确的信号。
2025年,影眸Hyper3D团队发表研究《CAST:基于单张RGB图像的组件对齐式3D场景重建》,探索如何从单张图像出发,构造由多个独立、完整、可交互物体组成,且在物理关系上合理的3D场景。该场景级生成研究成果斩获当年国际图形学顶会SIGGRAPH最佳论文,同期获得最佳论文的商业公司仅有三家:谷歌、Meta和影眸Hyper3D。

沿着CAST所验证的场景级3D生成方向,影眸Hyper3D团队继续推进后续模型、算法与工程系统的演进,最终形成WorldGen面向真实生产的多阶段技术路线。
WorldGen能够从存在遮挡、透视畸变和信息缺失的二维图片中逐物体补全几何,建立物体关系图,识别接触、支撑和悬挂等物理关系,并预测各个物体在统一三维空间中的位置、尺度、朝向与摆放状态。使生成场景不仅在视觉上完整,也更接近真实世界的空间结构与运行逻辑。
从具身训练到影视制作 多领域落地可用价值
1.具身智能:从单张照片到可训练场景
具身智能的训练高度依赖真实场景数据,但真实数据采集面临场地、设备、人员等多重成本约束,复杂布局、特殊物体状态等长尾场景在真实环境中难以复现。此外传统仿真建模依赖人工搭建,周期长且与真实世界存在明显偏差,数据、仿真与训练三个环节长期未能有效衔接。
作为NVIDIA Inception的一员,影眸Hyper3D长期深度融入NVIDIA全球仿真生态。此前,Hyper3D Rodin借助NVIDIA Omniverse与Isaac Lab上线了Sim-Ready功能,为3D生成资产赋予物理属性,并推出Isaac Sim官方插件。
如今,这一进程正通过Hyper3D WorldGen进一步深化,将“单个资产用于Isaac Sim”拓展为“整个场景用于Isaac Sim”。从资产生成到仿真验证,影眸Hyper3D已与NVIDIA Isaac Sim生态衔接为完整的上下游通路,覆盖具身智能仿真数据的关键环节。
今年7月,影眸Hyper3D联合地瓜机器人(D-Robotics)、谋先飞(Motphys)发布“具身智能可训练仿真闭环联合解决方案”,用真实世界的影像直接生成可训练的虚拟场景,降低机器人数据采集与训练的成本。
在这套方案中,WorldGen根据单张照片重建可交互的三维场景,并生成具备仿真导入能力的三维资产。通过调整场景布局与资产状态,可以构造同一任务下的多种环境变体。
在此基础上,谋先飞基于自研物理引擎 MotrixSim,完成资产的仿真适配与 SimReady 场景构建,使其能够支持机器人在场景中的运动、抓取和交互,并提供符合真实场景特征的仿真反馈。
地瓜机器人提供算力底座与开发工具链,将场景生成、仿真运行、数据采集和模型训练整合到同一平台。
该方案已形成从场景重建、仿真运行、数据采集、模型训练到策略验证的完整流程。光照、布局、障碍物及物体状态等参数均可快速调整,训练所得策略可向实体机器人迁移部署,并在真实环境中验证、迭代。目前,三方将持续完善该方案,并推进在具身智能训练场景中的落地应用。
与此同时,影眸Hyper3D参与的研究工作cuNRTO获得了2026年具身智能国际顶会RSS最佳论文提名,进一步探索3D生成资产、仿真训练与真实具身部署之间的Sim-to-Real问题。
从生成SimReady资产、构建可训练场景,到探索Sim-to-Real中的关键问题,影眸Hyper3D正在逐步打通3D生成与具身智能仿真训练之间的完整链路。
2.影视制作:以可控白模驱动影视级画面
随着视频生成技术的快速发展,单一镜头生成的画面质量已经有了显著提升。但涉及多镜头的复杂调度与叙事连贯,如何保持角色、物体、空间结构与场景布局的一致性,仍然是视频生成面临的关键难题。
WorldGen 为创作者提供的解法是:先建立一个资产彼此独立、空间结构明确的3D场景,在其中根据创作需求,自由调整镜头、移动物体、替换资产和修改布局,再将确定后的构图与视角交给视频生成模型完成最终画面。
目前,WorldGen已经能够与Seedance 2.5等视频生成模型形成完整AI工作流。WorldGen生成的场景通过提供稳定的空间结构、镜头关系和可控白模,配合Seedance 2.5等视频生成模型补充人物具体表现、画面的材质、光影和整体风格,将白模或基础渲染转化为接近影视级表现的动态片段。
基于WorldGen构建的3D场景,创作者可以像使用“3D导演台”一样,在统一的空间中调度镜头、调整构图、移动角色与物体,并在确定空间关系后生成连续画面,从而提升复杂场景与多镜头内容的可控性和一致性。
这一工作流将3D场景的空间可控性与视频生成模型的画面表现力结合起来,为多镜头叙事、广告制作、概念短片与影视预演提供了新的生产方式。
目前,WorldGen已经被用于实际影视生产,相关影视作品正在制作中,并将陆续上线。
https://weixin.qq.com/sph/A0ocyswufN
3.打通DCC与实时引擎:让生成场景进入现有工作流
3D 生成资产的生产价值,很大程度上取决于其与用户现有工作流的兼容性。
WorldGen并不是一个封闭的生成工具,其生成后的独立资产能够直接进入Blender、Unity、PlayCanvas、团结引擎、Unreal Engine等DCC与实时引擎环境,进行材质调整、动画绑定、关卡编辑、性能优化等二次创作。
用户可以先在WorldGen中快速生成场景资产,再回到熟悉的软件和管线中完成再创作,从而减少前期建模与场景搭建的时间,让AI 3D真正成为既有工作流中的生产力工具。
今年7月,影眸Hyper3D已与Unity中国(团结引擎)共同宣布,合力构建打通从3D生成到实时游戏应用的工程闭环。WorldGen也亮相同期举行的团结引擎2.0发布会,展示生成式场景在实时引擎和游戏生产流程中的落地能力。

影眸科技创始人兼CEO吴迪在Unity中国(团结引擎)发布会上展示 WorldGen效果
4.XR与空间计算:从一张图片进入一个三维空间
WorldGen生成的包含独立资产、明确物理关系与完整空间布局的3D场景,可进一步与Apple Vision Pro等XR设备结合,为用户提供更具临场感、可交互的沉浸式体验。
用户可以进入由单张图片生成的三维空间,从不同位置和视角观察场景,近距离查看其中的物体与环境细节,后续还可以进一步替换场景中物体、调整陈列、修改布局,并为关键物体增加交互能力。
这一能力可以进一步应用于室内设计、沉浸式教育、空间展示与XR内容创作,让过去只能被观看的一张图片,转化为可以进入、编辑和交互的三维空间。
从单个资产到完整场景,3D生成正在发生一次基本单位的变化。
WorldGen所生成的,不只是一个世界的视觉表象,而是构成这个世界的独立物体、空间关系与物理约束。当这些内容可以被拆分、编辑、替换、交互并接入现有生产流程,3D生成才真正开始从“生成内容”走向“构建世界”。
从资产生成到场景生成,再到可运行、可编辑、可持续扩展的三维空间,影眸Hyper3D正在推动3D生成进入新的发展阶段。未来,世界不再只是被拍摄、被观看或被手工搭建,也可以从一张图片、一段描述或一个创意出发,由AI快速生成,并在真实的生产流程中不断被修改、验证和使用。
当生成的场景能够承载内容、模拟现实、支持交互并连接不同产业,3D生成的价值也将不再局限于提升建模效率,而是成为连接数字内容、智能系统与现实空间的重要基础设施。(雷峰网(公众号:雷峰网))
雷峰网原创文章,未经授权禁止转载。详情见转载须知。