WorldGen 可从一张 RGB 场景图生成由多个独立物体构成的 3D 环境,而非难以拆分编辑的整体网格。 CAST 会尝试补全遮挡结构,并推断物体间的接触、支撑、悬挂及空间关系,让场景具备可继续编辑的结构基础。 其定位是游戏、影视、XR 和具身智能仿真的生产起点;物理参数属于推断值,实际项目仍需人工验证与清理。
发布者使用 GPT-5.6 Terra 编辑图片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Deemos Hyper3D WorldGen, launched on September 8, 2026, and how does it use the Hyper3D team’s SIGGRAPH 2025 Best Paper-winning CAST. Article summary: Hyper3D WorldGen is Deemos/Hyper3D’s scene-generation system: it turns one RGB scene image into a composed 3D environment of separately editable objects, rather than a single baked scene shell. Its technical basis is CAS. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Hyper3D WorldGen 想解决的,并不只是“由图生 3D”。它要把一张 RGB 场景图片变成由多个可独立编辑、替换和交互的 3D 资产组成的环境,而不是输出一个视觉上完整、但后续难以拆开的整体模型。
其技术基础是 CAST,即“基于单张 RGB 图像的组件对齐式 3D 场景重建”(Component-Aligned 3D Scene Reconstruction from an RGB Image)。这项研究获得了 SIGGRAPH 2025 最佳论文奖。2
11
用户上传场景图后,可以让 WorldGen 自动识别画面中的主要物体,也可以手动框选需要生成的区域。1
4
难点在于:单张图片只能看到一个视角,桌子背后、椅子被遮挡的部分都不存在直接可见的信息。CAST 的目标是在这一限制下,补全合理的遮挡几何,并将多个物体放到同一三维坐标体系中;系统还会建模接触、支撑、悬挂等关系。4
11
以室内图为例,桌子、椅子、墙面和摆件不是一堆彼此无关的像素。它们有相对位置,也有符合常识的物理关系。把这些关系保留下来,才有可能让后续的移动、替换、动画和交互编辑真正成立。
据 Hyper3D 的介绍,WorldGen 输出的是一组独立资产,而不是融合成一个场景网格。这意味着椅子、桌子或小型道具理论上可以被单独选中、移动、替换、动画化或接入交互逻辑,无须重建整个场景。2
4
Hyper3D 将这些对象定位为 Rodin 网格资产。对美术与开发团队而言,这种形式更接近现有工作流:生成结果可作为场景搭建的起点,之后再在既有工具中完善材质、绑定、交互、关卡设计与性能优化,而不是把一次生成结果当作不可改动的最终交付物。2
WorldGen 据称采用混合式表达:前景或需要互动的对象使用可编辑网格,背景环境则使用 3D Gaussian Splatting(3D 高斯泼溅)。2
这种分工较符合制作需求:网格适合选择、移动、动画和物理模拟;高斯泼溅则能以较高的视觉密度保留背景氛围与环境信息,但并不意味着背景具备同等程度的对象级编辑能力。它追求的是画面完整度与生产可控性之间的平衡。
Hyper3D 表示,WorldGen 可估计比例、质量、摩擦力及碰撞相关属性,面向机器人和具身智能仿真等用途。2
不过,这些属性本质上是从单张图像中推断出的初始值,不是测量级数据。一张 RGB 图片无法唯一确定物体真实尺寸、材料摩擦系数、内部构造或质量。因此,在对物理精度要求高的仿真任务中,更合理的做法是把它们当作可编辑的先验参数,并进行验证与校准。
Hyper3D 称,WorldGen 资产可以导入 Blender、Unity、PlayCanvas、Unreal Engine 和团结引擎,继续进行材质编辑、动画绑定、关卡设计和优化。2
在影视制作中,它设想的流程是:先用生成的 3D 场景固定镜头、物体与空间布局关系,再将渲染结果或镜头参考交给视频生成工具,由后者补充表演、材质、光照与风格化效果。这样做的目标,是让多镜头之间拥有更稳定的空间连续性。2
对于游戏和 XR,真正的价值也不止于“第一眼像不像”,而在于场景是否便于重排、优化并连接交互。对于仿真任务,价值则是缩短从参考图片到具有初步空间和物理结构的环境之间的路径。
虽然名为 WorldGen,但它不应与能够理解因果、预测长期变化、规划智能体行为的通用决策型世界模型混为一谈。
现有资料所支持的能力是场景级重建与生成:把资产、几何和物理关系组织为可交互的 3D 环境。2
4 它的贡献在于生产导向的场景结构,而不是通用具身推理。
目前公开描述主要支持刚体场景生成,并未证明其已全面覆盖可动关节角色或物体、软体、布料和流体模拟。CAST 相关介绍也将织物、玻璃、光照和背景建模列为仍具挑战的问题。11
关于速度,报道提到该系统可在数秒内给出预览、数分钟内完成场景,并通过按重要性分配细节的方式,先确定整体布局、再细化关键资产。这些属于公司或媒体表述,而非独立的生产基准测试结果。5
WorldGen 代表了生成式 3D 的一个方向变化:从生成单件模型,或产出难以编辑的视觉重建结果,转向构建可进入既有数字内容制作与仿真管线的场景资产结构。
它最有价值的主张并不是“一张图就能百分之百还原现实中所有隐藏细节”,而是把一张图转化为包含独立资产、空间关系和近似物理属性的可编辑场景,供创作者继续完善。2
4
实际评估时,最直接的方法是:将有代表性的生成场景导入目标 DCC 软件或引擎,检查资产是否真正可拆分、空间关系是否稳定,并测量为满足游戏、影视、XR 或仿真要求还需多少人工清理。决定其实际价值的,最终不是图生 3D 本身,而是下游编辑是否足够顺畅。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
WorldGen 可从一张 RGB 场景图生成由多个独立物体构成的 3D 环境,而非难以拆分编辑的整体网格。
WorldGen 可从一张 RGB 场景图生成由多个独立物体构成的 3D 环境,而非难以拆分编辑的整体网格。 CAST 会尝试补全遮挡结构,并推断物体间的接触、支撑、悬挂及空间关系,让场景具备可继续编辑的结构基础。
其定位是游戏、影视、XR 和具身智能仿真的生产起点;物理参数属于推断值,实际项目仍需人工验证与清理。