热搜:暂无热词
家具摆件自由替换,空间物理关系还原
本文解析影眸科技Hyper3D WorldGen模型,通过CAST架构实现单图生成可编辑3D场景,支持家具替换与物理属性推断,适用于具身智能、影视及游戏开发。
3D生成正从单个资产走向完整场景。影眸科技发布Hyper3D WorldGen,利用单张图片即可重建包含空间与物理关系的3D世界,让桌椅摆件随心替换,为影视、游戏及机器人训练提供新解法。

Hyper3D WorldGen 的核心突破在于将 3D 生成的粒度从单一资产提升至完整场景。基于其独创的 CAST(组件对齐式3D场景重建) 架构,该模型能够解析单张 RGB 图像中的空间逻辑。它不仅能识别主要物体,还能通过算法补全被遮挡部分的三维结构,从而重建出符合物理规律的空间关系。
这种“单图输入,场景级输出”的能力,使得用户只需上传一张图片,或手动框选特定目标,即可生成具备真实物理属性的 3D 世界。这一技术成果因其创新性,荣获了 SIGGRAPH 2025 最佳论文。对于开发者和创作者而言,这意味着无需复杂的建模流程,即可快速搭建用于影视预演或游戏开发的交互式空间。
了解了CAST架构的底层逻辑后,实际体验WorldGen时最直观的感受是效率与灵活性的平衡。以重构一个办公室盥洗室场景为例,上传参考图后,系统能在 2-3秒 内生成单个物体的3D预览,而完整场景的还原通常仅需 2-3分钟。这种速度对于快速迭代设计或预演空间布局极具价值,大幅缩短了从概念到可视化的等待时间。
在技术实现上,WorldGen采用了混合表达策略以兼顾编辑性与视觉保真度。对于桌椅、摆件等需要频繁调整的独立资产,模型生成标准的 Mesh网格模型,确保其具备清晰的拓扑结构,方便后续替换或修改;而对于墙面、地面等复杂背景,则采用 3D高斯泼溅(3D Gaussian Splatting) 技术,以保留丰富的光影细节和纹理特征,避免背景过于简化。
若场景需用于仿真训练,可开启 SimReady 功能。该功能会自动估计物体的质量、尺寸及摩擦系数等物理属性,使生成的场景不仅“看起来像”,更“动得准”。在此基础上,用户可对生成的资产进行自由选择、移动或替换,并从不同视角观察布局效果,为影视预演或机器人路径规划提供高精度的交互环境。
当生成的3D场景具备物理属性与可编辑性后,其价值便从“视觉展示”延伸至“生产落地”。目前,WorldGen已在具身智能、影视、游戏及XR四大领域展开实际验证。在具身智能方向,模型正与地瓜机器人、谋先飞等合作伙伴协同,通过生成高保真的仿真训练场景,加速机器人策略的训练与迭代,解决真实环境采样成本高、风险大的痛点。
影视制作领域则关注多镜头下的空间一致性。WorldGen生成的3D世界可作为空间锚点,配合Seedance 2.5等视频生成模型,确保不同机位、不同时间段生成的画面在空间结构上保持连贯,大幅降低后期穿帮率。对于游戏开发者而言,效率提升体现在资产工作流的打通上。生成的Mesh网格资产可直接接入Blender、Unity及Unreal Engine等主流DCC工具与引擎,无需二次建模即可进入实时渲染流程,显著缩短开发周期。
在XR及室内设计场景中,WorldGen提供的可编辑三维空间支持用户自由调整布局,满足从方案预演到沉浸式体验展示的需求。尽管技术已初步融入产业工作流,但复杂光照下的细节还原仍有优化空间,这也为后续的技术演进指明了方向。
尽管WorldGen在场景重建上表现亮眼,但使用者需清醒认知其技术边界。当前模型生成的物理属性,如物体质量、摩擦系数等,属于基于视觉特征的推断值,而非精确测量数据。这意味着它适合用于机器人策略预训练或游戏逻辑模拟,但严禁直接作为精密工程或物理仿真的高精度输入。
在生成范围上,WorldGen现阶段主要聚焦于刚体资产的重建与交互。对于柔体(如布料)、流体(如水、烟)以及复杂关节化资产(如可活动的人形关节),目前尚未提供原生支持。此外,WorldGen的定位是生成“可交互的3D环境”,而非控制物体运动的“行动模型”。它提供的是舞台,而非演员。
从行业趋势看,3D生成领域的竞争焦点正从单纯的视觉逼真度,转向场景的可控性与工作流兼容性。未来,3D生成模型与视频生成模型将不再是孤立存在,而是以混合架构的方式深度结合:3D模型提供空间结构与物理约束,视频模型负责动态光影与纹理细节,共同推动场景级生成从“能看”走向“可用”。
CopyRight 2025 www.bzxz.net All Rights Reserved
本网站所展示的内容均由用户自行上传发布,本站仅提供信息存储服务。若您认为其中内容侵犯了您的合法权益,请及时联系我们处理,我们将在核实后尽快删除相关内容。