一张图生成3D梦中情房,桌椅摆件随心换,又一世界生成模型来了

智东西·2026年09月01日 16:43
应用场景覆盖具身智能、游戏、影视、XR等。

智东西9月1日报道,今天,上海3D生成大模型公司影眸科技发布世界生成模型Hyper3D WorldGen,推动3D生成从“单个资产”走向“完整场景”

用户上传一张场景图片后,模型可以自动识别画面中的主要物体,并生成对应的3D资产,也支持手动框选目标生成,并通过影眸Hyper3D团队自研的CAST架构,重建物体之间的空间与物理关系,最终生成由多个独立、可编辑、可替换、可交互资产组成的3D场景。

CAST为“基于单张RGB图像的组件对齐式3D场景重建”,是影眸Hyper3D团队在2025年发布的场景级生成研究成果。其核心是从单张图片中补全被遮挡物体的三维结构,判断物体之间的接触、支撑、悬挂等关系,并将多个独立物体放入统一、物理合理的三维空间。该研究曾获SIGGRAPH 2025最佳论文。

值得注意的是,WorldGen的生成能力已经进入具身智能仿真训练、影视制作、游戏开发与XR等真实生产场景,推动场景级3D生成从视觉展示走向产业工作流。

模型发布前,智东西等媒体采访了影眸科技创始人、CEO吴迪和联合创始人、CTO张启煊,围绕WorldGen的技术路线、应用进展及3D生成行业趋势等问题进行了交流。

01.一张图片生成场景,场景内资产可交互

媒体交流会上,张启煊演示了WorldGen的生成过程:上传一张办公室盥洗室的图片后,系统能够自动识别水龙头、盘子、水果等主要物体,约2-3秒生成单个物体的3D预览,并在约2-3分钟内还原出完整场景。

这些物体都是可以被选择、移动和替换的独立资产。开启SimReady功能后,系统可以为资产估计出物体质量、大小和摩擦系数等物理属性,水果能够在力的作用下滚入水池中。

此外,用户还可以根据物体的重要程度选择不同的生成精度,先快速确定场景结构,再对重点资产进行精修。

吴迪举例称,如果用生成模型直接将会议室的图片转化为一个3D场景,画面中的桌椅、墙壁和其他物体通常会被合并在一起,难以单独选择和编辑。WorldGen在生成过程中能够拆分场景中的主要物体,分别生成独立资产,同时还原它们之间的空间与物理关系。

为了兼顾场景可用性与视觉完整性,WorldGen采用混合表达方式:需要编辑和交互的物体使用具备完整几何结构的网格模型(Mesh),方便后续调整和添加物理属性;背景则采用侧重还原场景外观的3D高斯泼溅(3D Gaussian Splatting),保留更多环境细节。

02.覆盖四类应用场景,具身智能、影视领域率先推进

张启煊向智东西介绍,WorldGen并非针对某个单一行业开发的模型,其应用场景覆盖具身智能、游戏、影视制作和XR等领域。目前,WorldGen已经在不同方向上推进落地应用。

在具身智能领域,影眸Hyper3D已与地瓜机器人、谋先飞展开合作,推出仿真训练方案:WorldGen负责生成可用于仿真的3D场景,谋先飞则进行仿真适配,地瓜机器人提供算力与开发工具链。

张启煊称:“生成式3D可以快速扩充物体种类和场景布局,但不会完全替代真实数据,机器人训练未来更可能混合使用仿真与真实数据。”

在影视领域,WorldGen能够解决视频模型在多镜头中难以保持空间和物体位置一致的问题。创作者可以先生成空间结构明确的3D场景,在其中调整镜头、移动物体和修改布局,再交给Seedance 2.5等视频模型补充人物表现、材质、光影和画面风格。

在游戏和专业3D制作领域,WorldGen生成的独立网格资产可以进入Blender、Unity、PlayCanvas和Unreal Engine等数字内容创作(DCC)工具及实时引擎,继续进行材质调整、动画绑定、关卡编辑和性能优化。今年7月,影眸Hyper3D还与Unity中国宣布合作,尝试打通从3D生成到实时游戏应用的流程。

在XR领域,WorldGen可以将参考图片还原为可编辑的三维空间,用户能够从不同视角观察场景,并调整物体和空间布局,可用于室内设计、空间展示和沉浸式体验。

张启煊告诉智东西,WorldGen在上述行业的应用目前主要处于内测或技术验证阶段,团队将根据实际客户需求确定后续投入重点。

03.以刚体生成为主,向“构建世界”继续演进

在采访交流环节,针对WorldGen技术边界的提问,张启煊称,系统生成的质量、摩擦系数等物理属性并非对真实物体的精确测量,主要结合资产体积、视觉信息、周围物体关系、传统估计算法以及视觉语言模型,对质量分布、摩擦系数和碰撞体进行推断。

因而,这些结果不能作为精密工程数据使用。现阶段,WorldGen主要支持刚体生成,尚未覆盖关节化资产、柔体和流体等。

关于WorldGen与“世界模型”的关系,吴迪称,世界模型既包括面向决策和行动的行动模型(Action Model),也包括生成可交互、可训练环境的模型,WorldGen更接近后者。影眸Hyper3D不会因此将自身定义为世界模型公司,其核心定位仍是3D生成。

吴迪认为,视频模型擅长最终画面呈现,3D则能够明确保存物体、空间结构和物理关系,两条路线并非相互取代,未来更可能以混合方式结合。

从单个资产走向完整场景,WorldGen让生成结果具备更强的可控性、可编辑性和工作流兼容能力。随着3D生成从“看起来好看”走向“真正可用”,场景级生成也正在成为连接游戏、影视、具身智能和XR等行业的新基础能力。

04.结语:3D生成竞争转向场景可用性

WorldGen的3D生成能力,并不只是局限于生成单个资产或是一个3D空间,它能够构建多个独立资产、理解空间关系与物理属性,形成可继续编辑、交互和运行的完整场景。3D生成的竞争重点正在从单个模型的视觉质量,进一步转向场景的可控性、物理合理性和工作流兼容能力。

现阶段,WorldGen仍以刚体生成为主,部分物理属性也依赖模型推断,在具身智能、游戏、影视和XR等领域仍处于验证与早期落地阶段。其后续价值能否真正释放,还要看生成结果能否稳定进入专业生产流程,但从“生成资产”走向“构建场景”,已经成为3D生成领域可行性较高的方案。

本文来自微信公众号“智东西”(ID:zhidxcom),作者:杨京丽,编辑:李水青,36氪经授权发布。

+1
2

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

快手旗下可灵AI完成204亿增资,获大基金参投。

9小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业