HY-World 2.0:统一生成与重建,腾讯混元打造开源 3D 世界模型新标杆

HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds

总结
问题
方法
结果
要点
摘要

腾讯混元团队推出 HY-World 2.0,这是一个统一 3D 世界“生成”与“重建”的多模态世界模型框架。该系统支持文本、单图、多图及视频输入,通过四阶段流水线生成高保真、可导航的 3D 高斯点云(3DGS)场景,在多项基准测试中达到 open-source SOTA,性能直追闭源模型 Marble。

TL;DR

腾讯混元团队发布了 HY-World 2.0,这是首个系统性地将 3D 世界生成(Generation) 与 物理精确重建(Reconstruction) 完美统一的开源框架。它能够将一段文字或一张照片,转化为一个物理连贯、可交互、带碰撞检测的 3D 高斯点云(3DGS)世界。

1. 痛点:生成与重建的“柏林墙”

在 AI 领域,构建 3D 环境一直存在两条平行线:

  • 重建派(如传统的 MVS 或最近的 AnySplat):追求几何精度,但“所见即所得”,无法处理遮挡和盲区。
  • 生成派(如各类 Video-to-3D):想象力丰富,但在大尺度场景下往往发生“几何漂移”,导致场景在物理上不可靠。

HY-World 2.0 的核心动向就是拆掉这堵墙:通过视频生成的强力 Prior 处理未知区域,通过升级的 Feed-forward Reconstruction 确保几何严谨性。

2. 核心架构:四阶段炼就 3D 世界

HY-World 2.0 的工作流程像是一个人类探险家:先看全局(全景生成),再定路线(轨迹规划),接着向远方探索(世界扩张),最后绘制地图(3D 组合)。

模型架构图

第一阶段:HY-Pano 2.0(全景初始化)

作者摒弃了传统繁琐的几何纠偏,采用 MMDiT(Multi-Modal Diffusion Transformer)在潜空间直接学习透视图像到等距柱状投影(ERP)的映射。这种“数据驱动”的方法能够生成无缝且具备全局语义一致性的 300° 视角。

第二阶段:WorldNav(语义轨迹规划)

为了让生成的 3D 世界没有死角,系统内置了一个“智能导航员”。它会利用 Qwen3-VL 进行场景理解,辨别障碍物,并设计出五种启发式路径(如:绕着物体转、专门去拍模糊区域等),确保后续重建有足够的高重叠度视角。

第三阶段:WorldStereo 2.0(世界扩张)

这是物理一致性的关键。作者提出了 Keyframe-VAE,只对空间进行压缩而保留时间维度。

  • GGM(全球几何记忆):将粗糙的点云作为 3D 先验“喂”给模型,防止生成过程中房子塌了、路偏了。
  • SSM++(空间立体记忆):通过“检索-拼接”机制,让模型在生成新帧时能参考之前的关键帧,细节纹理的一致性大幅提升。

第四阶段:WorldMirror 2.0 与 3D 组合

这是最后的拼图。WorldMirror 2.0 引入了 Normalized Position Encoding。传统的位姿编码在测试分辨率大于训练分辨率时会失效,而归一化编码将外插转为内插,保证了在 4K 级别渲染下依然稳健。

3. 实验结果:开源界的 Marble 挑战者

HY-World 2.0 在与目前顶尖的闭源模型 Marble 对比中表现惊艳。从对比图中可以看到, Marble 在大视角变换下经常出现模糊或几何缺失,而 HY-World 2.0 对围栏、车辆等细长结构的保持更具韧性。

实验结果对比

在消融实验中,加入 MaskGaussian 机制后,模型自动识别并剪枝了天空中冗余的、导致渲染卡顿的虚假高斯点,使得 3DGS 数量减少了 73.7%,渲染效率大幅提升。

4. 深度洞察:为什么它能成功?

  1. Keyframe 胜过 Full Video:在 3D 重建中,帧与帧之间的冗余是有害的。作者选择生成关键帧而非连续视频,极大地释放了显存去提升单帧的高频细节。
  2. 几何驱动的 Attention:模型不是在盲目地 Predict 像素,而是在 GGM(几何记忆) 的显式引导下进行插值,这使得生成过程具备了类似传统 SLAM 的空间感。

5. 局限性与展望

尽管 HY-World 2.0 刷新了性能,但在处理极其复杂的动态透明材质(如喷泉、火焰)时,生成的深度图仍存在挑战。未来的方向可能会集中在将 SSM(状态空间模型) 引入长时记忆,以及进一步降低 3DGS 训练的冷启动耗时。


总结:HY-World 2.0 不仅仅是一个模型,它是一套完整的生成式 3D 生产力工具链路。随着权重的发布,它有望在开源社区掀起一波“世界模型”的新浪潮。

发现相似论文

试试这些示例

  • 查找最近其他尝试在 Transformer 架构中通过 Keyframe 机制解决长视频生成和 3D 一致性的论文。
  • 哪篇论文最早提出了 3D Gaussian Splatting (3DGS) 用于实时渲染,本文提出的 MaskGaussian 与之有何改进关系?
  • 研究如何将 HY-World 2.0 的 3D 世界生成能力应用到具身智能(Embodied AI)的闭环导航仿真任务中?
目录
HY-World 2.0:统一生成与重建,腾讯混元打造开源 3D 世界模型新标杆
1. TL;DR
2. 1. 痛点:生成与重建的“柏林墙”
3. 2. 核心架构:四阶段炼就 3D 世界
3.1. 第一阶段:HY-Pano 2.0(全景初始化)
3.2. 第二阶段:WorldNav(语义轨迹规划)
3.3. 第三阶段:WorldStereo 2.0(世界扩张)
3.4. 第四阶段:WorldMirror 2.0 与 3D 组合
4. 3. 实验结果:开源界的 Marble 挑战者
5. 4. 深度洞察:为什么它能成功?
6. 5. 局限性与展望