一文读懂HY-World 2.0:多模态世界模型如何让3D世界生成、重建与模拟触手可及
【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0
HY-World 2.0 是腾讯开源的多模态世界模型框架,能从文字、单张图片或视频出发,直接生成、重建并模拟可交互的真实 3D 世界,而不是"放完即止"的视频片段。整套体系由四大模型组成:HY-Pano 2.0(全景生成)、WorldNav(轨迹规划)、WorldStereo 2.0(世界扩展)和WorldMirror 2.0(前馈式 3D 重建),最终产出可导入 Blender / Unity / Unreal 的 3DGS 高斯泼溅与网格资产。本文将带你快速看懂它的架构、亮点与上手路径。
为什么需要3D世界模型?它和视频世界模型有何不同
市面上不少"世界模型"(如视频生成类方案)产出的是像素级视频——本质是"看一段电影":时长有限、视角不一致、无法编辑、无法进引擎。
HY-World 2.0 走的是另一条路:直接构建持久、可编辑的 3D 资产。正如项目方所说——"看一段视频,看完就没了;造一个世界,永远留下"(Build a world, keep it forever)。
| 维度 | 视频世界模型 | 3D世界模型(HY-World 2.0) |
|---|---|---|
| 输出 | 像素视频(不可编辑) | 真实 3D 资产:网格 / 3DGS(完全可编辑) |
| 可玩时长 | 通常约 1 分钟 | 无限——资产永久保存 |
| 3D一致性 | 多视角闪烁、伪影 | 原生 3D 一致 |
| 实时渲染 | 每帧推理、延迟高 | 消费级显卡即可实时渲染 |
| 可控性 | 弱控制、无真实物理 | 精确控制、真实物理碰撞 |
| 引擎兼容 | 仅视频文件 | 可直接导入 Blender / UE / Isaac |
下面是由 HY-World 2.0 实时交互捕获的真实 3D 资产(非生成视频):
世界生成四步流水线:从一句话到可漫游的3D世界
HY-World 2.0 的"世界生成"(World Generation)是一条四阶段流水线:全景生成 → 轨迹规划 → 世界扩展 → 世界合成。文字或单图输入进来,可漫游的 3D 世界(3DGS / 网格)输出出去。
- Stage 1 全景生成(HY-Pano 2.0):将文本或单张透视图扩展为 360° 等距柱状全景图(默认 1920×960)。它提供两个后端:基于 HunyuanImage-3 的"思考-改写-扩散"完整推理管线,以及更轻量的 Qwen-Image-Edit + LoRA 后端,代码位于 hyworld2/panogen/。
- Stage 2 轨迹规划(WorldNav):由视觉语言模型(VLM)识别场景中的兴趣目标,结合 NavMesh 避障规划出环绕、探索、航拍等多样化相机轨迹,见 traj_generate.py 与 src/navi_utils.py。
- Stage 3 世界扩展(WorldStereo 2.0):基于扩散的"视频式"生成模型,沿规划轨迹把全景场景扩展开;内置**全景记忆库(PanoramaMemoryBank)**保证跨轨迹一致性,并支持 DMD 蒸馏四步快速推理,源码在 models/。
- Stage 4 世界合成(WorldMirror 2.0 + 3DGS 学习):把生成的帧对齐到深度、法线与相机,训练出最终的高斯泼溅世界,并可导出
.ply、压缩.spz与网格,训练器为 world_gs_trainer.py。
完整流程由五个脚本接力完成:轨迹规划 → 轨迹渲染 → 世界扩展 → GS 数据准备 → 3DGS 训练,详细命令见 hyworld2/worldgen/README.md。
生成的世界支持第一/第三人称漫游、物理碰撞——不只是"看",更是"玩":
世界重建:WorldMirror 2.0 一次前馈预测5类3D信息
如果说世界生成是"无中生有",世界重建(World Reconstruction)就是"照片变数字孪生"。
只需一段随手拍摄的视频或一组多视角照片,WorldMirror 2.0 作为统一前馈模型,单次前向传播即可同时输出:
- 📍 世界坐标系下的 3D 点云
- 📏 每视角深度图(支持 50K–500K 像素的灵活分辨率推理)
- 🧭 表面法线
- 🎥 相机位姿与内参
- ✨ 3DGS 高斯泼溅属性(中心、尺度、旋转、不透明度、球谐系数)
重建效果演示(输入视频 → 点云 / 深度 / 法线 / 3DGS):
重建精度:多组基准测试中的领先表现
在 7-Scenes / NRGBD / DTU 三个数据集的点图重建测试中,WorldMirror 2.0 配合全部先验(相机位姿 + 内参 + 深度)时,DTU 的 Acc 达到0.554、Comp 达到0.771,均优于 WorldMirror 1.0 与 Pow3R、MapAnything 等对比方法。
一个实用技巧:如果手头已有相机参数 JSON 或深度图目录,可以通过先验注入进一步压低误差,接口见 pipeline.py。
快速上手指南:环境安装与最小代码运行
环境要求
推荐CUDA 12.8 + Python 3.11+,先建一个共享环境,再按需叠加世界生成的额外依赖:
git clone https://gitcode.com/gh_mirrors/hy/HY-World-2.0 cd HY-World-2.0 conda create -n hyworld2 python=3.11.15 conda activate hyworld2 pip install -r requirements.txt3行代码跑通世界重建
模型权重会在首次运行时自动下载;代码入口为 hyworld2/worldrecon/:
from hyworld2.worldrecon.pipeline import WorldMirrorPipeline pipeline = WorldMirrorPipeline.from_pretrained('tencent/HY-World-2.0') result = pipeline('path/to/images')更省事的方式是启动自带的 Gradio 网页 Demo(gradio_app.py):上传照片或视频,浏览器里直接查看 3DGS、点云、深度、法线与相机参数:
python -m hyworld2.worldrecon.gradio_app生成360°全景图
from pipeline import HunyuanPanoPipeline # 工作目录:hyworld2/panogen/ pipeline = HunyuanPanoPipeline.from_pretrained('tencent/HY-World-2.0') output = pipeline('input.png') output.save('output_panorama.png')跑通完整世界生成流水线
世界生成对硬件要求更高(建议 ≥4 张 GPU,官方以 8×H20 测试),且需要一台部署了 VLM 的 vLLM 服务用于轨迹规划。五阶段命令与数据目录结构完整收录在 hyworld2/worldgen/README.md,训练完成后可用 show_gs.py 在浏览器中交互式查看成果:
项目结构速览与文档索引
| 模块 | 路径 | 说明 |
|---|---|---|
| 世界重建 WorldMirror 2.0 | hyworld2/worldrecon/ | 前馈 3D 重建、Gradio Demo |
| 世界生成 WorldNav + WorldStereo | hyworld2/worldgen/ | 轨迹规划、世界扩展、3DGS 训练 |
| 全景生成 HY-Pano 2.0 | hyworld2/panogen/ | 两个生成后端 |
| 示例输入数据 | examples/worldrecon/ | 真实/风格化多视角样例 |
| 详细文档 | DOCUMENTATION.md / DOCUMENTATION_zh.md | 参数参考、输出格式、先验注入 |
总结:3D世界生成、重建与模拟,真的触手可及了
一句话回顾 HY-World 2.0 的价值:输入可以是文字、一张图或一段视频;输出是持久、可编辑、可进引擎的真实 3D 世界。技术上它以 HY-Pano 2.0 打底、WorldNav 规划路线、WorldStereo 2.0 扩展世界、WorldMirror 2.0 完成重建与合成,四者各司其职。项目已开源全部推理代码、模型权重与技术细节(WorldMirror 2.0 约 1.2B 参数、WorldStereo 2.0 约 17B、HY-Pano-2 约 80B 参数),无论你想把照片变成数字孪生,还是从一句话"造"出一个可漫游的卡通小镇,都值得一试。
【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考