一文读懂HY-World 2.0:多模态世界模型如何让3D世界生成、重建与模拟触手可及
发布时间:2026/10/2 23:44:36 锦皓数字建站

一文读懂HY-World 2.0多模态世界模型如何让3D世界生成、重建与模拟触手可及【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0HY-World 2.0 是腾讯开源的多模态世界模型框架能从文字、单张图片或视频出发直接生成、重建并模拟可交互的真实 3D 世界而不是放完即止的视频片段。整套体系由四大模型组成HY-Pano 2.0全景生成、WorldNav轨迹规划、WorldStereo 2.0世界扩展和WorldMirror 2.0前馈式 3D 重建最终产出可导入 Blender / Unity / Unreal 的 3DGS 高斯泼溅与网格资产。本文将带你快速看懂它的架构、亮点与上手路径。为什么需要3D世界模型它和视频世界模型有何不同市面上不少世界模型如视频生成类方案产出的是像素级视频——本质是看一段电影时长有限、视角不一致、无法编辑、无法进引擎。HY-World 2.0 走的是另一条路直接构建持久、可编辑的 3D 资产。正如项目方所说——看一段视频看完就没了造一个世界永远留下Build a world, keep it forever。维度视频世界模型3D世界模型HY-World 2.0输出像素视频不可编辑真实 3D 资产网格 / 3DGS完全可编辑可玩时长通常约 1 分钟无限——资产永久保存3D一致性多视角闪烁、伪影原生 3D 一致实时渲染每帧推理、延迟高消费级显卡即可实时渲染可控性弱控制、无真实物理精确控制、真实物理碰撞引擎兼容仅视频文件可直接导入 Blender / UE / Isaac下面是由 HY-World 2.0 实时交互捕获的真实 3D 资产非生成视频世界生成四步流水线从一句话到可漫游的3D世界HY-World 2.0 的世界生成World Generation是一条四阶段流水线全景生成 → 轨迹规划 → 世界扩展 → 世界合成。文字或单图输入进来可漫游的 3D 世界3DGS / 网格输出出去。Stage 1 全景生成HY-Pano 2.0将文本或单张透视图扩展为 360° 等距柱状全景图默认 1920×960。它提供两个后端基于 HunyuanImage-3 的思考-改写-扩散完整推理管线以及更轻量的 Qwen-Image-Edit LoRA 后端代码位于 hyworld2/panogen/。Stage 2 轨迹规划WorldNav由视觉语言模型VLM识别场景中的兴趣目标结合 NavMesh 避障规划出环绕、探索、航拍等多样化相机轨迹见 traj_generate.py 与 src/navi_utils.py。Stage 3 世界扩展WorldStereo 2.0基于扩散的视频式生成模型沿规划轨迹把全景场景扩展开内置**全景记忆库PanoramaMemoryBank**保证跨轨迹一致性并支持 DMD 蒸馏四步快速推理源码在 models/。Stage 4 世界合成WorldMirror 2.0 3DGS 学习把生成的帧对齐到深度、法线与相机训练出最终的高斯泼溅世界并可导出.ply、压缩.spz与网格训练器为 world_gs_trainer.py。完整流程由五个脚本接力完成轨迹规划 → 轨迹渲染 → 世界扩展 → GS 数据准备 → 3DGS 训练详细命令见 hyworld2/worldgen/README.md。生成的世界支持第一/第三人称漫游、物理碰撞——不只是看更是玩世界重建WorldMirror 2.0 一次前馈预测5类3D信息如果说世界生成是无中生有世界重建World Reconstruction就是照片变数字孪生。只需一段随手拍摄的视频或一组多视角照片WorldMirror 2.0 作为统一前馈模型单次前向传播即可同时输出 世界坐标系下的 3D 点云 每视角深度图支持 50K–500K 像素的灵活分辨率推理 表面法线 相机位姿与内参✨ 3DGS 高斯泼溅属性中心、尺度、旋转、不透明度、球谐系数重建效果演示输入视频 → 点云 / 深度 / 法线 / 3DGS重建精度多组基准测试中的领先表现在 7-Scenes / NRGBD / DTU 三个数据集的点图重建测试中WorldMirror 2.0 配合全部先验相机位姿 内参 深度时DTU 的 Acc 达到0.554、Comp 达到0.771均优于 WorldMirror 1.0 与 Pow3R、MapAnything 等对比方法。一个实用技巧如果手头已有相机参数 JSON 或深度图目录可以通过先验注入进一步压低误差接口见 pipeline.py。快速上手指南环境安装与最小代码运行环境要求推荐CUDA 12.8 Python 3.11先建一个共享环境再按需叠加世界生成的额外依赖git clone https://gitcode.com/gh_mirrors/hy/HY-World-2.0 cd HY-World-2.0 conda create -n hyworld2 python3.11.15 conda activate hyworld2 pip install -r requirements.txt3行代码跑通世界重建模型权重会在首次运行时自动下载代码入口为 hyworld2/worldrecon/from hyworld2.worldrecon.pipeline import WorldMirrorPipeline pipeline WorldMirrorPipeline.from_pretrained(tencent/HY-World-2.0) result pipeline(path/to/images)更省事的方式是启动自带的 Gradio 网页 Demogradio_app.py上传照片或视频浏览器里直接查看 3DGS、点云、深度、法线与相机参数python -m hyworld2.worldrecon.gradio_app生成360°全景图from pipeline import HunyuanPanoPipeline # 工作目录hyworld2/panogen/ pipeline HunyuanPanoPipeline.from_pretrained(tencent/HY-World-2.0) output pipeline(input.png) output.save(output_panorama.png)跑通完整世界生成流水线世界生成对硬件要求更高建议 ≥4 张 GPU官方以 8×H20 测试且需要一台部署了 VLM 的 vLLM 服务用于轨迹规划。五阶段命令与数据目录结构完整收录在 hyworld2/worldgen/README.md训练完成后可用 show_gs.py 在浏览器中交互式查看成果项目结构速览与文档索引模块路径说明世界重建 WorldMirror 2.0hyworld2/worldrecon/前馈 3D 重建、Gradio Demo世界生成 WorldNav WorldStereohyworld2/worldgen/轨迹规划、世界扩展、3DGS 训练全景生成 HY-Pano 2.0hyworld2/panogen/两个生成后端示例输入数据examples/worldrecon/真实/风格化多视角样例详细文档DOCUMENTATION.md / DOCUMENTATION_zh.md参数参考、输出格式、先验注入总结3D世界生成、重建与模拟真的触手可及了一句话回顾 HY-World 2.0 的价值输入可以是文字、一张图或一段视频输出是持久、可编辑、可进引擎的真实 3D 世界。技术上它以 HY-Pano 2.0 打底、WorldNav 规划路线、WorldStereo 2.0 扩展世界、WorldMirror 2.0 完成重建与合成四者各司其职。项目已开源全部推理代码、模型权重与技术细节WorldMirror 2.0 约 1.2B 参数、WorldStereo 2.0 约 17B、HY-Pano-2 约 80B 参数无论你想把照片变成数字孪生还是从一句话造出一个可漫游的卡通小镇都值得一试。【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。