HY-World 2.0 快速开始完整指南:10分钟搭建环境,从文字/图片到可探索3D世界

发布时间:2026/10/2 16:23:43

HY-World 2.0 快速开始完整指南:10分钟搭建环境,从文字/图片到可探索3D世界 HY-World 2.0 快速开始完整指南10分钟搭建环境从文字/图片到可探索3D世界【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0HY-World 2.0是一个开源的多模态 3D 世界模型World Model框架输入一句文字或一张图片就能生成可自由漫游的真实 3D 世界3DGS / 网格输入多视角图片或一段视频即可瞬间完成 3D 重建。本指南带你 10 分钟完成环境搭建跑通第一次 3D 世界重建并了解「文字/图片 → 可探索 3D 世界」的完整生成流程。一、2分钟认识 HY-World 2.0输出真 3D 资产的世界模型HY-World 2.0 提供两大核心能力能力输入输出世界生成World Generation文字 / 单张图片360° 全景 → 可导航 3D 世界3DGS / 网格世界重建World Reconstruction多视角图片 / 视频深度图、法线、点云、相机参数、3DGS与生成像素视频的世界模型不同HY-World 2.0 产出的是可编辑、可持久化的真实 3D 资产消费级 GPU 即可实时渲染漫游并能直接导入 Blender / Unity / Unreal Engine。下图展示了这套 3D 世界模型的生成与重建效果整个系统是一条流水线全景生成HY-Pano 2.0→ 轨迹规划WorldNav→ 世界扩展WorldStereo 2.0→ 世界组合WorldMirror 2.0 3DGS 学习最终把文字或单张图像自动转化为高保真、可漫游的 3D 世界。二、10分钟环境搭建CUDA 12.8 Python 3.11 安装步骤环境要求一览项目建议配置GPUNVIDIA 显卡CUDA 12.8重建单卡可跑生成推荐 ≥4 卡系统Linux推荐Python3.11conda 环境python3.11.15磁盘模型权重首次运行自动下载WorldStereo 2.0 约 17B 参数建议预留充足空间 无需手动下载任何模型权重首次运行会自动拉取这也是10 分钟起步的关键。步骤 1克隆仓库并创建 conda 环境git clone https://gitcode.com/gh_mirrors/hy/HY-World-2.0 cd HY-World-2.0 conda create -n hyworld2 python3.11.15 conda activate hyworld2步骤 2安装 worldrecon 基础依赖WorldMirror 2.0这一步完成后环境即可运行世界重建模块# 基础依赖worldrecon 与 worldgen 共用 pip install -r requirements.txt # 推荐安装一次自定义 gsplat 渲染后端重建与生成共用 cd hyworld2/worldgen/third_party/gsplat_maskgaussian pip install -e . --no-build-isolation cd ../../../../步骤 3安装 FlashAttention二选一后端之一即可# 简单方案FlashAttention-2 pip install flash-attn --no-build-isolation如果你用的是 Hopper 架构 GPU如 H100/H20推荐从源码编译安装 FlashAttention-3具体步骤见 README.md 的 Install 章节。步骤 4可选世界生成的额外依赖只有需要跑文字/图片 → 3D 世界的生成流程时才需要执行# git 依赖需先装好 torch/CUDA pip install --no-build-isolation -r requirements_git.txt # recastnavigation 通过 git submodule 管理用于轨迹规划 git submodule update --init --recursive # Recast navmesh 扩展 cd hyworld2/worldgen/third_party/navmesh pip install . --no-build-isolation cd ../../../../此外世界生成还需要一个部署好的 vLLM 视觉语言模型服务如 Qwen3-VL-8B供轨迹规划阶段调用完整示例见 hyworld2/worldgen/README.md。步骤 5可选全景生成 HY-Pano 2.0全景模块有独立的安装方式与两套推理后端请参照 hyworld2/panogen/README.md 完成安装。三、第一次运行WorldMirror 2.0 多视角 3D 重建最简单的 Gradio Web 演示一条命令python -m hyworld2.worldrecon.gradio_app浏览器打开后上传图片或视频即可直接可视化 3DGS、点云、深度图、法线图和相机参数——零代码上手世界重建。完整参数端口、本地检查点等见 hyworld2/worldrecon/gradio_app.py。命令行与 Python API# 单卡推理 python -m hyworld2.worldrecon.pipeline --input_path path/to/imagesfrom hyworld2.worldrecon.pipeline import WorldMirrorPipeline pipeline WorldMirrorPipeline.from_pretrained(tencent/HY-World-2.0) result pipeline(path/to/images)输入就是一个多视角图片目录或一段视频。仓库自带示例场景可直接试用如 examples/worldrecon/realistic/Flower/image_0001.jpg⚠️ 多卡模式下输入图片数量必须≥ GPU 数量如 8 卡至少提供 8 张图。输出产物点云、深度、3DGS 与相机参数单次前向推理即可同时得到默认输出至inference_outputgaussians.ply— 3D 高斯泼溅可直接导入引擎渲染points.ply— 彩色点云camera_params.json— 相机外参与内参逐视角深度图 / 法线图PNG 可视化 原始数值视频 → 3D 数字孪生的重建效果如下四、世界生成从文字/图片到可探索 3D 世界的五阶段流水线这是 HY-World 2.0 的高光环节先由HY-Pano 2.0把文字或单图扩展为 360° 全景再经五个阶段变成可漫游的世界。全景生成HY-Pano 2.0提供diffusers风格的 Python API几行代码即可生成全景图输入可以是文本或图片from pipeline import HunyuanPanoPipeline pipeline HunyuanPanoPipeline.from_pretrained(tencent/HY-World-2.0) output pipeline(input.png) output.save(output_panorama.png)生成结果即 360° 等距柱状投影全景图仓库示例场景 examples/worldgen/case000/panorama.png 就是一个典型输入五阶段流水线从轨迹规划到 3DGS 训练全景就绪后世界生成流程按顺序执行各阶段共用同一--target_path场景目录中间结果逐步落盘便于排查阶段脚本作用1. 轨迹规划traj_generate.pyVLM 引导的相机轨迹规划障碍物感知导航2. 轨迹渲染traj_render.py沿规划轨迹做多卡点云渲染3. 世界扩展video_gen.pyWorldStereo 2.0 生成记忆一致性关键帧4. GS 数据准备gen_gs_data.py提取帧、对齐深度、法线与相机参数5. 3DGS 训练world_gs_trainer.py优化并导出最终 3DGS 世界支持网格导出完整命令模板含多卡torchrun与 FSDP 参数见 hyworld2/worldgen/README.md。⚠️ 世界生成建议 ≥4 GPU官方在 8×H20 上验证GPU 更少时请等比增大训练步数README 中已给出 1/2/4 卡对应的步数建议。探索世界交互式查看器与网格导出训练完成后一条命令启动基于浏览器的交互式 3DGS 查看器python show_gs.py --port 8081 --gpu_id 0 --ckpt $RESULT_DIR/ckpts/ckpt_1499_rank*.pt训练出的 3D 世界支持第一人称物理漫游效果如下世界同样可以导出为网格mesh方便导入 Blender 等工具二次创作以下画面均为真实 3D 资产而非生成视频截取自实时交互渲染五、环境搭建常见问题 FAQQ1重建和生成各需要多大算力WorldMirror 2.0 约 1.2B 参数单卡即可推理多卡 FSDP 可进一步加速WorldStereo 2.0 约 17B 参数世界生成全流程推荐 ≥4 卡。Q2多卡重建为什么报错检查输入图片数量是否 ≥ GPU 数量这是多卡模式的硬性要求。Q3模型权重要手动下载吗不需要。WorldMirror 2.0、HY-Pano 2.0、WorldStereo 2.0 的权重均支持首次运行自动下载。Q4想深入查看参数、输出格式与先验注入完整 API / CLI 参数参考含相机与深度先验注入、Gradio 参数见 DOCUMENTATION.md。六、文档与代码索引资料路径项目总览与安装指南README.md详细文档API / CLI / 输出格式DOCUMENTATION.md世界重建模块源码hyworld2/worldrecon/世界重建推理入口hyworld2/worldrecon/pipeline.py世界生成模块五阶段脚本hyworld2/worldgen/全景生成模块hyworld2/panogen/重建示例场景examples/worldrecon/世界生成示例场景examples/worldgen/按上面的步骤走一遍你已经在本地跑通了从几张照片 → 3D 世界重建并掌握了一句文字 → 可探索 3D 世界的完整路径。Happy World Building! 【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/2 16:23:43

Qwen3.6-27B 量化版来了:NVFP4/FP8 在 vLLM 上的部署与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/10/2 16:23:43

OpenShell:从Shell配置到终端效率跃升的完整指南

1. 项目概述与核心定位1.1 从一次终端体验谈起你有没有过这样的瞬间:盯着黑底白字的终端,敲完一长串grep -rn "some_config" ./src --include"*.py",按下回车前突然忘了某个参数写法,或者刚从历史记录里翻到一…

2026/10/2 21:59:01

Dockerfile实战指南:从镜像分层到多阶段构建

1. 把Dockerfile当成镜像的“配方”之前,先理解一条核心规则:一行指令 一层镜像 很多朋友第一次写Dockerfile,最容易产生的误解是:这玩意儿就是一份“安装脚本”,无非是从上到下把命令跑一遍。真正上手之后你会发现&a…

2026/10/2 21:59:01

自建GhostTrack:一站式网络信息追踪与资产监控部署实战

前段时间我捣鼓了一个叫 GhostTrack 的开源网络信息查询工具,顺手把它部署到了一台服务器上。折腾完之后的整体感受是:这类自部署工具,比直接用在线网页端要爽太多了。网格信息收集不再是一个一个页面手工切换,也不再担心查询记录…

2026/10/2 21:59:01

评论盖楼系统的MySQL索引设计:从递归到联合索引

“你这套系统,评论和回复存一张表,然后递归查子评论,对吧?”面试官边问边在纸上画了一棵树,“那几百万条评论,你都递归查?”我挠了挠头,补了一句“还在内存里拼树”,他笑…

2026/10/2 21:59:01

SQL Server 2000在Windows 10上的安装实战:注册表伪装与兼容性设置

折腾SQL Server 2000这种事,放在2024年的语境下确实有点黑色幽默——这产品发布的时候,很多读者可能还没出生。但现实就是这么魔性:老企业的核心业务系统还在跑SQL2000,数据库服务器硬盘一挂,新采购的机器清一色Window…

2026/10/2 8:16:46

东莞市品牌网站建设报价常见报错与解决

东莞品牌网站建设报价单背后:一份保姆级建站教程避坑实录 网站做好了没人访问,这大概是很多老板最头疼的事。花了大几万做的品牌站,上线后流量惨淡,比路边摊还冷清。别急着骂外包公司,很多“东莞品牌网站建设报价”里藏着不少猫腻,比如用模板站冒充定制…

2026/10/2 18:20:53

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/10/1 10:48:55

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/10/2 0:02:57

PWN入门:从栈溢出原理到ROP链实战

1. 这不是“学PWN”,是重新理解你每天敲的每一行C代码我第一次在CTF赛场上写出能控制程序流的exp时,手抖得连gdb的c命令都输错三次。那道题只有23行C代码,一个gets()调用,一个printf(),一个return——它甚至没开NX&…

2026/10/2 0:02:57

Windows下cudaMallocHost显存占用之谜:WDDM与TCC模式差异及优化方案

1. 一个反直觉的显存占用现象第一次在 Windows 上看到cudaMallocHost把显存吃掉的时候,我的反应是打开任务管理器反复确认了三遍。明明调用的是主机端锁页内存分配,按 CUDA 文档的说法,这块内存应该落在系统 RAM 里,跟 GPU 的显存…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑