Hunyuan3D-2 图片生成 3D 资产完全指南:6 种入口与显存选型一次讲清
【免费下载链接】Hunyuan3D-2High-Resolution 3D Assets Generation with Large Scale Hunyuan3D Diffusion Models.项目地址: https://gitcode.com/GitHub_Trending/hu/Hunyuan3D-2
游戏美术同事发来一张产品概念图,问"下午能不能给我一个能直接进引擎的模型?"——这类"从一张图片到可交付 3D 资产"的需求,现在有一条完全开源的本地解法:腾讯混元开源的 Hunyuan3D-2 是一套大规模 3D 生成系统,输入单张图片就能产出带高清贴图的 3D 资产,也能给你现成的网格上色。仓库里同时给出了推理代码、预训练权重和技术报告,装完就能跑,不用依赖云端。
两级流水线:它生成 3D 资产的方式
可以把 Hunyuan3D-2 理解成一个两班倒的 3D 资产车间:第一班是形状工位,由流匹配扩散 Transformer(Hunyuan3D-DiT,1.1B 参数)根据单张图片生成网格;第二班是贴图工位,Hunyuan3D-Paint(1.3B 参数)用同一张图生成高分辨率贴图。拆成两级的实际好处是:贴图工位可以单独接"手搓网格",你自己的模型也能直接上色,不必先过一遍形状生成。官方给出的评测中,它在 CMMD、FID_CLIP、FID、CLIP-score 四项指标上均优于开源与部分闭源基线:
CMMD 3.193、FID_CLIP 49.165、FID 282.429、CLIP-score 0.809,四项均为榜单最优(见 README 的 Performance 表格)。
读完这节,你能一句话说清"这套系统能干什么、贴图可以脱离形状生成单独用"。
仓库怎么读不迷路
目录结构遵循"模型代码 + 示例 + 文档"的固定套路,四块各管一摊:
- hy3dgen/ 是核心库,diffusers 风格 API;内部拆成 shapegen(DiT 去噪器、体素解码器、表面提取)与 texgen(Paint 流程、自定义光栅化器、可微渲染器)两个子包
- examples/ 有 11 个即用脚本,文件名直接对应场景:
shape_gen.py单视角出形状、textured_shape_gen.py形状加贴图、带multiview的是多图输入、带mini的是低显存版本、fast_*走 FlashVDM 加速 - docs/source/ 是官方文档:安装说明、六种上手方式(code / gradio / api / blender / comfyui / studio)与 modelzoo
- assets/ 放示例素材:
example_images/是输入示例图,report/里有技术报告 PDF
命名规律是高度可预期的:看到multiview就知道要多视角输入,看到mini就是 0.6B 小模型。读完这节,你拿到仓库后想找任何功能都能在三十秒内定位到目录。
获取与首次跑通
克隆并安装只需要两行:
git clone https://gitcode.com/GitHub_Trending/hu/Hunyuan3D-2 cd Hunyuan3D-2 && pip install -r requirements.txt && pip install -e .有两个前提要注意:PyTorch 需要按官方指南单独安装;如果要走贴图流程,还需按 setup.py 编译 hy3dgen/texgen/ 下的custom_rasterizer和differentiable_renderer两个 C++ 扩展。装好后跑一遍 minimal_demo.py——它依次做去背景、形状生成、贴图生成,最后导出demo.glb,输入就是 assets 目录下的示例图。首次运行会自动下载模型权重,留足时间。读完这节,你手里有一份可运行环境,也知道装哪一步失败该翻哪个目录。
六种入口,按场景挑一个
| 使用场景 | 入口 | 怎么用 |
|---|---|---|
| 写脚本、嵌进自己的工具链 | hy3dgen Python API | from_pretrained加载,pipeline(image=...)调用,输出是 trimesh 对象,可直接存 glb/obj |
| 本机可视化、给同事演示 | gradio_app.py | 一条 python3 命令起本地网页,支持--low_vram_mode |
| 后端服务、批量出资产 | api_server.py | 起在 8080 端口后,POST/generate传 base64 图片,直接返回 glb |
| Blender 工作流里调用 | blender_addon.py | 依赖先启动 API server,在 Blender 内直接触发 |
| ComfyUI 节点流 | 社区插件 | 社区已提供 ComfyUI 接入,见 README 的 Community Resources |
| 不想自己部署 | Hunyuan3D Studio 官网 | 浏览器打开即用,不占本地显存 |
显存预算记两个数:仅形状生成 6GB,形状加贴图全流程约 16GB;官方支持 macOS、Windows、Linux。读完这节,你能按"谁来用、在什么设备上用"一分钟内选出对应入口。
模型怎么选:系列、显存与蒸馏版本 💡
| 系列 | 规格 | 适合谁 |
|---|---|---|
| Hunyuan3D-2 主系列 | DiT 1.1B + Paint 1.3B | 追质量,16GB+ 显存 |
| Hunyuan3D-2mini | 0.6B(含标准/Fast/Turbo) | 显存有限、快速预览 |
| Hunyuan3D-2mv 多视角 | 1.1B(含标准/Fast/Turbo) | 手头有前/左/后多张图,要更高保真 |
| Turbo / Fast 蒸馏版 | 同系列参数 | 步数蒸馏或引导蒸馏,推理耗时明显缩短,可叠加 FlashVDM 框架 |
| Hunyuan3D-2.1 | DiT 3.0B + Paint 1.3B | 2025-06 发布的新一代,质量上限更高 |
几个常见疑问在这张表里一并交代:6GB 显卡能不能跑?可以,但只够走形状生成,贴图全流程按 16GB 准备。只想要上色不想重新建模?Paint 模型接受"网格 + 图片"输入,独立于形状生成。多视角示例可直接看 assets/example_mv_images/ 下按编号组织的三视图素材。商业使用方面,仓库采用腾讯混元社区许可(非商业),具体条款看 LICENSE。读完这节,你能为自己的显存和输入条件锁定一个具体模型。
相比"只给推理脚本"的仓库,它多了什么
- diffusers 风格 API:熟悉
from_pretrained+pipeline调用范式的工程师,迁移成本接近于零 - 技术报告与引用格式齐全:assets/report/ 有完整 PDF 报告,docs/source/citation.md 给出 BibTeX
- 开源路线图透明:README 的 Open-Source Plan 列明推理代码、权重、ComfyUI 支持、微调代码均已开源,TensorRT 版本还在待办
- 社区生态成熟:ComfyUI 包装器、Windows 整合包等第三方扩展都收录在 README 的 Community Resources
- 回归测试素材现成:assets/example_images/ 有 60 余张示例图,本地环境装好后随手就能验证
读完这节,你能判断它适不适合放进论文复现、生产工作流或商业评估的候选清单。
今天就能做的最小起步
只给两个动作,按顺序做。第一,跑通 minimal_demo.py,确认从图片到demo.glb的完整链路在你机器上没有断点;这一步完成前,别急着调参数。第二,按上表的场景选入口:要演示就起 gradio_app.py,要集成就把 README Code Usage 里的几行 API 拷进自己的脚本。如果你的素材是多视角截图,直接打开 examples/ 里的shape_gen_multiview.py,配上assets/example_mv_images/的第一组三视图即可复现。
【免费下载链接】Hunyuan3D-2High-Resolution 3D Assets Generation with Large Scale Hunyuan3D Diffusion Models.项目地址: https://gitcode.com/GitHub_Trending/hu/Hunyuan3D-2
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考