Duix.Avatar 数字人本地部署完整教程:10 秒视频克隆数字人,本地生成口播视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一款完全开源、可全离线运行的数字人(Digital Avatar,即你的虚拟分身)工具包:提供一段 10 秒左右的说话视频,它就能克隆你的形象和声音,再用文字或音频驱动,生成数字人口播视频。如果你要做培训、自媒体或营销类口播视频,又不想把素材交给云端服务,这个本地部署项目就是为你准备的。
它能干什么,又干不了什么
想象一个场景:你在做系列培训课程,需要一位固定的"出镜人"念稿。自己拍,错一个音就得重拍;用线上数字人服务,要付费,素材还得上传到云端。Duix.Avatar 把这件事搬到你自己的电脑上:拍一段 10 秒说话视频上传,系统学会你的长相和音色;之后每次制作,只要输入文案,数字人就会自动"念稿",口型同步。
但边界也要说清楚:它是"口播型"工具,数字人只会说话,不会走动、不会做肢体动作;而且必须有 NVIDIA 独立显卡,所有算力都在你本地跑,集显机器直接出局。
四步跑通本地数字人环境
动手前先确认三件事:NVIDIA 独显且驱动已装好、内存 32G(16G 是底线)、硬盘空闲 100G 以上(首次拉镜像约消耗 70G 流量,建议连 WiFi)。
第 1 步,获取代码:
git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai→ 成功标志:当前目录出现 HeyGem.ai 文件夹,里面有 src/、deploy/ 等子目录。
第 2 步,验证显卡驱动:
nvidia-smi→ 成功标志:能看到显卡型号和驱动版本。命令不可用时先装好 NVIDIA 驱动——没有驱动,后面三个核心服务根本起不来。
第 3 步,启动服务端。Windows 用户先在命令提示符执行wsl --install装好 WSL2(网络原因可能失败,多试几次),再安装 Docker Desktop,然后在 deploy/ 目录下执行:
cd deploy docker-compose up -d→ 成功标志:等待约半小时镜像下载完毕,Docker 容器列表出现 3 个服务且状态为 Running。低配机器可改用精简版docker-compose -f docker-compose-lite.yml up -d,只启动 1 个服务。
Ubuntu 22.04 用户装好 Docker 和 NVIDIA Container Toolkit 后(详见 README 说明),执行:
cd deploy docker-compose -f docker-compose-linux.yml up -d→ 成功标志:同样是 3 个服务 Running。点开容器的 Logs 标签页能看到启动日志,用这个页面随时确认服务端状态。
第 4 步,启动客户端。到项目 Releases 页下载官方构建的 Windows 安装包(.exe)或 Linux 版(AppImage),双击打开。
→ 成功标志:主界面出现"Create Video"和"Create Avatar"两个入口,可以开始创建数字人了。
原理扫盲:10 秒视频怎么变成数字人
把整个过程理解成"一张形象照 + 一份声音样本"。你上传的 10 秒视频会被拆成两部分:画面留给视频合成模型当"底",音轨则交给 ASR(自动语音识别,让机器听写音频内容)提取出参考文本;TTS(语音合成)服务从这段音频里学习你的音色,之后能把任意新文案念成你的声音;视频合成服务再根据新音频,逐帧驱动原视频里的人脸,让嘴型跟着新音频动。
拆开看是这几个能力点:
- 形象 + 声音双克隆:一段 10 秒视频得到一个可反复使用的数字人资产
- 文字或音频都能驱动:直接输文案,或导入自己的录音
- 口型同步:合成引擎按音频节奏驱动面部
- 8 种语言文案:中、英、日、韩、法、德、阿、西
- 全离线:素材和算力都不出内网
- 开放 API:模特训练、音频合成、视频合成各有 HTTP 接口
局限也坦白说:口播型模型,没有肢体动作;NVIDIA 显卡是硬性要求,没有就是跑不起来;首次下载镜像体量大、启动慢;项目迭代快,问题主要靠社区修,速度不如商业服务。
调优与避坑:配置对照表与高频问题
| 配置项 | 推荐值 | 作用 |
|---|---|---|
| NVIDIA 驱动 | 最新版,nvidia-smi可查 | 三个服务都依赖它,缺它起不来 |
| 硬盘空间 | ≥100G,Windows 的 D 盘 ≥30G | 镜像约 70G,还要存模型和作品 |
| 内存 | 32G(16G 下限) | ASR 服务启动时内存占用高 |
| 镜像源 | Docker 设置里配国内加速地址 | 官方源不稳定,拉取容易超时 |
| compose 文件 | 按场景选 | lite 版省资源;5090 版适配 RTX 50 系;linux 版给 Ubuntu |
Windows 上 Docker 镜像默认存在 C 盘,空间紧张的话,可以在 Docker Desktop 的 Resources 设置里把磁盘镜像位置改到其他盘。
⚠️ 三个高频问题:
docker-compose up -d报 Docker Hub 连接超时→ 官方源不稳定,在 Docker 设置里加上国内 registry 镜像源,重跑命令。- 新增模特时报错→ 你上传的视频必须有声音,且是人在说话,程序要靠这段音频做声音克隆,纯静音视频会失败。
- 服务端刚起就克隆形象,报 Connection refused→ ASR 服务启动慢还没加载完,等所有服务 Running 后等几分钟再操作;内存只有 16G 时,服务可能直接起不来。
错误定位不了就看服务端日志:打开对应容器的 Logs 标签页,搜索 ERROR 关键字。更多问题可翻 doc/常见问题.md。
进阶玩法:用 API 把数字人接进自己的系统
不想每次点界面、想批量生产,就看服务端暴露的本地端口。启动后它提供三组接口:模特训练、音频合成(18180 端口)、视频合成(8383 端口),都能通过http://127.0.0.1调用。写个脚本按"训练模特 → 合成音频 → 提交合成并轮询进度"的顺序跑,就能批量产出数字人视频,接口参数可直接参考 src/main/service/ 里的实现,它和客户端的调用逻辑一一对应。
💡 另一个组合:低配机器只起 lite 镜像负责视频合成,把吃资源的形象克隆放到另一台机器或 API 服务上做,还能避免单服务卡死拖垮整个部署。
本地数字人的价值,在于你的脸和素材始终不出自己的机器,克隆一次资产、之后按需产出。如果你准备动手,第一步就是先跑一下nvidia-smi,确认显卡驱动正常、硬盘留够 100G,再去拉镜像。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考