Duix.Avatar 本地部署完整指南:离线数字人视频生成环境搭建教程
2026/9/11 10:59:08 网站建设 项目流程

Duix.Avatar 本地部署完整指南:离线数字人视频生成环境搭建教程

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

数字人视频制作里,很多团队卡在同一个问题上:商用工具按条收费,在线服务又要求素材上云。Duix.Avatar 是开源的离线数字人视频生成与克隆工具,整套推理跑在自己电脑的显卡上,素材和成片都不出内网。本文按"自检 → 部署 → 出片 → 排障"的顺序,完整演示 Duix.Avatar 本地部署流程,照着做完就能产出第一条口播视频。

跑通之后你会得到上面这样的桌面客户端:两个入口分别负责"克隆形象"和"创建视频",数字人与作品列表都保存在本机。

部署前自检:硬件与软件门槛清单

Duix.Avatar 的全部算力都在本地 NVIDIA 显卡上,独显缺失或驱动没装好时,服务端容器根本起不来。动手前先对照这两组条件。

硬件

  • 显卡:NVIDIA 独显并装好驱动(硬性条件),推荐配置参考 i5-13400F / 32GB 内存 / RTX 4070
  • 内存:32GB 及以上,16GB 可能拉不起全部服务
  • 磁盘:镜像与模型至少预留 100GB 空闲,另留 30GB 存放数字人与作品数据

软件

  • 系统:Windows 10 19042.1526 以上,或 Ubuntu 22.04 桌面版
  • Docker 与 Docker Compose
  • Node.js 18:仅从源码构建客户端时需要,直接用官方安装包可跳过

有个成本需要心里有数:首次启动要拉取约 70GB 镜像,耗时约半小时,建议用有线或稳定的 WiFi。

01 装好 Docker 与 NVIDIA 驱动

Windows 路线

wsl --update

WSL 是 Docker Desktop 的底层依赖,先把它更新到最新。随后从 Docker 官网下载 Docker Desktop 安装,首次启动接受协议、跳过登录即可。

Windows 上 Docker 默认把镜像存在 C 盘,而本项目要求镜像存放位置有 100GB 以上空闲。C 盘不够时,打开 Docker 设置 → Resources → Advanced,把 Disk image location 指到空间充足的磁盘,再重启 Docker:

Ubuntu 22.04 路线

docker --version

能输出版本号说明 Docker 已就绪,可跳过安装;否则执行sudo apt install docker.io docker-compose。显卡驱动从 NVIDIA 官网安装后,用这条命令验收:

nvidia-smi

显示显卡型号与驱动版本即通过。之后按 NVIDIA 官方文档装好 Container Toolkit,执行nvidia-ctk runtime configure --runtime=docker并重启 Docker,容器才能真正调用到 GPU。

02 一条命令启动服务端,三个容器 Running 即就绪

先获取代码:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar

进入 deploy 目录拉起服务,compose 配置(deploy/ 目录内按平台区分)会自动拉取 fun-asr、fish-speech 和 duix.avatar 三个镜像:

cd deploy docker-compose up -d

下载完成后,Docker 中出现 3 个服务且状态均为 Running,服务端就算就绪:语音识别、语音合成、视频合成各占一个容器。磁盘或流量吃紧时可改用轻量版docker-compose -f docker-compose-lite.yml up -d,它只启动视频合成服务,但无法完成声音克隆。

03 打开客户端:从克隆形象到生成第一条口播视频

客户端无需编译,直接取官方构建包:Windows 双击 setup.exe 安装,Ubuntu 双击 AppImage 运行;若以 root 用户进入桌面后双击无效,在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox启动即可。

出片流程分两步:

  1. 克隆形象:上传一段 10 秒左右、真人说话的清晰视频。程序会把画面与声音分离,分别完成外貌建模和声音克隆。视频必须包含说话声,静音素材无法用于声音克隆。
  2. 生成视频:在"创建视频"中填入文案(支持中、英、日、韩等 8 种语言)或直接上传音频,数字人按内容驱动口型,输出与声音同步的口播视频。

镜像拉取超时、克隆失败时从哪里查起

出问题时多半是环境没到位,按这个顺序自查:

  • 三个服务是否都是 Running?只要有一个起不来,先执行nvidia-smi确认显卡与驱动正常——缺少 NVIDIA 环境容器必然失败。
  • docker-compose up -d报 connection canceled / context canceled:Docker Hub 直连不稳定,在 Docker Engine 配置里加入镜像加速器(或开启全局代理),改完重启 Docker 重新拉取。

  • 克隆时报 Connection refused 或 file not exists:ASR 容器冷启动较慢,服务端刚拉起时等几分钟再操作;内存低于 16GB 时该服务可能长期无法启动。
  • 项目更新频繁:服务端在 deploy 目录重跑docker-compose up -d、客户端换成新的构建包,不少报错在新版中已修复。

需要日志时:客户端点右上角 Setting → Open Log 打开本地日志;服务端在 Docker 对应容器的 Logs 页复制报错段落,再对照 常见问题文档 比对。

进阶:轻量版部署、50 系显卡与开放 API 调用

  • 显存或磁盘紧张:使用轻量版 compose(上文已给出命令),只保留视频合成服务。
  • NVIDIA 50 系显卡(5090 已验证,30/40 系搭配 CUDA 12.8 也可):改用预览版 PyTorch 的部署文件:
docker-compose -f docker-compose-5090.yml up -d
  • 想批量出片或接入自有系统:Docker 启动后,模型训练、音频合成、视频合成都会暴露在本机http://127.0.0.1的端口上,可脚本化调用;接口与请求参数可参考 src/main/service/ 下的 model.js、video.js、voice.js。

至此,克隆、合成、出片整条链路都运行在本机。后续保持服务端重拉镜像、客户端更换构建包,即可跟随项目更新同步能力。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询