Duix.Avatar 数字人本地部署教程:三步生成口播视频
2026/9/11 16:50:04 网站建设 项目流程

Duix.Avatar 数字人本地部署教程:三步生成口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一个开源数字人工具包:你只需要一段 10 秒左右的说话视频,它就能在本地完成形象和声音克隆,之后输入文字或上传音频,即可驱动这个数字人产出口播视频。本文按"环境自查 → 部署 → 出片"的顺序,走通它的本地部署全流程。

它能做什么

  • 全离线:训练、合成全部跑在你自己的显卡上,素材不出本机
  • 外貌 + 声音一次克隆:约 10 秒视频同时产出人物模型和声音模型
  • 文字/音频双驱动:文字会先转成语音再驱动口型,也可以直接用现成音频
  • 脚本支持 8 种语言:中、英、日、韩、法、德、阿、西

前置条件自查:动手前 6 项

项目要求说明
系统Windows 10 19042.1526+(需 WSL)或 Ubuntu 22.04 DesktopWSL 是 Windows 自带的 Linux 子系统,Windows 版 Docker 依赖它
显卡NVIDIA 显卡 + 驱动已装好nvidia-smi能列出显卡;没有它三个服务起不来
内存32GB 及以上16GB 偏紧,ASR 服务可能启动失败
CPU13 代 i5-13400F 或同级官方推荐配置
磁盘Windows:C 盘 100GB+(镜像)且 D 盘 30GB+(数据);Ubuntu:空闲 100GB+镜像和数据默认分开存放
网络稳定连接首次拉取镜像约 70GB,建议 Wi-Fi

部署:从零到服务跑通的 4 步

第 1 步:安装 WSL 与 Docker

Windows 上:

  • wsl --list --verbose查看 WSL 是否已装,没有就执行wsl --install,再执行wsl --update更新
  • 安装 Docker Desktop(按 CPU 架构选安装包),首次运行接受协议、跳过登录

Ubuntu 上(已装 Docker 的跳过):

sudo apt update sudo apt install docker.io docker-compose

另外 Ubuntu 还需要装好 NVIDIA 驱动(nvidia-smi验证),并安装 NVIDIA Container Toolkit、用sudo nvidia-ctk runtime configure --runtime=docker配置运行时后重启 Docker,这一步照着 NVIDIA 官方文档走即可。

⚠️ 注意:wsl --update更新后可能需要重启电脑,先保存手头工作。

判断成功:docker --version能输出版本号。

第 2 步:获取项目代码

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

服务端配置在 deploy/ 目录下,Windows、Ubuntu、lite 精简版、5090 版各有一份 compose 文件。如果你打算自己从源码构建客户端才需要 Node.js 18;直接装官方构建的安装包可以不管它。

第 3 步:用 docker-compose 启动三个服务

cd deploy docker-compose up -d

这条命令会拉取并启动三个容器(docker-compose 是"一条命令编排多个容器"的工具):

  • duix-avatar-asr:语音识别服务,端口 10095
  • duix-avatar-tts:语音合成服务,端口 18180
  • duix-avatar-gen-video:视频合成服务,端口 8383

首次拉镜像约 70GB,预计 Wi-Fi 下半小时左右。按情况换文件即可:显存/内存紧张用docker-compose -f docker-compose-lite.yml up -d(只起视频合成一个服务);Ubuntu 用docker-compose -f docker-compose-linux.yml up -d;50 系显卡或 CUDA 12.8 的 30/40 系显卡用docker-compose -f docker-compose-5090.yml up -d

判断成功:docker ps显示三个服务都是 Running。下载期间别关终端,也没必要守着,该干嘛干嘛去。

第 4 步:安装客户端

到项目 Releases 页面下载官方构建的安装包:

  • Windows:双击Duix.Avatar-x.x.x-setup.exe安装
  • Ubuntu:双击Duix.Avatar-x.x.x.AppImage直接启动,免安装;若以 root 用户登录桌面双击打不开,在终端加--no-sandbox参数启动

判断成功:客户端能打开,首页出现 Create Video / Create Avatar 两个入口。

验证首个结果:先看服务,再出第一条视频

docker ps应看到三个服务全部 Running(lite 版只有 gen-video 一个):

docker ps # NAME STATUS PORTS # duix-avatar-asr Running 10095:10095/tcp # duix-avatar-tts Running 18180:8080/tcp # duix-avatar-gen-video Running 8383:8383/tcp

然后打开客户端走一遍最小流程:

  1. 点 "Create Avatar",上传一段 10 秒左右、人在说话的正面视频,等模型训练完成
  2. 点 "Create Video",输入一段文字,数字人就会用克隆的声音说出这段话

补充一句:创建模型用的视频必须带人声——程序要用这段声音做声音克隆,只传无声画面会直接报错。

调优:最值得动的 3 个配置点

移动数据存储位置

Windows 的 compose 默认把模型和视频数据挂在d:/duix_avatar_data(Ubuntu 是~/duix_avatar_data),默认值对大多数人不用动。如果 C 盘空闲不足 100GB,把 Docker 的磁盘镜像位置换到空间更大的盘:Docker Desktop 右上角齿轮 → Settings → Resources → Advanced → Disk image location,选一个剩余 100GB+ 的目录,Apply & restart。

资源紧张就退到 lite 版

默认三服务(ASR + TTS + 视频合成)内存开销大。如果你的目标是"拿现成的音频 + 视频合成口播视频",或机器内存只有 16GB 左右,直接用 lite 版 compose,只保留视频合成服务,资源占用小很多。

50 系显卡用专用 compose

50 系显卡(5090 实测)以及 CUDA 12.8 的 30/40 系显卡,要用docker-compose-5090.yml这份基于 torch 预览版的配置。💡 这两类卡遇到 GPU 相关报错时,先换这份文件重启再排查其他问题。

两个能直接上手的场景

场景一:企业代言人口播视频

  • 素材:代言人正面讲话视频 10–15 秒,收音干净、背景无噪音
  • 设置:先克隆模型,再用文字模式贴入宣传文案
  • 产出:形象与声音都属本人的口播视频,换文案可反复生成

场景二:一门课多语言版本

  • 素材:讲师正面视频一次,声音模型一份
  • 设置:脚本支持 8 种语言,按目标语言分别生成
  • 产出:同一节课的中、英、日等多语言口播视频

快速排错:4 个高频问题

1.docker-compose up -d报 request canceled / Client.Timeout→ 最可能原因:Docker Hub 官方源连接不稳定。 → 一步修复:在 Docker Engine 的 daemon.json 里加registry-mirrors国内镜像源,Apply & restart 后重跑。

2. 三个容器始终不是 Running→ 最可能原因:没有 NVIDIA 显卡或驱动没装好——本项目全部算力在本地 GPU。 → 一步修复:跑nvidia-smi确认能列出显卡,装好驱动后再重启容器。

3. 新增模特报错 / 日志里刷 "file not exists"→ 最可能原因:上传的视频没有声音,或声音不是人说话。 → 一步修复:重新上传一段人在清晰讲话的视频。

4. 定制模特报 Connection refused→ 最可能原因:ASR 服务启动较慢,服务端刚起就来克隆;内存过小(16GB)也可能起不来。 → 一步修复:服务端启动后等几分钟再操作,内存不够就先升级。

📌 排查时先取日志:客户端右上角设置里点 "Open Log" 找到main.log;服务端点开对应 Docker 服务的 Logs 标签页复制报错段落,再对照 常见问题 搜。

写在最后

到这里,数字人本地部署已经闭环:三个服务跑起来,客户端上传 10 秒视频训出模型,文字进、口播视频出,全程离线。更多端口与接口细节可看 README_zh.md 和 常见问题。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询