Duix.Avatar 本地部署:30 分钟免费跑通开源 AI 数字人克隆
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一款完全开源、完全离线的开源 AI 数字人工具包:上传一段 10 秒自拍视频即可克隆你的脸和声音,之后输入文本就能生成口型同步的口播视频。全程不联网、数据不出本机。这篇教程带你完成 Duix.Avatar 部署,从零到做出第一个数字分身,大约 30 分钟。
你的电脑能不能跑:硬件与环境自检
动手前先对照这张表自查,任何一项不达标都会卡住:
| 项目 | 要求 |
|---|---|
| 显卡 | NVIDIA 显卡且已装好驱动,推荐 RTX 4070 及以上 |
| 内存 | 32GB 及以上 |
| 磁盘(Windows) | C 盘 100GB+ 空闲(存镜像)、D 盘 30GB+ 空闲(存数据,可改盘) |
| 磁盘(Ubuntu) | 100GB+ 空闲 |
| 系统 | Windows 10 19042+ 或 Ubuntu 22.04 |
| 环境 | 已安装 Docker;如需从源码构建客户端,再准备 Node.js 18 |
在终端执行一条命令验证算力环境:
nvidia-smi能打印出显卡型号和驱动版本,说明 GPU 这一关过了。本项目所有算力都在本地 GPU 上,没有 N 卡或驱动没装好,服务端是起不来的。
⚠️ 如果 C 盘空闲不足 100GB:打开 Docker Desktop → Settings → Resources,把 Disk image location 改到一个剩余 100GB 以上的磁盘,点 Apply & restart 即可。
三步把服务端和客户端全部跑起来
服务端由三个容器组成:fun-asr 负责语音识别、fish-speech-ziming 负责语音合成、duix.avatar 负责视频合成。
步骤 1:拉取代码
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy步骤 2:启动服务端
docker-compose up -dUbuntu 用户把配置文件换一下再执行:
docker-compose -f docker-compose-linux.yml up -d首次运行会自动下载三个服务的镜像,约 70GB 流量,网络正常的话半小时左右完成。✅ 看到 Docker 容器列表里 duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video 三个服务全部处于 Running 状态,就说明服务端这步成了。
如果你只要视频合成能力,用精简版,只启动一个服务:
docker-compose -f docker-compose-lite.yml up -d步骤 3:安装客户端
到项目官方发布页下载客户端安装包。Windows 双击Duix.Avatar-x.x.x-setup.exe按向导安装;Ubuntu 下载 AppImage 直接双击运行。root 用户双击可能跑不起来,需在终端加参数执行:
./Duix.Avatar-x.x.x.AppImage --no-sandbox✅ 客户端打开、进入主界面,能看到 Create Avatar 入口,整条部署链路就跑通了。
从 10 秒自拍到口播成片:完整工作流
克隆你的数字分身
素材要求:正面镜头、光线充足、10~15 秒、人声清晰无杂音。系统会自动把视频拆成静音画面和音频,提取人脸特征,同时对音频做声音克隆训练。
✅ 成功的标志:My Avatars 列表里出现你的数字分身卡片,声音模型也一并训练好了,这个分身可以反复使用。
文本驱动生成口播视频
选中你的分身 → 输入口播文案 → 导出成片。脚本支持中、英、日、韩、法、德、阿拉伯、西班牙 8 种语言。系统先用你的克隆音色做语音合成,再驱动嘴部动作贴合音频节奏,自动完成音视频对齐。生成进度可在对应 Docker 服务的日志里看到,卡在哪一步一目了然:
进阶玩法:音频驱动与多模型切换
音频驱动:直接上传你录好的音频文件,系统按原声的节奏和语气驱动口型与表情,情绪完整保留,适合用同一素材批量产出系列视频。
多模型切换:训练多个分身后可以在列表里一键切换,无需重新训练,换个"模特"就能继续生成。
出问题先自查:常见报错对照表
| 现象 | 原因 | 解决 |
|---|---|---|
docker-compose up -d报连接超时 | Docker Hub 官方源连接不稳定 | 在 Docker Engine 配置里加 registry-mirrors 镜像源后重启 |
| 三个服务起不来或反复重启 | 没有 N 卡或驱动没装好 | nvidia-smi确认后按官方指引安装 NVIDIA 驱动 |
| 新增模特时报错 | 上传的视频没声音或没人说话,声音克隆拿不到素材 | 重录一段 10 秒、口齿清晰的人声视频再传 |
| 数据目录很快被占满 | 卷映射指向了小磁盘 | 打开 deploy/ 下的 docker-compose.yml,把d:/duix_avatar_data这类映射改到空间更大的盘 |
| 训练和合成速度慢 | GPU 被其他程序占用、机械硬盘瓶颈 | 关闭占用 GPU 的程序、保证内存空闲,数据目录放到 SSD 上 |
镜像源配置只需加一行 JSON:
{ "registry-mirrors": ["https://docker.m.daocloud.io"] }仍然定位不了?客户端点右上角 Settings → Open Log 查看客户端日志,再结合对应 Docker 服务的 Logs 面板对照排查,还可以关注项目仓库的 Issues 页。
许可与边界
项目采用 DUIX.COM Community License:免费、可商用;如果你的产品月活用户(MAU)超过 1000,需要与官方签署商业许可协议。
部署完成后不用等任何云端排期:现在就上传那段 10 秒的自拍视频,把第一个数字分身克隆到你自己的电脑上。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考