Duix.Avatar数字人实战指南:一段短视频克隆你的外貌与声音,全本地离线生成视频
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
Duix.Avatar 是一个可以完全在本地离线运行的开源 AI 数字人工具包,只用一段几十秒的短视频就能做出一个外貌和声音都像你的数字人,再用文字或音频驱动它生成带口型的讲话视频。全程不需要联网,素材也不会上传到云端。
一、先看看能得到什么 🎯
| 项目 | 说明 |
|---|---|
| 核心功能 | 外貌+声音克隆;文字/语音驱动;生成带口型同步的数字人视频;文案支持中、英、日、韩等 8 种语言 |
| 硬件要求 | 必须配备 NVIDIA 显卡;推荐 i5-13400F + 32GB 内存 + RTX 4070;磁盘空闲 100GB 以上 |
| 上手耗时 | 首次部署约半小时;镜像下载约 70GB 流量,取决于网速 |
图:Duix.Avatar 数字人客户端主界面,上方是"创建视频"与"定制数字人"两个入口,下方为我的作品与我的数字模特列表
二、原理速览(人话版) 🔍
外貌克隆:face2face 如何逐帧"模仿"
视频合成服务 face2face 把你的参考视频当作"表情源":它逐帧分析视频里人脸的动作,让数字人照着做一遍。可以理解为皮影戏——参考视频是动作,模型是皮影,最后生成的视频里口型会与音频对齐。合成服务在本地监听 8383 端口。
声音克隆:两个容器配合"先听再学"
声音部分由两个容器协作完成:fun-asr(ASR,即把语音转成文字)先把上传视频里说的话转写出来;fish-speech-ziming 再从这段音频里学习你的音色,之后用你的声音朗读新文本。API 中topP、temperature默认固定为 0.7,普通用户无需改动。
部署架构:三个容器各管一摊
ASR、TTS、视频合成以独立 Docker 容器运行,都跑在 GPU 上,这也是本项目强依赖 NVIDIA 驱动的原因。素材与结果都写入本地目录(如 Windows 下的D:\duix_avatar_data),数据不出机器。
三、上手指南:数字人本地部署步骤 🚀
1. 准备:确认硬件与系统
支持 Windows 10(19042.1526 及以上)和 Ubuntu 22.04。Windows 下先检查并更新 WSL:
wsl --list --verbose wsl --update⚠️ 注意:没有 NVIDIA 显卡或驱动没装好,三个服务都启动不了。这是社区最高频的问题,动手前先执行nvidia-smi确认驱动正常。
图:C 盘空闲不足 100GB 时,在此界面将 Docker 镜像存储目录改到其他磁盘
2. 部署:docker-compose 启动服务
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d首次启动会拉取镜像与模型,约 70GB 流量、半小时左右。Docker 中看到三个容器 Running 即部署成功。若场景只需视频合成服务,可改用精简编排,只启动一个服务Duix.Avatar-gen-video:
docker-compose -f docker-compose-lite.yml up -d✅ 建议:镜像拉取慢或超时时,在 Docker Desktop 的 Docker Engine 里配置镜像源,配置示例见 doc/常见问题.md。
图:在 registry-mirrors 字段配置国内镜像源,加速数字人服务镜像拉取
3. 安装客户端
Windows:双击 release 页提供的安装包Duix.Avatar-x.x.x-setup.exe安装;Ubuntu 22.04:直接双击Duix.Avatar-x.x.x.AppImage运行,无需安装。
⚠️ 注意:定制模型的素材视频必须带人声说话,程序要从这段声音里做声音克隆,无声视频会失败。
4. 使用:训练模型并生成视频
先点"Create Avatar"上传视频训练模型,再到"Create Video"里选择模型,输入文字或上传音频开始合成。文案支持中、英、日、韩、法、德、阿、西 8 种语言。
⚠️ 注意:合成过程中别关闭客户端;出问题时通过设置菜单的 Open Log 导出日志排查。
图:在客户端设置菜单点击 Open Log 打开日志目录,便于定位部署与合成问题
四、谁适合用(场景速配) 🧩
| 用户类型 | 配置与用法建议 |
|---|---|
| 个人创作者 / 自媒体 | RTX 4070 + 32GB 内存的台式机;只做"音频驱动视频"时用 lite 版编排即可 |
| 教育 / 培训团队 | RTX 4090、32GB 以上内存、100GB+ 磁盘,批量产出讲解类视频 |
| 开发者 / 二次集成 | 直接调本地接口:语音合成http://127.0.0.1:18180/v1/invoke,视频合成http://127.0.0.1:8383/easy/submit |
五、进阶与资源:二次开发入口与调优建议 📚
- 二次开发入口:服务逻辑在 src/main/service/(模型训练、视频合成、声音),对外请求封装在 src/main/api/,容器编排在 deploy/(含
docker-compose-linux.yml与 50 系显卡用的docker-compose-5090.yml)。 - 合成进度可用
http://127.0.0.1:8383/easy/query?code=${taskCode}查询,参数为合成接口传入的code。 - 调优建议:视频仅用于线上发布时,先用 720P 出片验证,能明显省时省显存;50 系显卡请换用
docker-compose-5090.yml(官方预览版 PyTorch,30/40 系 + CUDA 12.8 也适用)。 - 官方文档:doc/常见问题.md;问题可在项目 Issues 区提交跟踪。
Duix.Avatar 把数字人制作门槛压到"一张 NVIDIA 显卡 + 一段短视频",且数据始终留在本地。随着模型与接口的持续迭代,虚拟授课、产品口播等场景有望从"棚内拍摄"变成"本地按需渲染"。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考