10秒视频克隆数字人:Duix.Avatar 免费本地 AI 数字人克隆完整指南
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
做口播视频要布景、打光、录制、再剪辑,文案一改就得重来。Duix.Avatar 解决的就是这个问题。它是一款完全免费开源的 AI 数字人克隆工具,用一段 10 秒的视频就能克隆出你的形象和声音。之后你只需输入文案,或上传一段音频,就能生成一条口型对齐的口播视频。
整个过程都在你自己的电脑上离线运行。视频素材和声音数据不会离开这台机器。代码完全开放,你可以自由修改、扩展,也可以参与社区共建。硬件要求是一张 NVIDIA 显卡加 32GB 内存,部署和首次上手大约 30 分钟。
它适合内容创作者、教师、企业市场团队,也适合想折腾数字人的个人用户。下文按"自检 → 部署 → 生成 → 排错"的顺序写,你可以直接跟着做。
先自检:你电脑要满足的 4 项硬件条件
这 4 项里缺任何一项,都别急着部署,三个核心服务起不来。
- 显卡:必须是 NVIDIA 显卡,30、40、50 系列都可以,驱动要装好。这个项目的算力全在本地,没有 N 卡服务直接跑不了。
- 内存:官方推荐 32GB 起步,参考配置是 i5-13400F 加 RTX 4070。
- 硬盘:服务镜像要 100GB 以上空间,数据目录再留 30GB 存放数字人文件。
- 系统:Windows 10(19042.1526 及以上)或 Ubuntu 22.04。
磁盘空间不够时改镜像位置
C 盘空闲不足 100GB 不必重装系统。装完 Docker 后,在 Settings → Resources → Advanced 里点 Browse,把磁盘镜像位置挪到空间够的盘。
部署前先验证显卡驱动
终端输入nvidia-smi,能看到显卡型号和驱动版本就没问题。命令报错或找不到,先装驱动。驱动没装好是"服务起不来"的头号原因。
30 分钟完成部署:3 个 Docker 服务加 1 个客户端
服务端是 3 个 Docker 镜像,客户端是 1 个安装包,全程约 30 分钟,一半时间在下载镜像。
先装 Docker
- Ubuntu:终端执行
docker --version,有版本号就跳过。没有的话按顺序装 3 个包,命令见下方代码块。 - Windows:用
wsl --list --verbose检查 WSL,用wsl --update更新,再装 Docker Desktop,首次启动接受协议。
sudo apt update sudo apt install docker.io sudo apt install docker-compose一条命令拉起 3 个服务
三个服务分工明确。一个做语音识别(ASR,基于 fun-asr),一个做语音合成(TTS,基于 fish-speech),一个做视频合成,也就是数字人视频生成引擎。后面讲 API 时,这三块能力会原样开放出来。
- 克隆仓库(地址
https://gitcode.com/GitHub_Trending/he/Duix-Avatar),找到 部署配置 所在的deploy目录。 - 在该目录执行
docker-compose up -d。下载约 70GB,建议连 WiFi,耐心等约 30 分钟。 - Docker 里看到 3 个服务运行中即成功。精简版换
docker-compose-lite.yml,只有 1 个视频生成服务。
安装客户端
- Windows:下载官方构建的安装包,双击
Duix.Avatar-x.x.x-setup.exe安装。 - Ubuntu:AppImage 直接双击运行。root 用户下打不开时,在终端加
--no-sandbox参数启动。
10 秒视频的克隆流程:建数字人并生成第一条口播视频
两步完成:先上传 10 秒视频克隆形象和声音,再输入文案生成口播视频。
上传 10 秒视频,同时克隆形象和声音
- 素材要求:人脸清晰、说话声音清楚,10 到 20 秒最合适,太短提取不到足够特征。
- 在主界面点"Create Avatar"上传后,系统自动提取面部特征和声音特征,耗时几分钟,取决于显卡。
- 训练完成后,模型出现在"My Avatars"列表里。
输入文案或上传音频,生成口播视频
- 选中数字人模型,输入文案或上传音频文件,点生成即可。
- 文案支持 8 种语言:中、英、日、韩、法、德、阿拉伯、西班牙。客户端界面本身也可以切换语言。
- 几分钟后口播视频出现在"My Works"里,口型自动对齐。
排查 4 类高频问题:从镜像到进度卡住
你遇到的问题大概率是这 4 类,FAQ 里都有对应解法。
问题一:服务起不来,查驱动和端口
- 用
nvidia-smi确认显卡被识别,三个服务都依赖 N 卡。 - 确认 8383、18180 端口没被其他程序占用,被占就关掉占用程序或改端口映射。
- 确认服务端和客户端都是最新版本。社区更新频繁,你的问题可能已经被修掉。
问题二:镜像拉取失败,配置镜像源
部署阶段最常见的失败是 Docker Hub 连接不稳定,镜像下载中断。解决办法是在 Docker 设置里加镜像源:打开 Docker Engine 配置,在registry-mirrors字段填入可用的镜像地址,然后应用并重启。
问题三:生成进度卡住,先看 tts 日志
进度卡在 20% 通常是音频处理环节出问题。在 Docker 里打开 3 个容器的日志,重点看语音合成(tts)服务。最高频的报错是File not exists,指向音频文件路径问题。一般重启该服务,或检查音频文件的路径和权限就能恢复。
客户端侧的日志也不难找:客户端右上角设置菜单里有"Open Log",或者直接在 logs 目录里找main.log文件。
图形界面之外:3 个本地 API 与批量生成
当界面点不过来时,3 个本地 API 就是答案,全部通过 127.0.0.1 访问。
- 模型训练 API:上传 10 秒视频,拆出无声视频和音频,返回后续合成要用的参考参数。
- 音频合成 API:监听 18180 端口,传入文案和训练返回的参考音频,输出数字人语音。
- 视频合成 API:监听 8383 端口,传入音频与视频路径提交任务,再按任务码查询进度。
具体请求参数写在 API 实现代码 里。model.js、video.js、voice.js 三个文件分别对应一项能力,照着写请求就行。
批量生成:把 API 排进队列
一次要出几十条口播视频时,别逐条点界面。写个脚本循环调用这 3 个 API:先克隆模型,再逐条合成语音,最后提交视频任务。系统会自动管理任务队列,这就是本地数字人视频生成的批量做法。
这类工具最适合谁用
四类人,按使用频率排序。
- 内容创作者:不露脸也能产出口播视频,保住更新频率。8 种语言支持让你用同一份文案出多语言版本。
- 教育:做数字人讲师,把讲义转成课程视频,形象统一,重复课程不用反复出镜。
- 企业:品牌代言、产品介绍、客服口播,数字人 7x24 小时在岗。
- 个人用户:纪念视频、祝福视频,门槛就是一条 10 秒的录像。
想动手的话,克隆仓库https://gitcode.com/GitHub_Trending/he/Duix-Avatar,照部署章节一步步做,或直接下载客户端安装包。遇到问题先查项目里的 FAQ 文档,还卡住就去项目 Issues 区提问,社区更新很快。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考