【2026实测】AI数字人本地部署零基础上手:10秒克隆你的形象和声音,完整跑通指南
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
还在把口播视频外包给别人做吗?一条上千块,脸还是别人的。Duix.Avatar 是一个开源的 AI 数字人 工具,用你自己 10 秒的视频就能克隆形象和声音,全程 本地部署 ,不联网,输一段文字就能产出会说话的视频。
跑起来:30分钟用 Docker 拉起数字人服务
推荐配置,一张表说清
| CPU | 内存 | 显卡 | 存储 |
|---|---|---|---|
| 13代 Intel i5-13400F 起 | 32GB(必要) | RTX 4070,仅支持英伟达 | 空闲 100GB 以上,Win 系统 C 盘 100G + D 盘 30G |
50 系新显卡有专门配置,进阶一节里有说法。
六步启动
- 动作:确认系统装过 WSL,并更新到最新版。 命令:
wsl --update预期:终端无报错。没装过 WSL 的,先按项目 README 里的说明安装。 - 动作:确认显卡和驱动就位。 命令:
nvidia-smi预期:屏幕显示显卡型号和驱动版本。 ⚠️ AMD 显卡直接出局,全部算力都跑在英伟达卡上,没装驱动一个服务都起不来。 - 动作:拿到项目代码。 命令:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar预期:当前目录出现 Duix-Avatar 文件夹。 - 动作:进入 deploy 目录,启动服务集群。 命令:
docker-compose up -d预期:开始拉 3 个镜像,总流量约 70GB,建议连 WiFi,大概半小时。Ubuntu 用户改用 deploy 目录里的 docker-compose-linux.yml 启动。 - 动作:确认容器活过来了。 命令:
docker ps预期:3 个服务 Running:duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video,端口 18180、10095、8383 全部映射成功。 - 动作:装客户端。 操作:下载官方发布的安装包,双击安装程序。 预期:能打开,首页出现"创建视频"和"创建形象"两个入口。
✅ 验证清单,开始创作前自查 4 项:
- 3 个容器都是 Running,没有 Restarting
- 浏览器访问 127.0.0.1:18180 有正常响应
- 8383 端口能通
- 客户端能进首页,不报连接错误
它怎么干活:10秒视频是怎么变成口播视频的
合成之前,系统先干一件铺垫的事:把你视频里说的话转写成文字。这一步是 ASR(自动语音识别,机器听你说话并转成文字)。不先搞清楚"这段音频里说了什么词",机器就没法学你的声音。
剩下两个核心环节:
- 声音克隆:从 10 秒音频里提取音色特征,给你建一份声纹。之后输入文字,TTS(文本转语音,用你克隆的声音把文字念出来)直接产出你的配音。 类比:像把旧收音机的声卡拆出来装进新收音机,你喂什么词,它都用你的嗓子唱。 关键数字:喂进去的样本只要 10 秒左右。
- 口型视频合成:画面背景、身体动作都保持原样,只有脸被重新驱动。 类比:像给一张定格照片做"对口型换脸",人不动,脸在动,嘴型跟着音频走。 关键数字:合成容器的共享内存配了 8G,显存小的卡最容易在这步被挤爆。
玩出花:接上 API 批量生成数字人视频
首页界面够个人用了,想批量生产就直接调接口。Docker 起来后服务暴露在本地 127.0.0.1,18180 管音频,8383 管视频。
- 场景:同一个数字人给 20 个人发周报,开场白各不一样。 参数:调 8383 的 /easy/submit,传 audio_url(音频路径)、video_url(静音视频)、code(唯一 key),外加三个固定值 chaofen=0、watermark_switch=0、pn=1;再用 /easy/query 带 code 轮询进度。 效果:绕开客户端,写个循环提交,批量出片不盯屏。
- 场景:同一段文字,想让配音更稳一点或语调更活一点。 参数:调 18180 的 /v1/invoke,temperature 和 topP 默认 0.7,max_new_tokens 1024,reference_audio 和 reference_text 填训练那一步的返回值。 效果:0.7 是稳态,调低更平稳,调高语调变化更多。
- 场景:内存吃紧,或者用的是 50 系新卡。 参数:deploy 目录改跑 docker-compose-lite.yml,只起 1 个 gen-video 容器;5090 用户换 docker-compose-5090.yml。 效果:lite 版不起 ASR 和 TTS,镜像更小,但没法克隆声音;5090 配置用的是 torch 官方预览版。
具体调用逻辑看仓库里的 src/main/service/voice.js 和 src/main/service/video.js,抄就行。
踩坑实录:我第一周栽过的 4 个真问题
拉镜像一直失败,满屏 request canceled 和 context canceled。 根因:Docker Hub 官方源在国内网络下不稳定。 修复:Docker 设置的 Docker Engine 里加一段镜像源配置(doc/常见问题.md 里有现成的 registry-mirrors),点 Apply & restart,再重新拉。
C 盘两天就被塞满。 根因:3 个镜像共 70GB,默认全躺在 C 盘。 修复:Docker 设置 → Resources → Advanced → Disk image location,换个空间足的盘,Apply & restart。
客户端新增模特报错,日志里是 file not exists。 根因:上传的模特视频必须带人说话的声音,程序要把音频拆出来做声音克隆,音频会写进容器约定的 d:/duix_avatar_data/voice/data 目录。没声音、或者这个目录压根不存在,都会翻车。 修复:重拍一段你说话清晰的片段,确认 D 盘的挂载目录存在。
服务刚起来就点克隆形象,报 Connection refused。 根因:ASR 服务启动偏慢,你连得太早,自然被拒。 修复:启动后等几分钟再操作,用 docker ps 确认 3 个服务都 Running。内存只有 16G 的话 ASR 可能根本起不来,加到 32G。
收尾
三个服务跑起来,形象克隆好,你手里就有了一个用自己脸和嗓子念稿的视频。接下来可以试试调 /v1/invoke 的 temperature,看看声音会不会更有起伏。再卡住的话,先翻 doc 目录下的常见问题,八成有人替你踩过。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考