【2026实测】AI数字人本地部署零基础上手:10秒克隆你的形象和声音,完整跑通指南
2026/9/11 15:38:35 网站建设 项目流程

【2026实测】AI数字人本地部署零基础上手:10秒克隆你的形象和声音,完整跑通指南

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

还在把口播视频外包给别人做吗?一条上千块,脸还是别人的。Duix.Avatar 是一个开源的 AI 数字人 工具,用你自己 10 秒的视频就能克隆形象和声音,全程 本地部署 ,不联网,输一段文字就能产出会说话的视频。

跑起来:30分钟用 Docker 拉起数字人服务

推荐配置,一张表说清

CPU内存显卡存储
13代 Intel i5-13400F 起32GB(必要)RTX 4070,仅支持英伟达空闲 100GB 以上,Win 系统 C 盘 100G + D 盘 30G

50 系新显卡有专门配置,进阶一节里有说法。

六步启动

  1. 动作:确认系统装过 WSL,并更新到最新版。 命令:wsl --update预期:终端无报错。没装过 WSL 的,先按项目 README 里的说明安装。
  2. 动作:确认显卡和驱动就位。 命令:nvidia-smi预期:屏幕显示显卡型号和驱动版本。 ⚠️ AMD 显卡直接出局,全部算力都跑在英伟达卡上,没装驱动一个服务都起不来。
  3. 动作:拿到项目代码。 命令:git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar预期:当前目录出现 Duix-Avatar 文件夹。
  4. 动作:进入 deploy 目录,启动服务集群。 命令:docker-compose up -d预期:开始拉 3 个镜像,总流量约 70GB,建议连 WiFi,大概半小时。Ubuntu 用户改用 deploy 目录里的 docker-compose-linux.yml 启动。
  5. 动作:确认容器活过来了。 命令:docker ps预期:3 个服务 Running:duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video,端口 18180、10095、8383 全部映射成功。
  6. 动作:装客户端。 操作:下载官方发布的安装包,双击安装程序。 预期:能打开,首页出现"创建视频"和"创建形象"两个入口。

✅ 验证清单,开始创作前自查 4 项:

  • 3 个容器都是 Running,没有 Restarting
  • 浏览器访问 127.0.0.1:18180 有正常响应
  • 8383 端口能通
  • 客户端能进首页,不报连接错误

它怎么干活:10秒视频是怎么变成口播视频的

合成之前,系统先干一件铺垫的事:把你视频里说的话转写成文字。这一步是 ASR(自动语音识别,机器听你说话并转成文字)。不先搞清楚"这段音频里说了什么词",机器就没法学你的声音。

剩下两个核心环节:

  1. 声音克隆:从 10 秒音频里提取音色特征,给你建一份声纹。之后输入文字,TTS(文本转语音,用你克隆的声音把文字念出来)直接产出你的配音。 类比:像把旧收音机的声卡拆出来装进新收音机,你喂什么词,它都用你的嗓子唱。 关键数字:喂进去的样本只要 10 秒左右。
  2. 口型视频合成:画面背景、身体动作都保持原样,只有脸被重新驱动。 类比:像给一张定格照片做"对口型换脸",人不动,脸在动,嘴型跟着音频走。 关键数字:合成容器的共享内存配了 8G,显存小的卡最容易在这步被挤爆。

玩出花:接上 API 批量生成数字人视频

首页界面够个人用了,想批量生产就直接调接口。Docker 起来后服务暴露在本地 127.0.0.1,18180 管音频,8383 管视频。

  1. 场景:同一个数字人给 20 个人发周报,开场白各不一样。 参数:调 8383 的 /easy/submit,传 audio_url(音频路径)、video_url(静音视频)、code(唯一 key),外加三个固定值 chaofen=0、watermark_switch=0、pn=1;再用 /easy/query 带 code 轮询进度。 效果:绕开客户端,写个循环提交,批量出片不盯屏。
  2. 场景:同一段文字,想让配音更稳一点或语调更活一点。 参数:调 18180 的 /v1/invoke,temperature 和 topP 默认 0.7,max_new_tokens 1024,reference_audio 和 reference_text 填训练那一步的返回值。 效果:0.7 是稳态,调低更平稳,调高语调变化更多。
  3. 场景:内存吃紧,或者用的是 50 系新卡。 参数:deploy 目录改跑 docker-compose-lite.yml,只起 1 个 gen-video 容器;5090 用户换 docker-compose-5090.yml。 效果:lite 版不起 ASR 和 TTS,镜像更小,但没法克隆声音;5090 配置用的是 torch 官方预览版。

具体调用逻辑看仓库里的 src/main/service/voice.js 和 src/main/service/video.js,抄就行。

踩坑实录:我第一周栽过的 4 个真问题

拉镜像一直失败,满屏 request canceled 和 context canceled。 根因:Docker Hub 官方源在国内网络下不稳定。 修复:Docker 设置的 Docker Engine 里加一段镜像源配置(doc/常见问题.md 里有现成的 registry-mirrors),点 Apply & restart,再重新拉。

C 盘两天就被塞满。 根因:3 个镜像共 70GB,默认全躺在 C 盘。 修复:Docker 设置 → Resources → Advanced → Disk image location,换个空间足的盘,Apply & restart。

客户端新增模特报错,日志里是 file not exists。 根因:上传的模特视频必须带人说话的声音,程序要把音频拆出来做声音克隆,音频会写进容器约定的 d:/duix_avatar_data/voice/data 目录。没声音、或者这个目录压根不存在,都会翻车。 修复:重拍一段你说话清晰的片段,确认 D 盘的挂载目录存在。

服务刚起来就点克隆形象,报 Connection refused。 根因:ASR 服务启动偏慢,你连得太早,自然被拒。 修复:启动后等几分钟再操作,用 docker ps 确认 3 个服务都 Running。内存只有 16G 的话 ASR 可能根本起不来,加到 32G。

收尾

三个服务跑起来,形象克隆好,你手里就有了一个用自己脸和嗓子念稿的视频。接下来可以试试调 /v1/invoke 的 temperature,看看声音会不会更有起伏。再卡住的话,先翻 doc 目录下的常见问题,八成有人替你踩过。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询