Duix.Avatar本地部署AI数字人视频工作室:一段10秒视频能走多远
2026/9/11 1:23:13 网站建设 项目流程

Duix.Avatar本地部署AI数字人视频工作室:一段10秒视频能走多远

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

你要批量产出口播视频,外包按分钟计费,把素材传到云端服务又有点不放心。Duix.Avatar 解决的就是这个问题:一款开源、全离线的 AI 数字人工具包,上传一段 10 秒左右的视频,它就能克隆你的形象和声音,之后用文字或音频驱动这个数字分身,产出口型匹配的口播视频。素材和模型都留在你自己的机器里。

🧭 部署前硬件自检清单

Duix.Avatar 没有 CPU 兜底方案,全部算力压在 NVIDIA 显卡上,所以动手前先对照检查:

项目要求说明
显卡NVIDIA 且装好驱动(推荐 RTX 4070)没显卡或没驱动,三个服务根本起不来
内存32GB 及以上16G 可能带不动 ASR 服务
硬盘C 盘空余 100G,D 盘 30GC 盘存 Docker 镜像,D 盘的 duix_avatar_data 存素材和作品
系统Win10 19042.1526+ 或 Ubuntu 22.04Ubuntu 需额外装 NVIDIA Container Toolkit
网络建议连 WiFi首次拉镜像约 70G 流量

部署有两条路线:手上已有音频、只想先跑口型合成的,选lite 版(单服务);要走「上传视频 → 克隆 → 文字出片」完整流程的,选完整版(三个服务)。

⚡ 本地部署:最小路径

先拿源码:

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar

把仓库放到本地,deploy 目录里放着各场景的 compose 文件。启动服务端:

cd deploy docker-compose up -d

这一条命令会拉取 fun-asr、fish-speech-ziming、duix.avatar 三个镜像并启动容器,同时把 D 盘 duix_avatar_data 挂成数据盘。下载耗时约半小时,取决于网速。

验证锚点:Docker 容器列表里duix-avatar-asrduix-avatar-ttsduix-avatar-gen-video三个服务全部显示 Running,服务端就算就绪;lite 版则是Duix.Avatar-gen-video一个服务 Running。

Ubuntu 22.04 把文件换成 Linux 专用版即可:

docker-compose -f docker-compose-linux.yml up -d

客户端是桌面程序,从官方 release 下载 setup.exe 安装(Windows),或运行 AppImage(Linux)。Ubuntu 下 root 用户进桌面的,要在终端加--no-sandbox参数启动。

制作你的第一段数字人视频

打开客户端,首页两个入口:Create Avatar(创建形象)Create Video(生成视频)

先克隆形象:上传一段你对着镜头说话的 10 秒视频。这一步系统会把视频拆成静音视频 + 音频,对画面做面部识别,再用 fun-asr 转写、fish-speech 对声音建模,得到一个以你命名的数字模型。这里有个硬性要求:素材视频必须带人声。没有声音就没有克隆对象,上传那一步就会直接报错。

再生成作品:选中模型,输入文案,支持中、英、日、韩、法、德、阿、西八种语言。内部链路是文字 → TTS 合成语音 → 驱动模型生成口型同步的视频;也可以直接上传现成音频,数字人会按这段音频的节奏和语调表演。

成片完成后自动归档到 My Works,在线播放和导出都在这一步完成。

🛠 进阶与投产

部署方式对照

场景命令说明
完整版(默认)docker-compose up -d三服务,克隆 + 文字转语音一条龙
快速体验docker-compose -f docker-compose-lite.yml up -d只起视频合成服务,适合拿现成音频跑
NVIDIA 50 系显卡docker-compose -f docker-compose-5090.yml up -d基于 PyTorch 预览版,5090 实测通过,30/40 系配 CUDA 12.8 也能用

值得动的三个参数

参数默认值建议值不改会怎样
镜像下载源Docker Hub 官方源配置国内 registry-mirrors拉取卡住、超时
Docker 数据位置(Win)C 盘 AppData空余不足 100G 就 Browse 到别的盘镜像写满磁盘直接失败
shm_size(视频合成服务)8g保持 8g长视频合成时共享内存不足会崩

Windows 下改数据位置的入口在 Docker 设置 → Resources → Disk image location:

如果你想把这套服务接进自己的系统,Docker 起来后会开放三个本地端口:18180 语音合成、10095 语音识别、8383 视频合成(/easy/submit提交、/easy/query查进度)。参考实现可以看 src/main/service/ 下的 model.js、video.js、voice.js。

启动报错排查

排障前先过两关:三个服务是否都 Running;nvidia-smi能否显示显卡。任一不过,后面这些错你大概率一个都撞不上。

  • 拉镜像报 request canceled / context canceled:Docker Hub 连接不稳。在 Docker Engine 配置里加 registry-mirrors 国内镜像源并 Apply & restart,或开全局网络。

下面两条是客户端侧的高发问题:

  • 克隆形象报 Connection refused:ASR 服务启动慢或内存不够(16G 可能起不来)。服务端起来后等几分钟再克隆;内存只有 16G 的,建议先升到 32G。
  • 克隆报错但没更多提示:素材视频里没有说话声,换一段你说话的素材即可。

再定位不了,翻客户端日志,服务端则点对应 Docker 容器「复制」日志,对照仓库里的 常见问题 逐条匹配。

下一步

  1. nvidia-smi确认显卡可用,C 盘腾出 100G。
  2. 在 deploy 下执行docker-compose up -d,等三个服务全部 Running。
  3. 上传一段带人声的 10 秒视频,克隆你的第一个数字分身,跑通一条 1 分钟文案。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询