Duix.Avatar本地部署AI数字人视频工作室:一段10秒视频能走多远
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
你要批量产出口播视频,外包按分钟计费,把素材传到云端服务又有点不放心。Duix.Avatar 解决的就是这个问题:一款开源、全离线的 AI 数字人工具包,上传一段 10 秒左右的视频,它就能克隆你的形象和声音,之后用文字或音频驱动这个数字分身,产出口型匹配的口播视频。素材和模型都留在你自己的机器里。
🧭 部署前硬件自检清单
Duix.Avatar 没有 CPU 兜底方案,全部算力压在 NVIDIA 显卡上,所以动手前先对照检查:
| 项目 | 要求 | 说明 |
|---|---|---|
| 显卡 | NVIDIA 且装好驱动(推荐 RTX 4070) | 没显卡或没驱动,三个服务根本起不来 |
| 内存 | 32GB 及以上 | 16G 可能带不动 ASR 服务 |
| 硬盘 | C 盘空余 100G,D 盘 30G | C 盘存 Docker 镜像,D 盘的 duix_avatar_data 存素材和作品 |
| 系统 | Win10 19042.1526+ 或 Ubuntu 22.04 | Ubuntu 需额外装 NVIDIA Container Toolkit |
| 网络 | 建议连 WiFi | 首次拉镜像约 70G 流量 |
部署有两条路线:手上已有音频、只想先跑口型合成的,选lite 版(单服务);要走「上传视频 → 克隆 → 文字出片」完整流程的,选完整版(三个服务)。
⚡ 本地部署:最小路径
先拿源码:
git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar把仓库放到本地,deploy 目录里放着各场景的 compose 文件。启动服务端:
cd deploy docker-compose up -d这一条命令会拉取 fun-asr、fish-speech-ziming、duix.avatar 三个镜像并启动容器,同时把 D 盘 duix_avatar_data 挂成数据盘。下载耗时约半小时,取决于网速。
验证锚点:Docker 容器列表里duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个服务全部显示 Running,服务端就算就绪;lite 版则是Duix.Avatar-gen-video一个服务 Running。
Ubuntu 22.04 把文件换成 Linux 专用版即可:
docker-compose -f docker-compose-linux.yml up -d客户端是桌面程序,从官方 release 下载 setup.exe 安装(Windows),或运行 AppImage(Linux)。Ubuntu 下 root 用户进桌面的,要在终端加--no-sandbox参数启动。
制作你的第一段数字人视频
打开客户端,首页两个入口:Create Avatar(创建形象)和Create Video(生成视频)。
先克隆形象:上传一段你对着镜头说话的 10 秒视频。这一步系统会把视频拆成静音视频 + 音频,对画面做面部识别,再用 fun-asr 转写、fish-speech 对声音建模,得到一个以你命名的数字模型。这里有个硬性要求:素材视频必须带人声。没有声音就没有克隆对象,上传那一步就会直接报错。
再生成作品:选中模型,输入文案,支持中、英、日、韩、法、德、阿、西八种语言。内部链路是文字 → TTS 合成语音 → 驱动模型生成口型同步的视频;也可以直接上传现成音频,数字人会按这段音频的节奏和语调表演。
成片完成后自动归档到 My Works,在线播放和导出都在这一步完成。
🛠 进阶与投产
部署方式对照
| 场景 | 命令 | 说明 |
|---|---|---|
| 完整版(默认) | docker-compose up -d | 三服务,克隆 + 文字转语音一条龙 |
| 快速体验 | docker-compose -f docker-compose-lite.yml up -d | 只起视频合成服务,适合拿现成音频跑 |
| NVIDIA 50 系显卡 | docker-compose -f docker-compose-5090.yml up -d | 基于 PyTorch 预览版,5090 实测通过,30/40 系配 CUDA 12.8 也能用 |
值得动的三个参数
| 参数 | 默认值 | 建议值 | 不改会怎样 |
|---|---|---|---|
| 镜像下载源 | Docker Hub 官方源 | 配置国内 registry-mirrors | 拉取卡住、超时 |
| Docker 数据位置(Win) | C 盘 AppData | 空余不足 100G 就 Browse 到别的盘 | 镜像写满磁盘直接失败 |
| shm_size(视频合成服务) | 8g | 保持 8g | 长视频合成时共享内存不足会崩 |
Windows 下改数据位置的入口在 Docker 设置 → Resources → Disk image location:
如果你想把这套服务接进自己的系统,Docker 起来后会开放三个本地端口:18180 语音合成、10095 语音识别、8383 视频合成(/easy/submit提交、/easy/query查进度)。参考实现可以看 src/main/service/ 下的 model.js、video.js、voice.js。
启动报错排查
排障前先过两关:三个服务是否都 Running;nvidia-smi能否显示显卡。任一不过,后面这些错你大概率一个都撞不上。
- 拉镜像报 request canceled / context canceled:Docker Hub 连接不稳。在 Docker Engine 配置里加 registry-mirrors 国内镜像源并 Apply & restart,或开全局网络。
下面两条是客户端侧的高发问题:
- 克隆形象报 Connection refused:ASR 服务启动慢或内存不够(16G 可能起不来)。服务端起来后等几分钟再克隆;内存只有 16G 的,建议先升到 32G。
- 克隆报错但没更多提示:素材视频里没有说话声,换一段你说话的素材即可。
再定位不了,翻客户端日志,服务端则点对应 Docker 容器「复制」日志,对照仓库里的 常见问题 逐条匹配。
下一步
- 用
nvidia-smi确认显卡可用,C 盘腾出 100G。 - 在 deploy 下执行
docker-compose up -d,等三个服务全部 Running。 - 上传一段带人声的 10 秒视频,克隆你的第一个数字分身,跑通一条 1 分钟文案。
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考