10秒视频克隆数字人:免费完整本地部署Duix.Avatar数字人视频生成
2026/9/11 16:52:43 网站建设 项目流程

10秒视频克隆数字人:免费完整本地部署Duix.Avatar数字人视频生成

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

你想让自己的脸和声音出镜讲视频,但外包 3D 建模又贵又慢,网上服务又担心素材隐私。Duix.Avatar 是免费开源、全离线运行的 AI 数字人工具包:上传约 10 秒视频即可克隆外貌与声音,输入文案自动生成口型同步的口播视频。全程只需 3 个 Docker 服务,镜像下载约 70GB,支持 8 种语言。

它凭什么值得用

先看传统 3D 数字人制作与本项目本地部署的差距,表中数字全部来自项目官方文档:

维度传统 3D 数字人Duix.Avatar
制作成本数十万美元量级约 1,000 美元(官方英文 README 原话:从数十万美元降到 $1,000)
建模素材专业团队建模,周期以周计一段 10 秒真人视频
联网要求多为云服务全离线,数据不出本机
语言支持依赖配音/翻译中、英、日、韩、法、德、阿拉伯、西语共 8 种
商用授权付费全球免费商用(用户量超 10 万或年营收超 1,000 万美元的企业需签署商业许可协议)

对个人和中小团队,最实在的变化是:不用采购 GPU 服务器,不用养 3D 团队,一台装了英伟达显卡的 Docker 机器就能跑。

原理速览

Duix.Avatar 本质是三个模块串联,看明白数据怎么流转,你就看懂了这个项目。

1. 声音克隆:从 10 秒音频到无限同音色输入:你 10 秒视频里提取的人声(客户端自动把视频分离成静音视频+音频,音频放入D:\duix_avatar_data\voice\data)。 处理:fun-asr 服务(ASR,自动语音识别,把语音转成文字)先把这段音频转写成文本,fish-speech 服务再基于"音频+文本"训练出参考音频 reference_audio 与参考文本 reference_text。 输出:之后任意文案送进合成接口http://127.0.0.1:18180/v1/invoke,就得到同音色的 wav 音频。调用细节见 src/main/service/voice.js。

2. 口型视频合成:从音频到口播视频输入:上一步的 wav + 你的数字人视频。 处理:duix.avatar 容器(本地 8383 端口)根据音频的节奏与语调驱动口型与表情。 输出:http://127.0.0.1:8383/easy/submit提交任务,/easy/query?code=...轮询进度,最终拿到口型对齐的视频。实现参考 src/main/service/video.js。

3. 全本地编排deploy/docker-compose.yml 定义三个容器:duix-avatar-tts(18180)、duix-avatar-asr(10095)、duix-avatar-gen-video(8383),全部跑在本地英伟达显卡上。客户端是 Electron + Vue 应用(依赖 Node.js 18),模特与作品数据全部落在D:\duix_avatar_data,没有任何数据外发。

上手实测

以下流程以 Windows 为例,Ubuntu 22.04 用户只需替换服务端启动命令。

第 1 步:拉取代码并检查硬件

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar

你会看到:当前目录多出一个Duix-Avatar文件夹,内含deploy/src/子目录。动手前确认:Windows 10 19042.1526+ 或 Ubuntu 22.04(官方已验证内核 6.8.0-52-generic);装好 Node.js 18;执行nvidia-smi能看到显卡(没有英伟达显卡和驱动,三个服务起不来);C 盘留 100GB 给镜像、D 盘留 30GB。

看到request canceled while waiting for connection报错 → 通常是 Docker Hub 官方源连接不稳 → 按 doc/常见问题.md 的指引,在 Docker 的 daemon.json 里加 registry-mirrors 镜像源并重启。

图:在 Docker Desktop 的 Settings → Docker Engine 中配置国内镜像源,解决拉镜像超时

第 2 步:启动三个服务端

cd deploy docker-compose up -d

Ubuntu 用户改为执行docker-compose -f docker-compose-linux.yml up -d;50 系显卡用docker-compose -f docker-compose-5090.yml up -d(官方 5090 测试通过,30/40 系 CUDA 12.8 也可用)。

你会看到:约半小时后(70GB 下载,建议连 WiFi),Docker 中出现 duix-avatar-tts / duix-avatar-asr / duix-avatar-gen-video 三个服务且全部 Running。只需要视频合成服务时可用 lite 版,只起一个 duix-avatar-gen-video。

定制模特时看到[Errno 111] Connection refused→ 通常是 ASR 服务启动慢 → 服务端起来后等几分钟再试;若机器内存偏小(16G),可能根本起不来(来源:doc/常见问题.md)。

第 3 步:安装客户端,进入主界面

双击Duix.Avatar-x.x.x-setup.exe安装(到项目 release 页下载对应系统安装包);Ubuntu 直接双击 AppImage 运行,无需安装,root 用户需加--no-sandbox参数启动。

你会看到:主界面顶部是 "Create Video" 与 "Create Avatar" 两个大入口,下方是 "My Works / My Avatars" 列表。

图:客户端主界面,左侧管理作品与数字人模特,顶部进入视频创建与形象克隆

客户端一直报连不上服务端 → 通常是三个服务未全部 Running 或 18180/8383 端口未放行 → 回到/deploy目录重新执行docker-compose up -d

第 4 步:克隆数字人,产出第一条视频

点击 "Create Avatar" 上传 10 秒视频,等训练完成;再点 "Create Video",选形象、输入文案(或上传自己的音频),点击生成。

你会看到:"My Avatars" 出现形象卡片,合成完成后 "My Works" 里可以下载口播视频。

新增模特时报错 → 通常是视频没有声音或不是人在说话(程序要用这段声音做声音克隆)→ 重新录一段有人声、单人出镜的清晰视频(来源:doc/常见问题.md)。

真实场景

场景一:企业内训 / 合规宣导视频需求:批量产出标准化口播视频,且培训素材与内部口径不能流到任何云服务。 关键配置:按 deploy/docker-compose.yml 完整部署三个容器,模特与作品数据统一放D:\duix_avatar_data,官方推荐配置为 i5-13400F + 32G 内存 + RTX 4070。 效果数据:每个模特只需 10 秒视频素材,文案支持 8 种语言,全程离线、无按次收费。

场景二:自媒体口播量产需求:用数字人替身批量产出口播内容,声音稳定不翻车。 关键配置:小量用客户端点选即可;要搭流水线就直连两个 API——http://127.0.0.1:18180/v1/invoke合成音频、http://127.0.0.1:8383/easy/submit合成视频,参数示例都在 README 的"开放 API"一节。 效果数据:商用免费(用户量超 10 万或年营收超 1,000 万美元需签商业许可),不限量次、不收月费。

进阶与求助

二次开发入口:

  • 模特训练逻辑:src/main/service/model.js
  • 视频合成逻辑:src/main/service/video.js
  • 界面组件(Vue):src/renderer/src/views

性能调优参数:deploy/docker-compose.yml中视频合成服务的shm_size: '8g'控制共享内存大小,环境变量PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:512控制显存分配策略,按你的内存与显存余量调整。

排查顺序:① 确认三个服务是否全部 Running;②nvidia-smi检查显卡驱动;③ 客户端右上角设置菜单 → Open Log 取客户端日志;④ 点开对应 Docker 容器复制关键报错堆栈,对照 doc/常见问题.md,或直接提交到项目 issue 页面。

图:客户端右上角设置菜单里点 Open Log,即可拿到客户端日志

图:Docker Desktop 中点开容器查看 TTS 服务日志,把关键报错堆栈复制到 issue

Duix.Avatar 目前能基于 10 秒视频,全离线克隆外貌与声音,并生成 8 种语言、口型同步的口播视频。下一步:在deploy目录跑一次docker-compose up -d,然后上传你第一段 10 秒视频。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询