用一段10秒视频做出你的AI数字人口播视频:Duix.Avatar 快速上手
2026/9/11 15:12:16 网站建设 项目流程

用一段10秒视频做出你的AI数字人口播视频:Duix.Avatar 快速上手

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

Duix.Avatar 是一个免费开源、完全离线的 AI 数字人项目:提交一段 10 秒左右的视频,即可克隆你的形象和声音;输入文案或上传音频,就能生成口播视频。它解决口播视频要出镜、商用服务收费、数据要传上云这几个痛点。本文从硬件要求讲到第一次产出。

它到底能帮你干什么

这个项目把形象克隆、声音克隆、视频合成三件事打包进了一个桌面客户端,常见用法有三种:

  • 自媒体与短视频博主:录一次 10 秒的说话视频,就能做出你的数字分身,之后输入文案即出视频,不用反复出镜拍摄。文案支持中、英、日、韩、法、德、阿拉伯、西语 8 种语言。
  • 讲师与企业内训师:把一份讲稿变成视频课程,声音用你的克隆音,形象用你本人,省掉录课流程。支持导入多个数字人模型,不同课程内容可以切换不同形象。
  • 企业宣发与电销团队:批量生成宣传口播和产品讲解视频;服务端在本地暴露 API,开发者可以把数字人生成能力接进自己的业务系统。

图:Duix.Avatar 客户端主界面,"我的数字人"存放克隆好的形象,"Create Video / Create Avatar"是两个主入口

上手之前,先确认这几件事

Duix.Avatar 最低配置要求

  • 系统:Windows 10 19042.1526 或更高版本;Ubuntu 22.04 Desktop 已验证可用。
  • 磁盘:Windows 需要 D 盘存放数字人和作品数据,空闲 30G 以上;C 盘存 Docker 镜像,空闲 100G 以上,不足时可在 Docker 设置中更换镜像位置。
  • 内存:32G 及以上,硬性要求。
  • 显卡:英伟达显卡且正确安装驱动,硬性要求;推荐 RTX 4070。Ubuntu 还需安装 NVIDIA Container Toolkit 让 Docker 调用 GPU。

四条都满足就值得试:项目完全开源,支持全球免费商用(用户量超 10 万或年营收超 1000 万美元的企业需签署商业许可协议)。没有英伟达显卡则三个服务端都起不来,不建议强上。

📦 最快上手路径

主线四步:Docker 环境 → 部署服务 → 安装客户端 → 做出第一个数字人。

第一步,准备 Docker 环境(Windows):用wsl --list --verbose查看 WSL,未更新则执行wsl --update,再安装 Docker Desktop。C 盘空间不足时,到 Settings → Resources → Advanced 把 Disk image location 改到空间充足的磁盘。

图:Docker Desktop 的 Resources 设置页,C 盘不足时可在此修改镜像文件位置

第二步,部署服务端

git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d

等待约半小时,下载约 70G,建议连 WIFI。Docker 中出现三个 Running 状态的服务,即部署成功。

第三步,安装客户端:Windows 双击官方构建的 Duix.Avatar-x.x.x-setup.exe;Ubuntu 双击 AppImage 即可运行,root 用户进入桌面时需在命令行加--no-sandbox参数。

第四步,产出第一个口播视频:点"Create Avatar"上传 10 秒视频(必须有声音、是人在说话),训练完成后模型出现在"我的数字人";输入文案或上传音频,生成第一条口播视频。语言切换、客户端日志入口在右上角设置菜单里。

图:右上角设置菜单,包含用户协议、打开客户端日志、语言切换

⚙️ 进阶玩法与常用配置

轻量版部署:磁盘或显存吃紧时,在 deploy 目录改用下面的命令,只保留视频合成服务,不部署声音克隆与 ASR,对应配置文件 deploy/docker-compose-lite.yml:

docker-compose -f docker-compose-lite.yml up -d

NVIDIA 50 系显卡:5090 用户使用 docker-compose-5090.yml 这份 compose,基于 torch 官方预览版;30/40 系中 cuda12.8 的用户也可切换到该方案。

本地 API 接入:服务启动后 18180 端口提供语音预处理与合成,8383 端口提供视频合成(提交 + 进度查询),请求参数中的 watermark_switch(水印)和 chaofen(超分)在此配置,调用示例见 src/main/service/ 下的 model.js、voice.js、video.js 三个文件。

⚠️ 容易翻车的几个地方

up -d报错连不上 registry-1.docker.io:Docker Hub 官方源连接不稳定。在 daemon.json 的 registry-mirrors 中配置国内镜像源,重启 Docker 再执行。

图:在 Docker 的 daemon.json 中添加 registry-mirrors,镜像源会随时间失效,需自行找最新可用的

新增模特报错:用于创建模特的视频必须有声音、且是人在说话。程序要用视频里的声音做声音克隆,静音视频必然失败;重录一段 10 秒说话视频再上传。

定制模特报 Connection refused:ASR 服务启动较慢。等服务起来后等几分钟再做克隆操作;另外内存只有 16G 的机器可能根本启动不了,仍需 32G。

服务起不来或反复重启:本项目所有算力都在本地,没有英伟达显卡或没装驱动,三个服务都会启动失败。用nvidia-smi确认显卡可见,并到 Docker 里查看日志定位报错。

图:打开 Docker 服务的日志面板,点"复制"即可把服务端日志取出来排查

写在最后

有英伟达显卡 + 32G 内存、想本地离线做口播视频的,值得花一小时部署这个项目;没有显卡或只想直接要结果的,可以跳过。

学习入口:排查指南在 doc/常见问题.md,完整部署文档见 README_zh.md。

今晚把镜像拉完,明天就能看到你的第一条数字人口播视频。

使用本人或他人形象、声音生成内容前请取得明确授权,不用于欺诈、造谣等违法违规用途。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询