HeyGem.ai 数字人本地部署全解:10秒克隆数字分身
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
想让人替你念口播,又不想出镜?HeyGem.ai(Duix.Avatar)是一个开源数字人项目:录 10 秒视频,它就能克隆你的形象和声音,之后输入文案,自动产出口型对得上的口播视频,全程本地离线跑,素材不出内网。#个人创作者 #课程制作 #数字营销
能不能跑:数字人硬件配置对照
先给结论:必须有 NVIDIA 显卡,这是硬门槛。项目里语音克隆、语音识别、视频合成三个 AI 服务全部依赖 GPU 算力,没有独显或驱动没装好,服务根本起不来。集成显卡、纯 CPU 方案请绕行。
| 配置项 | 够用线 | 舒适线 | 作用 |
|---|---|---|---|
| 显卡 | NVIDIA 8GB 显存 | RTX 4070 及以上 | 三个 AI 服务全部跑在 GPU 上,是速度瓶颈 |
| 内存 | 16GB | 32GB | 模型加载与容器运行 |
| CPU | 6 核 | 13 代 i5 或更高 | 客户端与容器调度 |
| 磁盘 | 数据区 30G + 镜像区 100G | SSD | 存放克隆视频和 Docker 镜像 |
| 系统 | Win10 19042+ / Ubuntu 22.04 | 同上并开启 WSL2 | 容器运行环境 |
两条系统级建议:
- 装好 NVIDIA 驱动后,在终端执行
nvidia-smi。你应当看到显卡型号、显存大小和驱动版本号,这是后面一切部署的前提。 - 拉取镜像默认走 Docker Hub,国内网络下很慢,进阶档会教你配国内镜像源。
它怎么做的:从10秒视频到成片
把数字人克隆理解成"录模板":你录的 10 秒视频,就是教 AI 认脸和听声的样本。脸是"面具",声音是"声纹",之后给它任何文案,它就照着模板开口说话。
拆开看,整条流水线是四个环节:
- 语音克隆(TTS):从你的音频样本里学音色、语调,之后用这个声音朗读任意文本。
- 语音识别(ASR):把你视频里说的话转成文字,作为声音训练的参考文本。
- Face2Face 视频合成:以原视频为模板,按新音频的口型逐帧生成新的面部画面,这是"换口型"的核心。
- 音视频合成引擎:把新画面和克隆语音按节奏对齐,输出最终视频。
客户端本身是个 Electron 桌面程序(源码在 src/main/service/video.js 可见它如何调度),所有重活都丢给本地三个 Docker 服务:TTS 占 18180 端口、视频合成占 8383 端口。
边界清单——这些它目前做不到:
- 只能克隆"会说话的上半身",复杂肢体动作、走动场景不在能力范围内。
- 源视频必须有清晰人声且是说话状态,静音视频会直接报错。
- 源视频质量决定上限:光线暗、侧脸、多人出镜,效果都会打折。
- 文案语言支持中文、英、日、韩、法、德、阿、西共 8 种,超出范围不保证效果。
怎么跑起来:数字人本地部署最小路径
快速档(5 分钟跑通):
git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai你应当看到当前目录下出现HeyGem.ai文件夹,里面有deploy(部署配置)等目录。
cd HeyGem.ai/deploy docker-compose up -d首次执行会拉取约 70G 流量,耗时半小时以上。完成后你应当看到docker ps里三个容器均为 Running:duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video。
最后装客户端:用官方构建的安装包(Windows 双击 exe、Ubuntu 用 AppImage)启动即可。打开后你应当看到主页两个大入口——"创建视频"和"创建虚拟形象",上传 10 秒视频完成克隆,再输文案就能生成成片。
如果卡住了:先确认三个服务是否都在 Running,再确认nvidia-smi有输出。哪个服务异常,就点开该容器复制日志排查,方式见 doc/常见问题.md 的截图说明。
进阶档(按机器对号入座):
显存 8GB 左右想省着用,用 lite 配置,只启动视频合成服务,声音改用你自己录的音频:
cd HeyGem.ai/deploy docker-compose -f docker-compose-lite.yml up -d你应当看到只有一个容器Duix.Avatar-gen-video启动。
RTX 50 系列(5090 已验证,30/40 系列 CUDA 12.8 用户也可用)换专用编排文件:
docker-compose -f docker-compose-5090.yml up -d拉镜像慢,就给 Docker 加国内镜像源,在/etc/docker/daemon.json写入:
{ "registry-mirrors": [ "https://hub.fast360.xyz", "https://hub.littlediary.cn" ] }保存后重启 Docker。你应当看到镜像从新源拉取,速度明显回升。
⚠️ 首次拉镜像约 70G 流量且 Windows 需要 C 盘 100G+ 存镜像文件——连上 WiFi 再执行,空间不足时在 Docker 设置里改"Disk image location"。
⚠️ 所有算力都在本地,装完驱动先跑一遍nvidia-smi再部署,能省掉大量"服务起不来"的排查时间。
如果卡住了:镜像源随时间会失效,遇到request canceled类报错,直接翻 doc/常见问题.md 里的最新可用镜像列表替换即可。
跑得更好:资源分配与批量生成
方向一:把 Docker 的资源配额调大。WSL 版 Docker 默认只分到很少的内存和 CPU,视频合成会明显变慢。打开 Docker Desktop → Settings → Resources → Advanced:
具体操作:CPU 分配系统总核心的 50%,内存给到 16GB 以上;"Disk image location" 指到 SSD 分区,提升镜像读写。你会看到合成一条 1 分钟视频的时间明显缩短,多个任务排队也不卡顿。
方向二:用开放 API 做批量生成。服务启动后会在本地暴露接口,写个脚本循环调用,就能批量出片。以视频合成接口为例,请求体最小配置:
{ "audio_url": "音频文件路径", "video_url": "源视频路径", "code": "唯一任务编号", "chaofen": 0, "watermark_switch": 0, "pn": 1 }POST 到http://127.0.0.1:8383/easy/submit,再用code轮询easy/query查进度;文案转语音则调用 18180 端口的 TTS 接口,参数示例都写在 README 的"开放 API"一节里。你会得到一条不依赖客户端界面、可脚本化跑批的自动化流水线。
目前它克隆的仍是"会说话的上半身",做不到舞蹈和复杂肢体语言;随着模型迭代,离线数字人离"生产级"只会越来越近。你打算让第一个 10 秒样本视频,替你念出哪句话?
【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考