HeyGem.ai 数字人本地部署全解:10秒克隆数字分身
2026/9/11 6:28:47 网站建设 项目流程

HeyGem.ai 数字人本地部署全解:10秒克隆数字分身

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

想让人替你念口播,又不想出镜?HeyGem.ai(Duix.Avatar)是一个开源数字人项目:录 10 秒视频,它就能克隆你的形象和声音,之后输入文案,自动产出口型对得上的口播视频,全程本地离线跑,素材不出内网。#个人创作者 #课程制作 #数字营销

能不能跑:数字人硬件配置对照

先给结论:必须有 NVIDIA 显卡,这是硬门槛。项目里语音克隆、语音识别、视频合成三个 AI 服务全部依赖 GPU 算力,没有独显或驱动没装好,服务根本起不来。集成显卡、纯 CPU 方案请绕行。

配置项够用线舒适线作用
显卡NVIDIA 8GB 显存RTX 4070 及以上三个 AI 服务全部跑在 GPU 上,是速度瓶颈
内存16GB32GB模型加载与容器运行
CPU6 核13 代 i5 或更高客户端与容器调度
磁盘数据区 30G + 镜像区 100GSSD存放克隆视频和 Docker 镜像
系统Win10 19042+ / Ubuntu 22.04同上并开启 WSL2容器运行环境

两条系统级建议:

  • 装好 NVIDIA 驱动后,在终端执行nvidia-smi。你应当看到显卡型号、显存大小和驱动版本号,这是后面一切部署的前提。
  • 拉取镜像默认走 Docker Hub,国内网络下很慢,进阶档会教你配国内镜像源。

它怎么做的:从10秒视频到成片

把数字人克隆理解成"录模板":你录的 10 秒视频,就是教 AI 认脸和听声的样本。脸是"面具",声音是"声纹",之后给它任何文案,它就照着模板开口说话。

拆开看,整条流水线是四个环节:

  • 语音克隆(TTS):从你的音频样本里学音色、语调,之后用这个声音朗读任意文本。
  • 语音识别(ASR):把你视频里说的话转成文字,作为声音训练的参考文本。
  • Face2Face 视频合成:以原视频为模板,按新音频的口型逐帧生成新的面部画面,这是"换口型"的核心。
  • 音视频合成引擎:把新画面和克隆语音按节奏对齐,输出最终视频。

客户端本身是个 Electron 桌面程序(源码在 src/main/service/video.js 可见它如何调度),所有重活都丢给本地三个 Docker 服务:TTS 占 18180 端口、视频合成占 8383 端口。

边界清单——这些它目前做不到:

  • 只能克隆"会说话的上半身",复杂肢体动作、走动场景不在能力范围内。
  • 源视频必须有清晰人声且是说话状态,静音视频会直接报错。
  • 源视频质量决定上限:光线暗、侧脸、多人出镜,效果都会打折。
  • 文案语言支持中文、英、日、韩、法、德、阿、西共 8 种,超出范围不保证效果。

怎么跑起来:数字人本地部署最小路径

快速档(5 分钟跑通):

git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai

你应当看到当前目录下出现HeyGem.ai文件夹,里面有deploy(部署配置)等目录。

cd HeyGem.ai/deploy docker-compose up -d

首次执行会拉取约 70G 流量,耗时半小时以上。完成后你应当看到docker ps里三个容器均为 Running:duix-avatar-ttsduix-avatar-asrduix-avatar-gen-video

最后装客户端:用官方构建的安装包(Windows 双击 exe、Ubuntu 用 AppImage)启动即可。打开后你应当看到主页两个大入口——"创建视频"和"创建虚拟形象",上传 10 秒视频完成克隆,再输文案就能生成成片。

如果卡住了:先确认三个服务是否都在 Running,再确认nvidia-smi有输出。哪个服务异常,就点开该容器复制日志排查,方式见 doc/常见问题.md 的截图说明。

进阶档(按机器对号入座):

显存 8GB 左右想省着用,用 lite 配置,只启动视频合成服务,声音改用你自己录的音频:

cd HeyGem.ai/deploy docker-compose -f docker-compose-lite.yml up -d

你应当看到只有一个容器Duix.Avatar-gen-video启动。

RTX 50 系列(5090 已验证,30/40 系列 CUDA 12.8 用户也可用)换专用编排文件:

docker-compose -f docker-compose-5090.yml up -d

拉镜像慢,就给 Docker 加国内镜像源,在/etc/docker/daemon.json写入:

{ "registry-mirrors": [ "https://hub.fast360.xyz", "https://hub.littlediary.cn" ] }

保存后重启 Docker。你应当看到镜像从新源拉取,速度明显回升。

⚠️ 首次拉镜像约 70G 流量且 Windows 需要 C 盘 100G+ 存镜像文件——连上 WiFi 再执行,空间不足时在 Docker 设置里改"Disk image location"。

⚠️ 所有算力都在本地,装完驱动先跑一遍nvidia-smi再部署,能省掉大量"服务起不来"的排查时间。

如果卡住了:镜像源随时间会失效,遇到request canceled类报错,直接翻 doc/常见问题.md 里的最新可用镜像列表替换即可。

跑得更好:资源分配与批量生成

方向一:把 Docker 的资源配额调大。WSL 版 Docker 默认只分到很少的内存和 CPU,视频合成会明显变慢。打开 Docker Desktop → Settings → Resources → Advanced:

具体操作:CPU 分配系统总核心的 50%,内存给到 16GB 以上;"Disk image location" 指到 SSD 分区,提升镜像读写。你会看到合成一条 1 分钟视频的时间明显缩短,多个任务排队也不卡顿。

方向二:用开放 API 做批量生成。服务启动后会在本地暴露接口,写个脚本循环调用,就能批量出片。以视频合成接口为例,请求体最小配置:

{ "audio_url": "音频文件路径", "video_url": "源视频路径", "code": "唯一任务编号", "chaofen": 0, "watermark_switch": 0, "pn": 1 }

POST 到http://127.0.0.1:8383/easy/submit,再用code轮询easy/query查进度;文案转语音则调用 18180 端口的 TTS 接口,参数示例都写在 README 的"开放 API"一节里。你会得到一条不依赖客户端界面、可脚本化跑批的自动化流水线。

目前它克隆的仍是"会说话的上半身",做不到舞蹈和复杂肢体语言;随着模型迭代,离线数字人离"生产级"只会越来越近。你打算让第一个 10 秒样本视频,替你念出哪句话?

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询