HeyGem.ai 数字人本地部署完整指南:3 步生成你的第一条 AI 口播视频
2026/9/11 1:25:14 网站建设 项目流程

HeyGem.ai 数字人本地部署完整指南:3 步生成你的第一条 AI 口播视频

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

HeyGem.ai(开源项目 Duix.Avatar)是一个能在你自己电脑上跑的数字人视频生成工具:上传一段 10 秒左右的视频,它会学会你的长相和声音,做出属于你的数字分身。之后你只需要输入一句话,或上传一段录音,它就能自动生成口型对得上的口播视频,全程离线,视频和声音都不用出你的机器。这篇文章带你走通 HeyGem.ai 本地部署的完整流程,从确认配置到排出最常见的坑。

开始本地数字人部署前,先对照硬件和磁盘空间

这个项目所有计算都在本地完成,所以硬件是硬门槛,装之前先对一遍:

  • 显卡:必须是 NVIDIA 显卡,并且装好了最新的显卡驱动。没有独显的话,服务起不来,这是最常见的"白忙活"。
  • 内存:32G 起步,低于这个数容易在生成视频时卡死。
  • 磁盘:Windows 上需要 D 盘空余 30G 以上(存数字人和作品),C 盘空余 100G 以上(存 Docker 镜像)。C 盘不够也没关系,装完 Docker 后可以在设置里把镜像目录改到别的盘,如下图位置:

Ubuntu 22.04 用户同样需要 32G 内存、NVIDIA 显卡加驱动、100G 以上硬盘。配置不够也没关系,下文会讲一个更轻量的 lite 版本。

HeyGem.ai 三步快速启动:部署服务端、拉起客户端

整个部署就三个动作:把代码拿到手、把服务端容器跑起来、把客户端打开。

第 1 步:获取项目代码

git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai

第一条命令把项目克隆到本地,第二条进入项目目录。这个项目本身就是客户端源码,服务端由 Docker 提供。

第 2 步:启动服务端

进入项目里的deploy/目录,执行:

docker-compose up -d

这一条命令会拉取并启动三个服务:语音识别(ASR)、语音合成(TTS)、视频生成。首次运行要下载约 70G 的镜像,官方建议预留半小时以上,建议连 WiFi。Docker Desktop 里看到三个服务都变成 Running,就说明服务端就绪了。

第 3 步:启动客户端

回到项目根目录,先装依赖再启动:

npm install

安装客户端运行所需的全部依赖包。装完执行:

npm run dev

启动开发模式的客户端窗口。如果你不想自己跑源码,也可以直接去项目发布页下载打包好的安装程序(Windows 是 exe,Ubuntu 是 AppImage),双击就能用,效果一样。

先创建数字人,再产出口播视频:客户端完整用法

客户端首页就两个入口:"Create Avatar"(创建数字人)和 "Create Video"(生成视频),使用顺序固定——先有人,再有片。

创建数字人(约 1 分钟上传,稍等训练)

  1. 点右侧蓝色区域的 "Create Avatar",上传一段你出镜说话的视频,10 秒左右即可。注意两点:画面里的人必须在说话,声音要清晰——程序要从这段声音里克隆你的音色,无声视频会直接报错。
  2. 给数字人起个名字,提交后等待训练完成。成功后它出现在 "My Avatars" 标签页里,以后随时可以复用。

生成口播视频(输入一句话就能出片)

  1. 点紫色区域的 "Create Video",选择刚创建好的数字人。
  2. 输入方式两种任选:直接打字,或上传一段现成音频。
  3. 提交后系统自动合成语音(打字模式)并驱动数字人口型,完成后视频进入 "My Works" 列表,点开即可播放、下载。

脚本支持 8 种语言:中、英、日、韩、法、德、阿拉伯、西班牙语。客户端界面本身也支持中英文切换,在右上角设置里点 "Language switch" 即可:

进阶调优:更省的部署、新显卡适配和 API 批量调用

跑通之后,有三种方式可以让 HeyGem.ai 部署更贴你的场景。

配置不够?用 lite 版本

lite 版只跑一个视频生成容器,资源占用小很多,8G 显存也能用。在deploy/目录执行:

docker-compose -f docker-compose-lite.yml up -d

功能相同,适合显存和内存吃紧的机器。

用 50 系显卡?换专用配置

RTX 50 系(官方按 5090 测试通过)需要新版 CUDA 环境,deploy/目录里专门放了一份配置文件:

docker-compose -f docker-compose-5090.yml up -d

30、40 系显卡如果也升级到了 CUDA 12.8,同样可以用这份配置。所有配置文件都在 deploy 目录 下,打开就是能看懂的 YAML。

想做批量或集成?直接调开放 API

服务端启动后会在本机开放几个端口,你不需要经过界面就能调用,适合做批量生成或嵌进自己的系统:

  • 视频合成:向http://127.0.0.1:8383/easy/submit提交音频加视频路径,拿回一个任务码,再用http://127.0.0.1:8383/easy/query?code=任务码轮询进度。
  • 声音克隆与合成:http://127.0.0.1:18180上的接口,先对参考音频做预处理,再把文本合成成指定音色的语音。

请求参数和返回格式不用猜,客户端调用这些接口的代码就是现成示例,在 src/main/service/ 目录下按 model.js、video.js、voice.js 三个文件对着看即可。

本地部署最常见的 3 个坑,以及自诊办法

坑一:docker-compose 拉镜像失败,报 request canceled / connection refused

这是新手遇到最多的问题,根因是 Docker Hub 官方源连不上。解决办法是给 Docker 配国内镜像加速。Linux 用户在/etc/docker/daemon.json里加一段registry-mirrors配置即可:

Windows 用户同样在 Docker Desktop 的设置面板里编辑对应的 JSON 配置文件,改完重启 Docker 再重新执行docker-compose up -d。镜像源会随时间失效,配之前搜一下当前可用的地址。

坑二:创建数字人报错,其实是上传的视频不对

如果提交模特视频后失败,先检查素材:视频必须带声音、且画面里的人在说话。声音是克隆音色的原料,视频无声或只有背景音乐,训练必然失败。重录一段口播视频再传即可。

坑三:训练时报 Connection refused(连接被拒绝)

这个错的意思是某个后端服务没跑起来,去 Docker 里确认三个服务的状态,把挂掉的那个重启。如果反复重启仍失败,多半是显卡驱动问题——用nvidia-smi验证驱动是否正常输出显卡信息。真实的服务日志长这样,看到红色报错行基本就能定位到是哪个环节:

问题查不出来的自诊顺序

  1. 看三个服务是否全部 Running,任何一个异常先修它。
  2. 确认有 NVIDIA 显卡且nvidia-smi能正常显示,驱动不是一切的前提。
  3. 把服务端和客户端都更新到最新版本,社区更新频繁,你的问题可能已经修了。
  4. 翻一遍 常见问题文档,里面按现象整理了报错和对应解法。

提问前顺手把两边的日志各留一份:客户端在右上角设置点 "Open Log",日志文件在用户目录的 heygem.ai/logs 里:

服务端日志直接在 Docker Desktop 里点开对应容器,右侧复制按钮一键导出:

收尾:部署完成,下一步做什么

到这里,你已经有了一个完全离线、可反复使用的数字人产线:一段 10 秒视频换一个人,一句话换一条口播视频。建议下一步这样做——先用 lite 配置验证全流程,再录一段 30 秒、语速平稳、光线均匀的素材练手,最后按需接入 API 做批量生成。硬件、配置、API 与排错的细节,随时回看 deploy 目录 和 常见问题文档。

【免费下载链接】Duix-Avatar🚀 Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询