GSVI:三步接入零样本文本转语音推理插件
2026/8/22 8:43:18 网站建设 项目流程

GSVI:三步接入零样本文本转语音推理插件

【免费下载链接】GPT-SoVITS-InferenceInference Specialization项目地址: https://gitcode.com/gh_mirrors/gp/GPT-SoVITS-Inference

GSVI(GPT-SoVITS Inference Plugin)是基于 GPT-SoVITS 的文本转语音(TTS)推理插件,只做推理、不做训练。它把角色模型与情感参考封装成简单 API,面向想快速集成零样本语音合成、TTS 推理接口的开发者。

🚀 30 秒上手

三步跑起来:

  1. git clone https://gitcode.com/gh_mirrors/gp/GPT-SoVITS-Inference
  2. 安装依赖:Linux 执行bash install.sh;Windows 可用预打包版,或pip install -r requirements.txt
  3. 把角色模型文件夹放进trained/目录,运行app.py,或直接双击「0 一键启动脚本」里的启动脚本打开 Gradio 界面

核心能力

角色文件夹即插即用

每个角色就是一个文件夹:一份.ckpt/.pth模型文件,加上一条以参考文本命名的参考音频。丢进trained/后界面自动扫描出角色列表,无需改任何配置。「增加一个声音」从改配置变成复制粘贴。

一个 API 切换角色与情感

后端暴露 REST 接口:先查/character_list拿到各角色支持的情感列表,再调/tts,用characteremotionspeedstream几个参数指定声音与语气,返回音频;开启流式后逐句返回。把你的产品接上语音,只需一次 HTTP 请求,接口细节见api_doc.md

可插拔的 TTS 推理引擎

Synthesizers/目录下,本地 GPT-SoVITS 引擎与远程引擎基于同一个抽象基类实现,改一行配置即可切换,前端界面不变。需要把推理挪到另一台 GPU 机器时,只需换成远程引擎。

谁适合用

  • 游戏配音:给多个角色稳定声音,并按情感分层
  • SillyTavern 类互动工具:用角色列表加情感参数做对话语音
  • 播客、视频创作:批量生成旁白,参数调速、流式输出

不适用:官方明确不推荐用它训练;角色音色依赖现成模型文件,只靠一段参考音频无法克隆新音色;Mac 环境走 CPU 推理,效果与速度受限。

收尾

克隆仓库、放一个角色文件夹,10 分钟内听到第一段零样本语音。

【免费下载链接】GPT-SoVITS-InferenceInference Specialization项目地址: https://gitcode.com/gh_mirrors/gp/GPT-SoVITS-Inference

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询