☰
FireRedTTS3零样本语音克隆入门教程:仅用参考音频,无需微调复刻声音
2026/10/11 18:04:10 网站建设 项目流程

【免费下载链接】FireRedTTS3

FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing

项目地址:https://gitcode.com/gh_mirrors/fi/FireRedTTS3
点击查看免费下载

FireRedTTS3 是一款开箱即用的零样本语音克隆系统:无需任何微调训练,只需一段几秒的参考音频,就能用目标说话人的声音朗读 24 种语言、21 种中文方言的文本。它还提供指令式音色设计与自由语音编辑能力,是新手快速上手多语种语音克隆的完整指南。

零样本语音克隆:FireRedTTS3 能做什么?

零样本语音克隆(Zero-Shot Voice Cloning)指不训练、不微调,仅凭一段参考音频(prompt audio)即可"借用"说话人的音色、语调和节奏来合成新语音。FireRedTTS3 在这一点上做到了:

  • 🌍多语言:支持阿拉伯语、中文、英语、日语、韩语、法语、德语、俄语、西语等 24 种语言
  • 🗣️多方言:覆盖川渝、吴语、闽南、粤语、山东、上海等 21 种中文方言
  • ✂️语音编辑:用自然语言指令对已有音频做插入、删除、替换,或调整语速、音高、音量
  • 🎨音色设计:不用参考音频,仅凭一句"年轻女性的温柔嗓音"描述就能生成全新声音

官方评测中,FireRedTTS3-Base 在 Seed-TTS-eval 上的平均说话人相似度达78.8%,多语种克隆 WER/CER 平均仅3.75%,均为同类最佳水平。

准备工作:FireRedTTS3 安装步骤

一键克隆代码仓库

git clone https://gitcode.com/gh_mirrors/fi/FireRedTTS3 cd FireRedTTS3

安装依赖

依赖清单见 requirements.txt,包含 PyTorch 2.8、transformers、wetext 等:

pip install -r requirements.txt

下载预训练模型

两种方式任选其一(模型约几百 MB 级,请耐心等待):

# 方式一:Hugging Face pip install "huggingface_hub[cli]" hf download FireRedTeam/FireRedTTS3 --local-dir pretrained_models/ # 方式二:ModelScope(国内网络更友好) pip install modelscope modelscope download --model FireRedTeam/FireRedTTS3 --local_dir pretrained_models/

最快上手方式:Gradio 网页界面

对新手最友好的方式是直接打开官方 Gradio 演示界面,无需写一行代码:

pip install gradio python gradio_base.py --host "0.0.0.0" --port 7860

浏览器访问http://0.0.0.0:7860即可进入界面,核心操作只有三步:

  1. 选择语言/方言(如 Chinese 中文)
  2. 上传参考音频(Prompt Audio)并填写音频对应的文字转录
  3. 输入要合成的文本,点击Generate Speech生成语音

左侧为 Base 语音克隆界面,右侧为 Instruct 音色设计与语音编辑界面。入口脚本分别是 gradio_base.py 和 gradio_instruct.py。

Python API 调用:三行代码生成克隆语音

若要在自己的项目中集成,核心合成管线位于 fireredtts3/core.py,最简用法如下:

from fireredtts3.core import FireRedTTS3 import torchaudio tts = FireRedTTS3("pretrained_models", use_wetext=True) prompt_audio, prompt_audio_sr = torchaudio.load("prompt.wav") gen_audio, gen_audio_sr = tts.generate( language=None, # None 表示自动检测语言 prompt_text="参考音频对应的文字", prompt_audio=prompt_audio, prompt_audio_sr=prompt_audio_sr, text="今天天气很好,我们一起去公园散步吧。", ) torchaudio.save("gen.wav", gen_audio, gen_audio_sr)

完整的 API 示例(含方言标签、Instruct 接口)可参考 README.md 的 Quick Start 部分。

让克隆效果更逼真的 5 个技巧

  1. 参考音频与目标语言一致:合成日语就用日语参考音频,合成四川话就用四川话参考音频——输出会继承参考音频的说话风格。
  2. 选择干净录音:参考音频尽量无人声背景噪音、无音乐,时长 3~10 秒即可,过长容易引入杂音。
  3. 准确填写 Prompt Transcription:参考音频的文字转录越准确,克隆效果越稳定。
  4. 明确指定语言:language参数支持Chinese、ZH_Sichuan(川渝方言)等标签,明确指定优于自动检测。
  5. 调节随机种子与 CFG:Gradio 界面中的 Random seed 与 CFG guidance scale 可改变生成的自然度,同一文本可多试几次挑选最像的一版。

进阶玩法:FireRedTTS3-Instruct 语音设计与编辑

除克隆外,Instruct 模型用一句自然语言指令驱动三种高级能力(接口在 fireredtts3/llm/fireredtts3_instruct.py):

能力指令示例说明
音色设计"一个年轻女性的温柔嗓音,语速稍慢"无需参考音频,生成全新音色
语义编辑"Replace 'cats' with 'dogs'"在保留原声音基础上改词
声学编辑"adjust the speed to 0.5x"调整语速 / 音高 / 音量

启动方式与 Base 相同:python gradio_instruct.py --port 7860。

合规使用提醒

零样本语音克隆能力仅限学术研究用途:请勿将其用于任何非法活动或冒用他人声音。如发现滥用行为,请及时向项目团队报告。

小结

你想做什么该看哪里
快速体验语音克隆Gradio 界面(gradio_base.py)
项目集成Python API(fireredtts3/core.py)
设计新音色 / 编辑音频Instruct 模型(gradio_instruct.py)
查看性能数据README.md Performance 章节

只需参考音频、无需微调,FireRedTTS3 让多语种、多方言的零样本语音克隆变得前所未有地简单。现在就可以动手,用几秒录音复刻出专属于你的声音。

【免费下载链接】FireRedTTS3

FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing

项目地址:https://gitcode.com/gh_mirrors/fi/FireRedTTS3
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询