【免费下载链接】FireRedTTS3
FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing
FireRedTTS3 是一款开箱即用的零样本语音克隆系统:无需任何微调训练,只需一段几秒的参考音频,就能用目标说话人的声音朗读 24 种语言、21 种中文方言的文本。它还提供指令式音色设计与自由语音编辑能力,是新手快速上手多语种语音克隆的完整指南。
零样本语音克隆:FireRedTTS3 能做什么?
零样本语音克隆(Zero-Shot Voice Cloning)指不训练、不微调,仅凭一段参考音频(prompt audio)即可"借用"说话人的音色、语调和节奏来合成新语音。FireRedTTS3 在这一点上做到了:
- 🌍多语言:支持阿拉伯语、中文、英语、日语、韩语、法语、德语、俄语、西语等 24 种语言
- 🗣️多方言:覆盖川渝、吴语、闽南、粤语、山东、上海等 21 种中文方言
- ✂️语音编辑:用自然语言指令对已有音频做插入、删除、替换,或调整语速、音高、音量
- 🎨音色设计:不用参考音频,仅凭一句"年轻女性的温柔嗓音"描述就能生成全新声音
官方评测中,FireRedTTS3-Base 在 Seed-TTS-eval 上的平均说话人相似度达78.8%,多语种克隆 WER/CER 平均仅3.75%,均为同类最佳水平。
准备工作:FireRedTTS3 安装步骤
一键克隆代码仓库
git clone https://gitcode.com/gh_mirrors/fi/FireRedTTS3 cd FireRedTTS3安装依赖
依赖清单见 requirements.txt,包含 PyTorch 2.8、transformers、wetext 等:
pip install -r requirements.txt下载预训练模型
两种方式任选其一(模型约几百 MB 级,请耐心等待):
# 方式一:Hugging Face pip install "huggingface_hub[cli]" hf download FireRedTeam/FireRedTTS3 --local-dir pretrained_models/ # 方式二:ModelScope(国内网络更友好) pip install modelscope modelscope download --model FireRedTeam/FireRedTTS3 --local_dir pretrained_models/最快上手方式:Gradio 网页界面
对新手最友好的方式是直接打开官方 Gradio 演示界面,无需写一行代码:
pip install gradio python gradio_base.py --host "0.0.0.0" --port 7860浏览器访问http://0.0.0.0:7860即可进入界面,核心操作只有三步:
- 选择语言/方言(如 Chinese 中文)
- 上传参考音频(Prompt Audio)并填写音频对应的文字转录
- 输入要合成的文本,点击Generate Speech生成语音
左侧为 Base 语音克隆界面,右侧为 Instruct 音色设计与语音编辑界面。入口脚本分别是 gradio_base.py 和 gradio_instruct.py。
Python API 调用:三行代码生成克隆语音
若要在自己的项目中集成,核心合成管线位于 fireredtts3/core.py,最简用法如下:
from fireredtts3.core import FireRedTTS3 import torchaudio tts = FireRedTTS3("pretrained_models", use_wetext=True) prompt_audio, prompt_audio_sr = torchaudio.load("prompt.wav") gen_audio, gen_audio_sr = tts.generate( language=None, # None 表示自动检测语言 prompt_text="参考音频对应的文字", prompt_audio=prompt_audio, prompt_audio_sr=prompt_audio_sr, text="今天天气很好,我们一起去公园散步吧。", ) torchaudio.save("gen.wav", gen_audio, gen_audio_sr)完整的 API 示例(含方言标签、Instruct 接口)可参考 README.md 的 Quick Start 部分。
让克隆效果更逼真的 5 个技巧
- 参考音频与目标语言一致:合成日语就用日语参考音频,合成四川话就用四川话参考音频——输出会继承参考音频的说话风格。
- 选择干净录音:参考音频尽量无人声背景噪音、无音乐,时长 3~10 秒即可,过长容易引入杂音。
- 准确填写 Prompt Transcription:参考音频的文字转录越准确,克隆效果越稳定。
- 明确指定语言:
language参数支持Chinese、ZH_Sichuan(川渝方言)等标签,明确指定优于自动检测。 - 调节随机种子与 CFG:Gradio 界面中的 Random seed 与 CFG guidance scale 可改变生成的自然度,同一文本可多试几次挑选最像的一版。
进阶玩法:FireRedTTS3-Instruct 语音设计与编辑
除克隆外,Instruct 模型用一句自然语言指令驱动三种高级能力(接口在 fireredtts3/llm/fireredtts3_instruct.py):
| 能力 | 指令示例 | 说明 |
|---|---|---|
| 音色设计 | "一个年轻女性的温柔嗓音,语速稍慢" | 无需参考音频,生成全新音色 |
| 语义编辑 | "Replace 'cats' with 'dogs'" | 在保留原声音基础上改词 |
| 声学编辑 | "adjust the speed to 0.5x" | 调整语速 / 音高 / 音量 |
启动方式与 Base 相同:python gradio_instruct.py --port 7860。
合规使用提醒
零样本语音克隆能力仅限学术研究用途:请勿将其用于任何非法活动或冒用他人声音。如发现滥用行为,请及时向项目团队报告。
小结
| 你想做什么 | 该看哪里 |
|---|---|
| 快速体验语音克隆 | Gradio 界面(gradio_base.py) |
| 项目集成 | Python API(fireredtts3/core.py) |
| 设计新音色 / 编辑音频 | Instruct 模型(gradio_instruct.py) |
| 查看性能数据 | README.md Performance 章节 |
只需参考音频、无需微调,FireRedTTS3 让多语种、多方言的零样本语音克隆变得前所未有地简单。现在就可以动手,用几秒录音复刻出专属于你的声音。
【免费下载链接】FireRedTTS3
FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing
相关推荐
零样本语音克隆原理拆解:为什么5秒音频就能复刻声线
零样本语音克隆原理拆解:为什么5秒音频就能复刻声线 传统语音克隆有两条公认的路:要么在预训练模型里从有限说话人中选择固定音色,要么为每个新说话人收集数分钟乃至数
零样本语音克隆革命:用Spark-TTS一键复刻明星声线
零样本语音克隆革命:用Spark TTS一键复刻明星声线 你是否还在为TTS语音千篇一律而苦恼?是否渴望让AI用特定明星的嗓音播报新闻,用企业知名人士的语调讲解
人工智能语音音频大模型模型推理服务Uvicorn请求ID跟踪:分布式系统中的日志关联技术
Uvicorn请求ID跟踪:分布式系统中的日志关联技术 在现代分布式系统中,快速定位和解决问题变得越来越复杂。当请求在多个服务之间流转时,如何准确追踪每一个请求
后端Web框架
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考