10秒克隆声音:OpenVoice 语音克隆免训练上手指南
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
OpenVoice 是 MIT 与 MyShell 开源的免训练语音克隆工具,一段 10 秒人声参考,就能用这个音色朗读你写的文字,MIT 许可免费可商用。全程不用标注、不用训练。
🎧 跑通后你能听到什么:3 分钟出第一版
跑通后你手里会有三样东西:一段参考音频、输出目录里新生成的克隆音频、以及一份可改的参数脚本。录一段 10 秒左右的参考音频,装好依赖,跟着 demo 单元格逐步执行,大约 3 分钟就能听到第一版输出。
产物形态:输入是你的人声,输出是同一音色念出目标文本的音频。想改语速、情绪、停顿,改参数再跑一次就行。
🔬 免训练语音克隆原理:音色和词是两路信号
把一句话拆开看,其实是两条独立信号:一条装着"说了什么",即文字内容和语言;另一条装着"谁在说",即音色。OpenVoice 的音色提取器只干一件事——从参考音频里把"谁在说"这层摘出来,再贴到任意 TTS 合成的语音上。
打个比方:像把一个人说话的声纹当成一种专属墨色。你用这支墨笔写任何文章、换任何语言,字怎么写由你定,墨色始终是那个人的。配合 IPA 对齐保证发音位置准确,内容语言随便换,音色不换人。架构如下图:
🧰 开工前备齐环境与材料
环境要求:Linux 系统、Python 3.9、PyTorch。版本怎么选:V1 功能齐,跑基础流程够用;V2 音质更好,且原生支持中、英、日、法、西、韩 6 种语言,参考音频是中文也能说英语,但要额外装 MeloTTS 依赖。
材料清单,三项:
- 一段 10 秒参考音频:单人、干净、无长静音,语言不限
- 对应版本的 checkpoint 压缩包,解压到
checkpoints或checkpoints_v2目录 - 示例脚本:demo_part1.ipynb、demo_part2.ipynb、demo_part3.ipynb
版本和 checkpoint 的对应关系、MeloTTS 安装细节,都在 docs/USAGE.md 里。
⌨️ 10 秒克隆声音:从装环境到出音
- 建环境并安装:
conda create -n openvoice python=3.9 git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice && pip install -e .- 把 checkpoint 解压到指定目录(V2 解压到
checkpoints_v2) - 打开
demo_part1.ipynb,从加载 converter 开始逐步执行:提取参考音色 → 合成语音 → 应用音色,听到音频即成功 - 想要本地网页版界面,另开终端运行:
python -m openvoice_app --share🌐 多语言TTS合成能用在哪,又卡在哪
| 场景 | 状态 |
|---|---|
| 给 AI 助手换上自己的音色 | 可用,10 秒录音一次搞定 |
| 一份中文录音,多语言输出(V2 六语言) | 可用,不用每种语言重新配音 |
| 课程、内容批量配音,单独调情绪、语速、停顿 | 可用 |
| 游戏角色、产品原型快速试音 | 可用,先克隆个"够用"的声音 |
| 克隆参考音频的口音和情绪 | 不行,只克隆音色,口音情绪由底座 TTS 决定 |
| 多人嘈杂、带长静音的参考音频 | 不行,需要干净的单人录音 |
🩺 卡点自查:安装、效果、资源
按出现顺序排,先自查再求助:
- 安装报错:先核对 Python 是不是 3.9、PyTorch 版本是否匹配,再重跑
pip install -e . - 生成音质差:换一段干净、单人、无长静音的参考音频;同名文件重跑时记得删掉
processed缓存目录 - 显存或内存吃紧:缩小处理批次,或先跑在线 demo 验证思路,再上本地
- 其余高频问题,官方问答 docs/QA.md 有整理
下一步
打开 demo_part1.ipynb 从头跑到尾,听到第一段克隆音频,再回头按需换语言、调风格参数。
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考