5 秒录音克隆你的声音:OpenVoice 语音克隆从入门到跑通
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
AI 能直接用你的声音念稿吗?OpenVoice 是 MIT 和 MyShell 联合开源的即时语音克隆基础模型:上传几秒参考音频,它就能用这个声音说出新的文字,免训练,商用也免费。
免训练语音克隆:它到底能干 6 件事
- 即时克隆:几秒参考音频就能生成这个人的声音,全程不用训练
- 音色还原:忠实复现参考说话人的音色特征,越贴近真人录音越像本人
- 风格可控:情绪、口音、节奏、停顿、语调都能单独调,是这里头最实用的能力
- 多语言生成:V2 原生支持中、英、日、韩、西班牙语、法语 6 种语言
- 跨语言克隆:参考音频和要生成的文字可以不是同一种语言
- 免费商用:V1、V2 均采用 MIT 许可证,商用没有门槛
「风格可控 + 跨语言」是它跟普通文本转语音最大的差别:声音借自参考音频,语气则由参数决定。
最短体验路径:3 步听到克隆声音
先别急着装环境。MyShell 官方平台已经部署好了服务,用浏览器就能完成第一次体验。
- 登录 MyShell 官方平台,进入 Workshop 区域
- 点 Create a Bot 新建一个 Bot
- 在语音设置里选「通过语音克隆创建声音」,上传几秒参考音频
- 输入要朗读的文字,Bot 用克隆出来的声音开口
参考音频的要求不高:单人发声、背景干净、没有长段静音,质量比时长重要。
只想先听效果、暂时不克隆的话:进 Widget Center 选 TTS 分类,点开任意一个预置语音模型就能试听。
想本地跑、研究实现细节的话,往下看部署章节。
原理拆解:把音色和风格拆成两条线
OpenVoice 的核心思路是「解耦」。生成时,底层 TTS 模型先根据文本和风格参数(情绪、口音、节奏)合成一段基础语音;同时,音色提取器从你的参考音频里抽出音色特征。两者结合,得到的就是「参考者的音色 + 你指定的风格」——正因为拆开处理,它才既克隆得像、又调得动。
想翻代码的话,推理接口在 openvoice/api.py,音色特征提取在 openvoice/se_extractor.py。
本地部署:3 条命令跑起来 OpenVoice
想研究实现细节,或必须离线运行时才需要这一步,前提是有一台熟悉 Linux、Python 和 PyTorch 的机器。V1 和 V2 的安装方式相同,先建独立环境:
conda create -n openvoice python=3.9 conda activate openvoice然后克隆仓库装好依赖:
git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .再下载对应 checkpoint 解压到 checkpoints 目录,V2 还需额外安装 MeloTTS,完整步骤详见 docs/USAGE.md。
仓库里 3 个示例笔记本分别演示风格控制、跨语言克隆和 V2 用法,从 demo_part1.ipynb 开始按顺序跑,跨语言克隆在 demo_part2.ipynb。
落地场景:3 个最有画面感的用法
- 🎙️个性化语音助手:给智能设备配一条专属的固定声音,交互不再是「机器腔」
- 📚有声内容创作:用同一个克隆声音连载朗读小说和课程文稿,风格一集都不跑偏
- 🎬视频多语言配音:同一角色在中英文之间切换,音色保持一致,观众不觉得割裂
这 4 个坑先替你踩了
参考音频要多长?几秒就够,质量大于时长。先自查 4 件事:有无背景噪音、是否太短、是否混入多人声音、是否有长时间空白——效果差的大多是这 4 类问题。
为什么口音和情绪跟参考音频不一样?正常现象。OpenVoice 只克隆音色,口音和情绪由底层 TTS 模型决定;想要别的口音,换掉 base speaker 模型即可,框架支持替换。
可以商用吗?可以。V1、V2 均为 MIT 许可,商业和研究使用都免费。
效果不好先查什么?按顺序查参考音频:噪音、时长、人数、空白段。还不对就注意缓存——复用了之前的文件名,processed 目录里的旧结果可能还在生效,完整排查清单见 docs/QA.md。
接下来去哪儿
OpenVoice 自 2023 年 5 月起就支撑着 MyShell 平台的即时语音克隆,到 2023 年 11 月已被全球用户使用数千万次。想要一个克隆得准、调得动、还免费商用的开源项目,它就是目前最完整的选择之一。
- 从 docs/USAGE.md 开始,在线试听到本地部署都有
- 装好后按顺序跑示例:demo_part1.ipynb 风格控制,demo_part2.ipynb 跨语言克隆
- 遇到问题先翻 docs/QA.md
现在就可以去试试:上传一段 5 秒的干净录音,30 秒后你会听到自己的声音开口说话。
【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考