30分钟跑通本地文本转语音:VoxCPM 声音克隆实操教程
【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM
给短视频配旁白、把小说稿读成播客,或者用家人的声音录一段语音留言,这些场景都需要先把文字变成自然的语音。VoxCPM 是一款免费开源的本地文本转语音工具,支持多语言语音合成、声音克隆和声音设计,装好 Python 环境后十几分钟就能在自己电脑上生成第一条音频。
本地文本转语音怎么实现:VoxCPM 的输入与输出
VoxCPM 的工作方式可以一句话讲清:输入一段文字(可选地再配一段参考音频或一句声音描述),模型在本地完成全部计算,输出一个 48kHz 的 wav 音频文件。它采用无 tokenizer 的扩散自回归架构,直接生成连续语音表示,不经过离散语音 token,这是它听起来比传统 TTS 更自然的原因。整个过程数据不出本机,音频文件留在本地。最新版本 VoxCPM2 参数量 2B,支持 30 种语言和多种中文方言,提供声音设计、可控克隆、极致克隆三种模式。
从安装到首次跑通:VoxCPM 本地部署完整流程
这一节按顺序做四步,每步都有明确的成功标志,做完第四步就能在网页上生成语音。
安装 voxcpm 并确认命令可用
做什么:安装 Python 包,确认命令行工具在 PATH 中。要求 Python 3.10–3.12、PyTorch 2.5 以上,用 NVIDIA 显卡还需要 CUDA 12 及以上。
pip install voxcpm voxcpm --help成功标志:终端打印出帮助信息,能看到 design、clone、batch 等子命令。
用 design 命令生成第一段合成语音
做什么:不依赖任何参考音频,用一句话描述想要的音色,把文字合成语音。--control 参数控制音色、语气和语速。
voxcpm design \ --text "你好,这是用 VoxCPM 合成的第一条语音。" \ --control "年轻女声,语气自然,语速适中" \ --output hello.wav成功标志:终端输出 Saved audio to: hello.wav 和音频时长,打开 hello.wav 能正常播放。首次运行会自动下载模型权重,需要额外等几分钟。
用参考音频克隆一个声音
做什么:准备一段 3–10 秒、背景干净的人声 wav 作为参考,让模型用这个音色朗读新文本。仓库自带示例音频 examples/reference_speaker.wav,克隆仓库后可直接用来测试。
voxcpm clone \ --text "这是一段声音克隆效果测试。" \ --reference-audio examples/reference_speaker.wav \ --output clone.wav成功标志:生成的 clone.wav 音色与参考音频接近,而不是随机音色。
启动网页版界面生成语音
做什么:不想敲命令的话,用仓库自带的 Gradio 页面,在浏览器里填文本、上传参考音频即可。依赖在上一步已装好,直接运行:
git clone https://gitcode.com/GitHub_Trending/vo/VoxCPM cd VoxCPM python app.py --port 8808成功标志:浏览器打开 http://localhost:8808,页面出现声音描述、参考音频上传和待合成文本三个区域。Apple Silicon 的 Mac 可加 --device auto 自动走 MPS。
声音设计、可控克隆与极致克隆怎么选
声音设计适合"手上没有任何参考音频"的情况:操作路径是在 --control 里写清性别、年龄、语气,比如"低沉的中年男声,语速偏慢";得到的结果是一个符合描述的全新音色,不满意可以换 --seed 多生成几次对比。
可控克隆适合"用自己或同事的声音配音":操作路径是 --reference-audio 提供音色、--control 指定情绪和语速;得到的结果是保留原音色、说话风格却可以按需调整。有用户用它把项目周报念成语音版,再叠加"稍快、轻松一点"的描述,效果接近真人改口重录。
极致克隆适合"相似度优先":操作路径是同时给 --prompt-audio(参考音频)和 --prompt-text(这段音频对应的文字内容),模型把它当作已说出的前文往下续写;得到的结果是最接近参考音频的延续,音色、节奏、情绪都尽量还原。
| 模式 | 需要准备 | 适用场景 | 得到的结果 |
|---|---|---|---|
| 声音设计 | 一句声音描述 | 从零创造旁白、角色音 | 符合描述的全新音色 |
| 可控克隆 | 一段参考音频 | 用指定音色配音,需调情绪语速 | 原音色 + 描述里的风格 |
| 极致克隆 | 参考音频 + 其文字内容 | 相似度优先、同风格续写 | 最接近参考音频的延续 |
下图是早期版本 VoxCPM 的架构示意,VoxCPM2 在同样的管线上扩展了多语言与声音设计能力:
两个顺手的扩展:给每个字打时间戳,在生成命令后加 --timestamps(需先执行 pip install "voxcpm[timestamps]");想长期固定某个音色,则可以用 5–10 分钟音频做 LoRA 微调,配置模板见仓库 conf/voxcpm_v2/ 目录。
生成失败或报错时的自查步骤
第一次运行长时间卡在模型下载。
- 确认网络能否访问模型仓库,公司内网一般要走代理
- 也可先 pip install modelscope,用 snapshot_download 把权重下到本地,再用 --model-path 指向本地目录
- 确认磁盘剩余空间足够,2B 模型权重有几个 GB
- 仍不行时:换一台外网正常的机器把权重整目录下载好,拷过来后用 --model-path 指向它
clone 命令报参数错误,如 --prompt-audio requires --prompt-text。
- 极致克隆的 --prompt-audio 必须和 --prompt-text(或 --prompt-file)成对出现
- 只做音色克隆时只带 --reference-audio,不要混入 --prompt-* 参数
- --control 与 --prompt-text 互斥,同一命令里不要混用
- 仍不行时:先跑只带 --reference-audio 的最简 clone 命令验证流程,确认通了再逐个加参数
显存不足或 CPU 上生成太慢。
- VoxCPM2 大约需要 8GB 显存,先关掉其他占显存的程序
- CPU 运行时把 --inference-timesteps 调低(推荐范围 4–30,越小越快)
- 仍不行时:换参数更小的 VoxCPM1.5,显存需求约 6GB
跑完上面的流程,对照确认一下:
- voxcpm --help 能看到 design、clone、batch 子命令
- voxcpm design 生成了一条能正常播放的 wav
- voxcpm clone 用参考音频产出了音色接近的克隆语音
接下来日常用法就是替换文本和参考音频;等想固定某个音色时,再去动 conf/voxcpm_v2/ 里的微调配置。
【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考