30分钟跑通本地文本转语音:VoxCPM 声音克隆实操教程
2026/9/1 13:31:29 网站建设 项目流程

30分钟跑通本地文本转语音:VoxCPM 声音克隆实操教程

【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM

给短视频配旁白、把小说稿读成播客,或者用家人的声音录一段语音留言,这些场景都需要先把文字变成自然的语音。VoxCPM 是一款免费开源的本地文本转语音工具,支持多语言语音合成、声音克隆和声音设计,装好 Python 环境后十几分钟就能在自己电脑上生成第一条音频。

本地文本转语音怎么实现:VoxCPM 的输入与输出

VoxCPM 的工作方式可以一句话讲清:输入一段文字(可选地再配一段参考音频或一句声音描述),模型在本地完成全部计算,输出一个 48kHz 的 wav 音频文件。它采用无 tokenizer 的扩散自回归架构,直接生成连续语音表示,不经过离散语音 token,这是它听起来比传统 TTS 更自然的原因。整个过程数据不出本机,音频文件留在本地。最新版本 VoxCPM2 参数量 2B,支持 30 种语言和多种中文方言,提供声音设计、可控克隆、极致克隆三种模式。

从安装到首次跑通:VoxCPM 本地部署完整流程

这一节按顺序做四步,每步都有明确的成功标志,做完第四步就能在网页上生成语音。

安装 voxcpm 并确认命令可用

做什么:安装 Python 包,确认命令行工具在 PATH 中。要求 Python 3.10–3.12、PyTorch 2.5 以上,用 NVIDIA 显卡还需要 CUDA 12 及以上。

pip install voxcpm voxcpm --help

成功标志:终端打印出帮助信息,能看到 design、clone、batch 等子命令。

用 design 命令生成第一段合成语音

做什么:不依赖任何参考音频,用一句话描述想要的音色,把文字合成语音。--control 参数控制音色、语气和语速。

voxcpm design \ --text "你好,这是用 VoxCPM 合成的第一条语音。" \ --control "年轻女声,语气自然,语速适中" \ --output hello.wav

成功标志:终端输出 Saved audio to: hello.wav 和音频时长,打开 hello.wav 能正常播放。首次运行会自动下载模型权重,需要额外等几分钟。

用参考音频克隆一个声音

做什么:准备一段 3–10 秒、背景干净的人声 wav 作为参考,让模型用这个音色朗读新文本。仓库自带示例音频 examples/reference_speaker.wav,克隆仓库后可直接用来测试。

voxcpm clone \ --text "这是一段声音克隆效果测试。" \ --reference-audio examples/reference_speaker.wav \ --output clone.wav

成功标志:生成的 clone.wav 音色与参考音频接近,而不是随机音色。

启动网页版界面生成语音

做什么:不想敲命令的话,用仓库自带的 Gradio 页面,在浏览器里填文本、上传参考音频即可。依赖在上一步已装好,直接运行:

git clone https://gitcode.com/GitHub_Trending/vo/VoxCPM cd VoxCPM python app.py --port 8808

成功标志:浏览器打开 http://localhost:8808,页面出现声音描述、参考音频上传和待合成文本三个区域。Apple Silicon 的 Mac 可加 --device auto 自动走 MPS。

声音设计、可控克隆与极致克隆怎么选

声音设计适合"手上没有任何参考音频"的情况:操作路径是在 --control 里写清性别、年龄、语气,比如"低沉的中年男声,语速偏慢";得到的结果是一个符合描述的全新音色,不满意可以换 --seed 多生成几次对比。

可控克隆适合"用自己或同事的声音配音":操作路径是 --reference-audio 提供音色、--control 指定情绪和语速;得到的结果是保留原音色、说话风格却可以按需调整。有用户用它把项目周报念成语音版,再叠加"稍快、轻松一点"的描述,效果接近真人改口重录。

极致克隆适合"相似度优先":操作路径是同时给 --prompt-audio(参考音频)和 --prompt-text(这段音频对应的文字内容),模型把它当作已说出的前文往下续写;得到的结果是最接近参考音频的延续,音色、节奏、情绪都尽量还原。

模式需要准备适用场景得到的结果
声音设计一句声音描述从零创造旁白、角色音符合描述的全新音色
可控克隆一段参考音频用指定音色配音,需调情绪语速原音色 + 描述里的风格
极致克隆参考音频 + 其文字内容相似度优先、同风格续写最接近参考音频的延续

下图是早期版本 VoxCPM 的架构示意,VoxCPM2 在同样的管线上扩展了多语言与声音设计能力:

两个顺手的扩展:给每个字打时间戳,在生成命令后加 --timestamps(需先执行 pip install "voxcpm[timestamps]");想长期固定某个音色,则可以用 5–10 分钟音频做 LoRA 微调,配置模板见仓库 conf/voxcpm_v2/ 目录。

生成失败或报错时的自查步骤

第一次运行长时间卡在模型下载。

  • 确认网络能否访问模型仓库,公司内网一般要走代理
  • 也可先 pip install modelscope,用 snapshot_download 把权重下到本地,再用 --model-path 指向本地目录
  • 确认磁盘剩余空间足够,2B 模型权重有几个 GB
  • 仍不行时:换一台外网正常的机器把权重整目录下载好,拷过来后用 --model-path 指向它

clone 命令报参数错误,如 --prompt-audio requires --prompt-text。

  • 极致克隆的 --prompt-audio 必须和 --prompt-text(或 --prompt-file)成对出现
  • 只做音色克隆时只带 --reference-audio,不要混入 --prompt-* 参数
  • --control 与 --prompt-text 互斥,同一命令里不要混用
  • 仍不行时:先跑只带 --reference-audio 的最简 clone 命令验证流程,确认通了再逐个加参数

显存不足或 CPU 上生成太慢。

  • VoxCPM2 大约需要 8GB 显存,先关掉其他占显存的程序
  • CPU 运行时把 --inference-timesteps 调低(推荐范围 4–30,越小越快)
  • 仍不行时:换参数更小的 VoxCPM1.5,显存需求约 6GB

跑完上面的流程,对照确认一下:

  • voxcpm --help 能看到 design、clone、batch 子命令
  • voxcpm design 生成了一条能正常播放的 wav
  • voxcpm clone 用参考音频产出了音色接近的克隆语音

接下来日常用法就是替换文本和参考音频;等想固定某个音色时,再去动 conf/voxcpm_v2/ 里的微调配置。

【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询