AI 声音克隆怎么远程用?从本地推理到带密码的公网 WebUI
前言
我一直觉得,声音克隆最容易让人产生错觉的地方,是看到一段参考音频就以为后面的事情都能自动完成。真正动手以后,先要弄清楚整合包适配哪种显卡、文件放在哪个目录、启动页和推理页是不是同一个端口;生成出音频,还要能找到文件、试听比较,才能判断效果是否符合预期。Index-TTS 这类零样本文本转语音工具,吸引我的正是可以用少量参考音频尝试指定音色,不必先为某个声音单独训练一套模型。拿来做自己的配音实验很方便,但参考声音的使用授权和生成内容的用途也得先想清楚。
这次使用 Windows 整合包来走完整流程:按显卡和系统选择包,用 7-Zip 解压到不含中文、空格和特殊字符的路径,通过run.ps1启动,先打开9874的入口,再进入9872的 TTS 推理 WebUI。我会把参考音频放进WORKSPACE/source,生成后分别从页面和工作目录查看结果,并保留原音频、生成音频的试听对比。局域网使用没问题后,再安装 Windows 版 cpolar,把推理端口9872映射出去,先测试随机域名,再使用固定二级子域名indextts,最后给公网入口加授权验证。这样得到的是一套可远程操作的本地推理服务,而不是把模型计算搬到云端。
1. Index-TTS 能做什么,先弄清它需要什么
Index-TTS 是零样本文本转语音(TTS)系统。简单说,给它一段有使用权限的参考音频,再输入希望朗读的文本,就可以尝试沿用参考音频的音色生成语音。项目介绍强调可控性、合成效率和中英文等语言能力,也将语速、音调、情感等维度列为可控制的方向。
我更看重的不是“复制任何人的声音”这种说法,而是能否把参考音频、文本和生成结果放在一条容易重复操作的流程中。公开视频、影视素材或他人的声音并不因为技术上能提取就自动获得克隆和传播授权;实际制作与分享时,应先确认许可。
2. Windows 整合包的硬件条件
开源代码手动部署需要准备运行环境。这里选择由@宇宙重女库瓦特罗、@心空 12138制作的整合包,减少初次安装时反复配依赖的工作量。整合包也要按系统和硬件选择,不能拿一个 Windows 包通用到所有设备。
NVIDIA 50 系显卡、AMD 显卡和 Mac 需要下载各自的专用整合包;Mac 专用包仅限 M 芯片。
| 硬件/软件类别 | 最低要求 | 推荐配置 | 说明 |
|---|---|---|---|
| 操作系统 | Windows 10 | Windows 11 | 确保系统已安装最新的系统更新和驱动程序 |
| 显卡类型 | NVIDIA 显卡 | NVIDIA 显卡 | 必须支持 CUDA |
| 显存容量 | 6GB | 8GB 或更高 | 显存越大,处理速度越快 |
| 显卡型号 | GTX 1060 6GB | RTX 3060 及以上 | 推荐 RTX 系列以获得更好性能 |
| 处理器 | Intel i5 / AMD Ryzen 5 | Intel i7 / AMD Ryzen 7 | 多核心处理器有助于提升性能 |
| 内存(RAM) | 8GB | 16GB 或更高 | 内存不足可能导致程序崩溃 |
| 存储空间 | 10GB 可用空间 | 20GB 可用空间 | 用于安装和运行,模型文件较大 |
| 网络速度 | 2MB/s | 5MB/s 或更高 | 首次运行需要下载模型文件 |
没有独立显卡也可以尝试 CPU 推理,但速度可能很慢。首次启动可能自动下载模型文件,等待时间会受到网络和文件大小影响;运行时尽量关掉其他明显占用显存的程序。这些是选择整合包和启动时的环境参考,具体体验仍需以自己的机器为准。
3. 下载整合包,先用 7-Zip 正确解压
进入整合包获取页面,选择 Windows 对应的版本。
准备7-Zip,用它解压下载的文件。Windows 11 如果在右键菜单里没看到 7-Zip,可以先点“显示更多选项”。这套整合包特别要求使用 7-Zip,以免其他解压方式造成文件缺失或损坏。
另一个容易在启动前就踩中的点是路径。解压目录不要包含中文、空格或特殊字符。比如D:\AI工具\IndexTTS\index-tts-test不符合这里的路径要求,示例使用:
D:\AI\IndexTTS\index-tts-test
进入解压后的文件夹,找到run.ps1,右键选择“使用 PowerShell 运行”。
4. 先看启动窗口,再进入 9874
运行脚本以后会弹出 PowerShell 窗口。若出现 Python 防火墙许可提示,按实际环境允许对应访问。控制台出现乱码时,可以结合页面是否继续启动判断,不要只看几行乱码就认定程序没起来。
稍等片刻,浏览器会自动打开整合包入口:
这里先记住9874是整合包入口,不是后面直接映射的 TTS 推理 WebUI 端口。两个页面要是混为一谈,公网隧道很容易配错。
5. 从整合包入口打开 TTS 推理 WebUI
在页面里点击1-TTS推理,再点打开TTS推理WebUI。
这时才进入实际上传参考音频、输入文本和生成语音的地方。先把本地推理走通,再考虑外网访问,出现问题时也能分清是生成服务还是网络入口。
6. 参考音频放进 WORKSPACE/source
准备好具有使用权限的参考音频,放进工作目录。这里使用的示例路径是:
D:\AI\IndexTTS\index-tts-test\WORKSPACE\source\灵笼-白月魁音频素材位于WORKSPACE下的source目录。
把路径准备好以后回到推理页面,按界面选择素材和文本。
点击“刷新文本”,滚动到页面下方,上传原素材参考音频,最后点击生成音频。
我习惯先检查参考文件、文本和输出入口,再点生成;如果出来的声音不合适,至少知道自己送进去的是哪段素材。
7. 听一遍结果,也看看文件落在哪里
生成完成后,可以直接点播放按钮试听,也可以下载文件。
生成后的音频还能从工作目录找到。
下面保留一组原素材和生成结果的试听。示例使用的是“灵笼-白月魁”的 43 秒分离人声;它适合帮助理解对照方法,不应据此推断所有参考音频都能得到同样的相似度。
克隆后的音频文件:
这一步的验证不止是“生成按钮能点”。页面能播放、文件能下载、工作目录能找到结果,才算本地操作真正收尾。
8. 远程使用之前,先分清 9874 和 9872
在本机使用时,整合包入口可以从打开;推理 WebUI 对应的是9872。如果人在外面,需要打开的是实际推理界面,所以后面的 cpolar 隧道映射9872。
网络入口只让外部设备连到本地运行的 WebUI,语音生成仍在运行 Index-TTS 的电脑上完成。本机需要保持开机,推理服务也要运行。尤其是声音素材和输出音频可能涉及私人内容,不能因为生成了一个公网地址就默认适合公开分享。
9. 安装 Windows 版 cpolar
在 cpolar 下载页面选择立即下载 64-bit,解压后运行安装程序,按页面流程完成安装。
在 CMD 中检查客户端版本:
cpolar version还没有账号的话,在官网点击免费注册。
进入注册页面,完成账号注册。
随后在浏览器打开 cpolar Web UI:
使用 cpolar 账号登录。
这里的9200只是隧道管理页面的端口,不是 Index-TTS 的推理端口。
10. 先用随机域名验证 9872
实际需要映射的是推理 WebUI 的9872,启动界面可以看到对应端口。
在 cpolar 左侧进入隧道管理 → 隧道列表。页面默认提供ssh(TCP、22)和website(HTTP、8080)两条隧道。
点击website旁的“编辑”,将其用于 Index-TTS 推理 WebUI,本地地址对应9872,使用随机域名方式。HTTP 隧道会出现 HTTP、HTTPS 两种公网入口。
进入状态 → 在线隧道列表,查看生成的公网地址。
换一台设备使用其中一个地址测试,这里使用 HTTPS 地址。
外部能打开推理页面,说明“外部浏览器 → cpolar → 本地9872→ TTS 推理 WebUI”这条网络链路已经通了。随机地址适合短期测试;这套演示中给出的规则是约每 24 小时变化一次,长期保存入口时还要考虑换固定地址。
11. 预留固定二级子域名 indextts
进入预留页面:
示例中已保留的记录为:地区China Top,二级子域名indextts。二级子域名具有唯一性,实际填写自己账号里预留成功的名称。
注:二级域名是唯一的,每个账号都不相同,请以自己设置的二级域名保留的为主返回隧道管理 → 隧道列表,找到index-tts隧道。
点击“编辑”,把域名类型改为“二级子域名”,填写前面保留的名称,再点击“更新”。
在在线隧道列表里,原来的随机入口会切换成固定二级子域名形式。
使用 HTTPS 地址再次测试。
这里从默认website隧道开始操作,固定域名阶段显示的名称则是index-tts。找隧道时应以自己实际配置的本地地址9872和隧道记录为准,避免只按名称判断。
12. 再用新的文本验证公网推理
固定域名能够打开以后,继续使用前面的参考音频,换一段文本再生成。演示输入如下:
是一款内网穿透工具,可以将你在局域网内运行的服务(如本地 Web 服务器、SSH、远程桌面等)通过一条安全加密的中间隧道映射至公网,让外部设备无需配置路由器即可访问。生成后可以下载输出音频,再听一遍结果:
这一步比单纯测试登录页更进一步:不仅远程页面可达,远程操作也完成了文本输入、生成和输出文件获取。
13. 给没有登录机制的 WebUI 加授权验证
Index-TTS 推理 WebUI 本身没有登录界面,固定公网地址如果直接对外开放,知道地址的人就可能进入生成页面。它背后连接的是本机算力,还涉及参考音频和输出文件,因此我会把访问验证当成远程使用的必要一环。
进入 cpolar 隧道列表,编辑index-tts。
展开“高级”设置,按界面配置授权验证,保存并更新。
重新访问固定地址:
这次会先出现验证窗口。演示使用的用户名为admin、密码为123456。
输入后可以进入推理页面。admin / 123456只是演示凭据,长期开放前应使用独立强密码,并限制分享范围。访问认证保护的是公网入口,不会自动赋予声音素材的使用授权。
总结
把用起来,我更愿意记住的是一条具体的工作流:选对整合包、用 7-Zip 解压、从run.ps1进入推理页面,把参考音频放进WORKSPACE/source,生成后试听并找到文件。这样即使以后换素材,也知道每一步该检查哪里。
远程使用则是另一条链:将本机9872的推理页面提供给外部浏览器,固定域名解决入口变化,授权验证限制访问者。模型、算力与工作文件仍留在本地电脑。先把本地生成和公网访问分别跑通,再照看好参考音频的授权与访问凭据,这套声音实验环境才更适合长期使用。