MoneyPrinterTurbo 离线 TTS 部署指南:AI视频生成本地配音,零 API 成本
2026/9/13 1:51:07 网站建设 项目流程

MoneyPrinterTurbo 离线 TTS 部署指南:AI视频生成本地配音,零 API 成本

【免费下载链接】MoneyPrinterTurbo利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short videos from a topic or keyword with an automated AI workflow.项目地址: https://gitcode.com/GitHub_Trending/mo/MoneyPrinterTurbo

MoneyPrinterTurbo 是一款 AI视频生成 工具,能把一个主题变成高清短视频;它的离线语音合成把配音全程放在本地跑,不走云端 API,文本不出本机,零调用成本。下文是一份本地 TTS 部署与离线字幕生成的完整指南。

🎙 它到底解决了什么问题

MoneyPrinterTurbo 让关键词自动走完脚本、配音、字幕、剪辑全流程,而配音环节可以完全离线,这是它的核心价值。

  • 全程本地合成:TTS 请求在本地进程内完成,没有网络依赖,弱网环境也能出片
  • 数据不出机器:脚本文本不上传第三方服务器,规避隐私泄露风险
  • 零调用成本:无按量 API 计费,部署一次即可无限次生成,批量生产成本可控
  • 双引擎架构:V1 引擎基于 edge-tts 库,快速稳定;V2 引擎集成 Azure Cognitive Services SDK,音色更真实,字级字幕时间戳更精确

⚡ 三步跑起来

第一步:克隆仓库

git clone https://gitcode.com/GitHub_Trending/mo/MoneyPrinterTurbo cd MoneyPrinterTurbo

第二步:安装依赖

pip install -r requirements.txt

第三步:配置并启动。把模板配置复制为config.toml后填入语音参数,WebUI 与 API 两个入口二选一:

cp config.example.toml config.toml sh webui.sh # Windows 用 webui.bat python main.py # 或启动 API 服务,文档见 http://127.0.0.1:8080/docs

⚙️ 关键配置速览

配置由app/config/config.py统一加载,与离线语音合成相关的项不多:

参数作用示例值是否必填
speech_keyAzure Speech 服务密钥,V2 引擎前提你的服务密钥选填(V2 必填)
speech_regionAzure 服务区域,与密钥配套eastasia选填(V2 必填)
voice_name发音人名称zh-CN-XiaoxiaoNeural选填
voice_rate语速倍率,可调范围 -50%~+50%1.1选填
subtitle_provider字幕生成模式:edge 或 whisperedge选填

语音库内置 1000+ 种发音人,覆盖数十种语言:中文有 zh-CN-XiaoxiaoNeural(晓晓)、zh-CN-YunxiNeural(云希),英文有 en-US-JennyNeural,还有日文、法文、德文等,完整清单见docs/voice-list.txt

📝 edge 还是 whisper:字幕模式怎么选

模式生成速度质量硬件要求适用场景
edge良好批量生产、快速验证
whisper中高正式发布内容

切换只需在config.toml中设置subtitle_provider = "whisper",其余保持不变。

📺 三类场景直接抄作业

中文教育视频

需求:讲解清晰自然,字幕对齐不能出错。

  • 音色:zh-CN-XiaoxiaoNeural,女声柔和,适合教学场景
  • 语速:voice_rate设 1.1,+10% 跟上课件节奏
  • 字幕:whisper 模式,逐句对齐更稳

中英双语商业演示

需求:一条视频内按语言切换音色,统一横屏交付。

  • 音色:中文段 zh-CN-YunxiNeural,英文段 en-US-JennyNeural
  • 语速:保持 1.0,商务内容避免急促感
  • 字幕:中英双语字幕、16px 字号,输出 1920x1080 横屏

批量短视频流水线

需求:每天产大批量短视频,吞吐量优先。

  • 音色:同音色内容复用已合成的语音缓存,不重复计算
  • 语速:1.0 默认值即可,保证产出风格统一
  • 字幕:edge 模式求快,同时调大max_concurrent_tasks并配好material_directory

硬件与调优建议

组件最低配置推荐配置最佳配置
CPU4 核8 核12 核以上
内存8GB16GB32GB
存储256GB SSD512GB NVMe SSD1TB NVMe SSD

软件层面四条一句话建议:

  • 给 Python 进程留足内存余量,避免频繁 GC 拖慢流程
  • max_concurrent_tasks把并发任务数压在机器承受范围内
  • 复用已合成的语音结果,同一文本不重复计算
  • 语音与素材文件放 SSD,直接提升读写吞吐

常见问题

合成速度慢?先看 CPU 与内存占用,降并发;字幕生成改用 edge 引擎也能明显提速。

音色怎么选?用 WebUI 的试听功能逐个预览候选,听完再定;1000+ 全量清单见docs/voice-list.txt

能自定义语音模型吗?当前版本支持 Azure TTS 标准模型,GPT-SoVITS 等本地自定义模型在计划中。

字幕不准?subtitle_provider切到 whisper,同时保证音频清晰,重新生成即可。

源码导读

代码分四层:控制器层app/controllers/负责请求入口与业务编排;服务层app/services/装 TTS、字幕、视频合成等核心能力;模型层app/models/定义请求参数结构;工具层app/utils/提供通用函数。TTS 核心在 app/services/voice.py:一次配音依次经过文本预处理(清洗括号等符号)、选音色、调用引擎合成音频、采集字级边界时间戳、生成 SRT 字幕并转格式五步,azure_tts_v1azure_tts_v2两个引擎实现都在这里。功能路线上,GPT-SoVITS 本地自定义模型、情感化合成、接入更多 TTS 服务商、一键发布到 YouTube 等平台都已列入计划。

MoneyPrinterTurbo 已把配音与字幕整条链路做成开箱即用的本地工具,你只需提供主题。把仓库克隆下来用默认配置跑出第一条视频,遇到坑或想要新特性时,直接向社区提交 Issue 或 PR 是最快的参与方式。

【免费下载链接】MoneyPrinterTurbo利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short videos from a topic or keyword with an automated AI workflow.项目地址: https://gitcode.com/GitHub_Trending/mo/MoneyPrinterTurbo

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询