MoneyPrinterTurbo 离线 TTS 部署指南:AI视频生成本地配音,零 API 成本
【免费下载链接】MoneyPrinterTurbo利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short videos from a topic or keyword with an automated AI workflow.项目地址: https://gitcode.com/GitHub_Trending/mo/MoneyPrinterTurbo
MoneyPrinterTurbo 是一款 AI视频生成 工具,能把一个主题变成高清短视频;它的离线语音合成把配音全程放在本地跑,不走云端 API,文本不出本机,零调用成本。下文是一份本地 TTS 部署与离线字幕生成的完整指南。
🎙 它到底解决了什么问题
MoneyPrinterTurbo 让关键词自动走完脚本、配音、字幕、剪辑全流程,而配音环节可以完全离线,这是它的核心价值。
- 全程本地合成:TTS 请求在本地进程内完成,没有网络依赖,弱网环境也能出片
- 数据不出机器:脚本文本不上传第三方服务器,规避隐私泄露风险
- 零调用成本:无按量 API 计费,部署一次即可无限次生成,批量生产成本可控
- 双引擎架构:V1 引擎基于 edge-tts 库,快速稳定;V2 引擎集成 Azure Cognitive Services SDK,音色更真实,字级字幕时间戳更精确
⚡ 三步跑起来
第一步:克隆仓库
git clone https://gitcode.com/GitHub_Trending/mo/MoneyPrinterTurbo cd MoneyPrinterTurbo第二步:安装依赖
pip install -r requirements.txt第三步:配置并启动。把模板配置复制为config.toml后填入语音参数,WebUI 与 API 两个入口二选一:
cp config.example.toml config.toml sh webui.sh # Windows 用 webui.bat python main.py # 或启动 API 服务,文档见 http://127.0.0.1:8080/docs⚙️ 关键配置速览
配置由app/config/config.py统一加载,与离线语音合成相关的项不多:
| 参数 | 作用 | 示例值 | 是否必填 |
|---|---|---|---|
speech_key | Azure Speech 服务密钥,V2 引擎前提 | 你的服务密钥 | 选填(V2 必填) |
speech_region | Azure 服务区域,与密钥配套 | eastasia | 选填(V2 必填) |
voice_name | 发音人名称 | zh-CN-XiaoxiaoNeural | 选填 |
voice_rate | 语速倍率,可调范围 -50%~+50% | 1.1 | 选填 |
subtitle_provider | 字幕生成模式:edge 或 whisper | edge | 选填 |
语音库内置 1000+ 种发音人,覆盖数十种语言:中文有 zh-CN-XiaoxiaoNeural(晓晓)、zh-CN-YunxiNeural(云希),英文有 en-US-JennyNeural,还有日文、法文、德文等,完整清单见docs/voice-list.txt。
📝 edge 还是 whisper:字幕模式怎么选
| 模式 | 生成速度 | 质量 | 硬件要求 | 适用场景 |
|---|---|---|---|---|
| edge | 快 | 良好 | 低 | 批量生产、快速验证 |
| whisper | 慢 | 高 | 中高 | 正式发布内容 |
切换只需在config.toml中设置subtitle_provider = "whisper",其余保持不变。
📺 三类场景直接抄作业
中文教育视频
需求:讲解清晰自然,字幕对齐不能出错。
- 音色:zh-CN-XiaoxiaoNeural,女声柔和,适合教学场景
- 语速:
voice_rate设 1.1,+10% 跟上课件节奏 - 字幕:whisper 模式,逐句对齐更稳
中英双语商业演示
需求:一条视频内按语言切换音色,统一横屏交付。
- 音色:中文段 zh-CN-YunxiNeural,英文段 en-US-JennyNeural
- 语速:保持 1.0,商务内容避免急促感
- 字幕:中英双语字幕、16px 字号,输出 1920x1080 横屏
批量短视频流水线
需求:每天产大批量短视频,吞吐量优先。
- 音色:同音色内容复用已合成的语音缓存,不重复计算
- 语速:1.0 默认值即可,保证产出风格统一
- 字幕:edge 模式求快,同时调大
max_concurrent_tasks并配好material_directory
硬件与调优建议
| 组件 | 最低配置 | 推荐配置 | 最佳配置 |
|---|---|---|---|
| CPU | 4 核 | 8 核 | 12 核以上 |
| 内存 | 8GB | 16GB | 32GB |
| 存储 | 256GB SSD | 512GB NVMe SSD | 1TB NVMe SSD |
软件层面四条一句话建议:
- 给 Python 进程留足内存余量,避免频繁 GC 拖慢流程
- 用
max_concurrent_tasks把并发任务数压在机器承受范围内 - 复用已合成的语音结果,同一文本不重复计算
- 语音与素材文件放 SSD,直接提升读写吞吐
常见问题
合成速度慢?先看 CPU 与内存占用,降并发;字幕生成改用 edge 引擎也能明显提速。
音色怎么选?用 WebUI 的试听功能逐个预览候选,听完再定;1000+ 全量清单见docs/voice-list.txt。
能自定义语音模型吗?当前版本支持 Azure TTS 标准模型,GPT-SoVITS 等本地自定义模型在计划中。
字幕不准?把subtitle_provider切到 whisper,同时保证音频清晰,重新生成即可。
源码导读
代码分四层:控制器层app/controllers/负责请求入口与业务编排;服务层app/services/装 TTS、字幕、视频合成等核心能力;模型层app/models/定义请求参数结构;工具层app/utils/提供通用函数。TTS 核心在 app/services/voice.py:一次配音依次经过文本预处理(清洗括号等符号)、选音色、调用引擎合成音频、采集字级边界时间戳、生成 SRT 字幕并转格式五步,azure_tts_v1与azure_tts_v2两个引擎实现都在这里。功能路线上,GPT-SoVITS 本地自定义模型、情感化合成、接入更多 TTS 服务商、一键发布到 YouTube 等平台都已列入计划。
MoneyPrinterTurbo 已把配音与字幕整条链路做成开箱即用的本地工具,你只需提供主题。把仓库克隆下来用默认配置跑出第一条视频,遇到坑或想要新特性时,直接向社区提交 Issue 或 PR 是最快的参与方式。
【免费下载链接】MoneyPrinterTurbo利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short videos from a topic or keyword with an automated AI workflow.项目地址: https://gitcode.com/GitHub_Trending/mo/MoneyPrinterTurbo
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考