免费搭建私有Vapi替代方案:Dograh自托管成本与云版本性价比深度算账
【免费下载链接】dograhOpen source voice AI platform. Self-hosted alternative to Vapi and Retell. On Prem, BYOK across Speech to Speech or LLM/STT/TTS, with a visual workflow builder, MCP native and telephony support.项目地址: https://gitcode.com/GitHub_Trending/do/dograh
Dograh 是一个开源、可自托管的语音 AI 平台,也是 Vapi 和 Retell 的免费私有替代方案。它提供可视化工作流构建器、MCP 原生支持和电话系统集成,支持 LLM/STT/TTS 或语音到语音(Speech to Speech)两种推理模式,并允许自带密钥(BYOK)接入任意模型供应商。这篇文章带你完整算一笔账:自托管 Dograh 需要哪些成本,与直接使用云版本相比到底谁更划算。
为什么选 Dograh 作为免费的 Vapi 替代方案
与闭源的 Vapi、Retell 不同,Dograh 采用 BSD 2-Clause 开源协议,每一条代码都可以查看和修改。它的核心优势可以概括为:
| 维度 | Dograh(自托管) | Vapi / Retell(云) |
|---|---|---|
| 授权 | BSD 2-Clause 开源 | 商业闭源 |
| 部署方式 | 一条 Docker 命令 | 仅 SaaS |
| 平台费用 | 免费(自担服务器成本) | 按分钟计费 |
| 模型选择 | 任意 LLM / STT / TTS / 电话供应商 | 仅限其集成的供应商 |
| 数据归属 | 数据留在你自己的基础设施 | 数据在对方云端 |
| 厂商锁定 | 无 | 完全锁定 |
除了成本,自托管最大的价值是数据主权:通话录音、转写文本全部存储在你自己的 MinIO/S3 对象存储中,适合金融、医疗等对数据驻留有合规要求的场景。
平台的工作方式可以简单理解为:电话接通后,实时音频流经 STT 转成文字,交给 LLM 结合当前节点的提示词生成回复,再由 TTS 合成语音说给通话者听,每通电话结束后自动保存一次 "run" 记录(转写、录音、抽取的变量、用量与成本),详见 docs/core-concepts/calls-and-runs.mdx。
一条命令完成 Dograh 自托管部署步骤
Dograh 的自托管门槛非常低:整套系统打包为dograh-api与dograh-ui两个镜像,加上 Postgres、Redis、MinIO,用 Docker Compose 编排。本地体验只需要一条命令(首次启动约 2-3 分钟下载镜像),然后打开http://localhost:3010即可创建第一个语音智能体,具体步骤见 docs/deployment/docker.mdx。
要对外提供真实电话服务,推荐在服务器上部署:脚本会自动装好 Docker、申请免费的 sslip.io HTTPS 证书(无需域名)、配置 coturn TURN 服务器处理 WebRTC 打洞。
官方对生产服务器的最低要求是4 vCPU + 8 GB 内存,这直接决定了我们的成本下限。
Dograh 自托管成本明细:服务器、模型与电话费
自托管的总成本 = 服务器 + 模型推理 + 电话线路,三项分开算:
1. 服务器成本(固定支出)
- 4 vCPU / 8 GB 的入门 VPS:主流厂商大约在每月 20~50 元美元区间,选择低价区域(如 Hetzner)可压到 20 美元/月以下
- 平台软件本身:0 元(BSD 开源)
- 扩容时按 docs/deployment/scaling.mdx 的指引,每个 FastAPI worker 约占 300~500 MB 内存,4 核跑 4 个 worker 即可应对中小并发
2. 模型推理成本(变动支出,BYOK 是关键)
Dograh 支持三种模型配置模式(详见 docs/configurations/inference-providers.mdx):
- Speech to Speech:用实时语音模型直接处理对话,延迟最低
- Dograh 托管:用一个 Service Key 使用 Dograh 托管的 LLM/语音/转写
- BYOK:自带 OpenAI、ElevenLabs、Deepgram 等任意供应商的 API Key,逐项配置
这是自托管省钱的核心:推理费用直接走你自己的供应商账单,没有平台加价。以 1 分钟通话估算,使用主流供应商的 LLM + STT + TTS 组合,模型成本大约在几美分量级,远低于 Vapi 等按分钟打包收费的云版本——你付的是"原料价"而不是"成品价"。
3. 电话费用(固定不变)
无论自托管还是用云,电话费都付给 Twilio、Vonage、Telnyx 等运营商,Dograh 原生支持这些供应商的呼入/呼出和呼叫转接。这部分成本与部署方式无关,可以从对比中剔除。
每通电话结束后,你可以在 run 记录里查看转写、录音和用量明细:
自托管 vs 云版本:性价比深度对比
| 使用场景 | 月通话量参考 | 更划算的选择 | 理由 |
|---|---|---|---|
| 个人学习 / 原型验证 | < 几百分钟 | 本地 Docker | 零服务器成本,一条命令跑起来 |
| 小团队生产(数据敏感行业) | 数千分钟 | 自托管 + BYOK | 省掉按分钟的平台费,数据不出内网 |
| 高并发外呼(Campaign) | 数万分钟 | 自托管 + BYOK | 用量越大,与云版本的价差越明显 |
| 无运维能力、临时项目 | 不确定 | 云版本 | 免运维,按需付费,起步最省心 |
粗略的盈亏平衡直觉:当你的月通话分钟数足以让"每分钟平台费"累积超过一台 VPS 月租时,自托管就开始回本;通话量越大、对定制(源码级修改、私有 LLM)需求越强,自托管的优势越明显。反之,如果你的量小且不想碰运维,云版本的省心价值更高。
隐藏成本:别忽略自托管的运维开销
算账不能只看服务器月租,还要计入:
- 运维时间:升级版本(参考 docs/deployment/update.mdx)、扩容、监控告警都需要人力
- 通话链路排障:WebRTC 打洞异常、防火墙端口未开是最常见的坑,官方文档在 docs/getting-started/troubleshooting.mdx 有整理
- 模型调试:提示词、节点跳转、QA 节点需要持续迭代,Dograh 提供 Test Audio / Test Chat 面板和链路追踪(可下载转写与录音、查看 Trace)帮助定位问题
好消息是这些"隐形工作"的调试成本不高——可视化构建器 + 内置测试面板 + run 级成本记录,让排查和调优都有据可依。
总结:Dograh 自托管适合谁?
🎯适合自托管:有数据合规要求、月通话量可观、想用自己的模型 Key 控制推理单价、或需要对语音 Agent 做源码级定制的团队——平台软件 0 元,总成本 = VPS + 供应商账单,长期来看是 Vapi/Retell 之外性价比最高的路线。
☁️适合云版本:刚起步、用量不确定、没有专职运维的个人或小团队——先用云版本验证业务,量起来后再迁移到自托管,因为 Dograh 的开源与闭源云版本功能同源,迁移不存在功能断层。
无论哪种方式,都建议先跑一次本地 Docker(git clone https://gitcode.com/GitHub_Trending/do/dograh后用 scripts/start_docker.sh 一键启动),亲手创建并测试一个语音智能体,再根据真实通话量决定最终方案。项目更多背景见 README.md 与 docs/deployment/introduction.mdx。
【免费下载链接】dograhOpen source voice AI platform. Self-hosted alternative to Vapi and Retell. On Prem, BYOK across Speech to Speech or LLM/STT/TTS, with a visual workflow builder, MCP native and telephony support.项目地址: https://gitcode.com/GitHub_Trending/do/dograh
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考