进阶Python

dograh开源可自托管的语音AI平台

dograh 是一个用 Python 打造的开源语音 AI 平台,可自托管替代 Vapi 和 Retell,支持语音到语音及 LLM/STT/TTS 模块化组合,内置可视化工作流构建器,原生支持 MCP 与电话接入。对数据隐私敏感或想摆脱供应商锁定的团队,这是一个值得关注的自部署选项。

5.1K 星标
1.2K 分叉
27 问题
122 浏览
Python
BSD-2-Clause
收录日期

项目概述

dograh 是一个用 Python 打造的开源语音 AI 平台,可自托管替代 Vapi 和 Retell,支持语音到语音及 LLM/STT/TTS 模块化组合,内置可视化工作流构建器,原生支持 MCP 与电话接入。对数据隐私敏感或想摆脱供应商锁定的团队,这是一个值得关注的自部署选项。

语音 AI 的风口这两年没停过,但真正敢把业务跑在别人云端的团队并不多。有的因为数据合规,有的因为每通电话的成本,还有的单纯烦透了供应商锁定的感觉。Vapi 和 Retell 这类托管服务很香,却始终不是公司内部的基础设施。如果你也有这个顾虑,dograh 值得花十分钟看看。

dograh 是一个用 Python 写的开源语音 AI 平台,GitHub 上的星标已经有五千出头。它的定位很直接:做一个可自托管的 Vapi 替代品,让你把整个语音管线搬进自己的服务器。所谓“整个管线”,指的是从语音识别 STT,到语言模型 LLM 处理,再到语音合成 TTS 的全部流程,甚至可以直接做语音到语音的实时对话。

模块化组合,自带密钥

说得具体一点,dograh 并不强迫你绑定某一家模型服务。它把语音管道拆成三段,用户可以各选所爱。STT 换一家,TTS 换一家,中间 LLM 也能接不同的模型。BYOK(Bring Your Own Key)模式意味着你自己的 API key 自己测,云厂商的账单也自己管。

听起来挺玄,但实际跑一遍就懂:在 dograh 的可视化工作流构建器里,把语音识别节点连到 LLM 节点,再连到语音合成节点,几分钟就能搭出一条对话流。这个过程对不熟悉代码的开发者尤其友好,拖拽代替了手写状态机。

  • 可视化流程构建:拖拽节点定义对话逻辑,支持条件分支和循环。
  • MCP 原生支持:让语音助手直接调用外部工具和 API,相当于给 AI 加了手脚。
  • 电话接入:可以接听真实来电,适合客服机器人或电话销售场景。
  • 自托管部署:所有数据留在你自己的环境里,满足隐私和合规要求。

对谁有用,对谁有门槛

典型使用场景是那些已经有现成模型的团队,想快速搭一个语音助手验证业务逻辑。比如企业做一个内部客户问答热线,不想把音频内容发给第三方,那么 dograh 自托管就是一条很务实的路。再比如开发者在做 Vapi 迁移测试,想先在本地完全复刻一套环境,dograh 也可以当作沙盒。

不过这并不意味着零门槛。先说结论:dograh 属于那种“能自己搞定 Docker 和反向代理”的团队才能舒服使用的项目。Python 环境、模型 API、电话线路配置,每一项都需要花时间。如果你的团队没有运维基础,可能还是直接买托管服务更省心。

另外,BYOK 虽然带来了自由度,也带来了成本计算负担。每个模型各算各的账,叠加起来未必比平台统一收费便宜。短时间测试没问题,长跑大规模并发的用户,运维压力需要提前评估。

上手建议

想尝试的开发者,建议按这几个步骤走:先跑一个最简单的 LLM + STT + TTS 流程,确认管道通了;再加可视化工作流;最后才考虑接电话和 MCP。一步步来,能省掉不少排查时间。

还有一点比较重要:dograh 目前还在快速发展中,社区和文档未必像商业产品那样完善。遇到问题优先去 GitHub Issues 里翻,或者用开源社区惯用的方式求助。

如果你能接受自己动手这件事,dograh 提供了一个相当完整的语音 AI 平台骨架。它不会替你解决所有模型问题,但至少能把控制权还给你。

语音AI开源自托管Vapi替代语音对话平台STTTTS可视化工作流MCP电话机器人

项目评分

0.0 (0 评价)

分享

常见问题

dograh: 开源可自托管的语音AI平台 是什么?

dograh 是一个用 Python 打造的开源语音 AI 平台,可自托管替代 Vapi 和 Retell,支持语音到语音及 LLM/STT/TTS 模块化组合,内置可视化工作流构建器,原生支持 MCP 与电话接入。对数据隐私敏感或想摆脱供应商锁定的团队,这是一个值得关注的自部署选项。

dograh: 开源可自托管的语音AI平台 用什么语言开发?

dograh: 开源可自托管的语音AI平台 主要使用 Python 开发。

dograh: 开源可自托管的语音AI平台 使用什么开源协议?

dograh: 开源可自托管的语音AI平台 基于 BSD-2-Clause 协议开源。

相关项目

暂无结果

探索更多

相似工具

豆包

豆包

豆包(Doubao)是字节跳动推出的一款智能办公与内容创作工具,核心功能包括:智能问答、文案生成、翻译润色、PPT 自动生成、Excel 分析、图像创作、音视频辅助处理等。依托字节的大模型能力,豆包在中文理解、写作、数据处理和创意生成方面表现出色,是国内广泛使用的 AI 办公工具之一。

ChatGPT

ChatGPT

ChatGPT 是一款基于大型语言模型的智能聊天工具,可以理解人类语言并生成自然回应。它广泛应用于写作、翻译、办公自动化、代码生成、学习问答等场景,能够快速提升个人和团队的工作效率。

DeepSeek

DeepSeek

DeepSeek 是一款面向全球用户的智能语言模型工具,具备文本生成、代码推理、任务分析、内容写作等能力。与传统 AI 工具相比,它更强调高效推理与高性价比,尤其在编程问答、技术场景、数据分析等方面表现突出。

MiniMax

MiniMax

MiniMax 是一家由前商汤科技核心团队创立的 AI 独角兽,业内常把它比作“中国的 OpenAI”。它最核心的底层是自研的 abab 系列大模型。与其他只擅长处理文字的 AI 不同,MiniMax 在语音、视觉和逻辑推理三个维度上走得非常均衡。如果你在寻找一个说话不生硬、生成的视频不“鬼畜”且能深度理解复杂指令的 AI 工具,它基本就是国内的首选。

智谱清言

智谱清言

智谱清言是基于GLM-4大型预训练模型打造的国产AI助手,可以实时对话、答疑解惑,支持文章创作、新闻选题、PPT大纲、程序编写等多种功能。它擅长理解上下文,并提供高质量的创意写作和代码生成服务,是一款面向中文用户的智能生产力工具。

Kimi

Kimi

在 2026 年的全球 AI 竞赛中,Kimi 已成为“高保真长文本处理”的代名词。它最初凭借处理百万字不“断片”的能力切入市场,而现在的 Kimi 已经进化为一个拥有深度推理能力的智能系统。它最核心的竞争力在于:当其他模型在面对海量文档感到“困惑”时,Kimi 能够像经验丰富的研究员一样,在几秒钟内穿透数十万行代码或上千页财报,精准定位逻辑关键点。

评论

评论

0
0/500 字符

暂无评论

成为第一个评论的人

开源项目

探索、学习和贡献开源AI项目,推动人工智能技术的发展

查看全部