Dograh AI:开源自托管的语音 AI 平台

Dograh AI 是开源的语音 Agent 平台:节点式可视化编排、实时语音引擎、通话追踪分析一应俱全,全栈可自托管、模型无关。本文讲清架构与搭建方法。

最佳实践
智能体工具协作与任务执行插画

直接回答:Dograh AI 是开源的对话式语音 Agent 构建平台:提供节点式可视化工作流编排器、管理实时音频流的语音引擎、以及含通话追踪/录音/分析的平台层。整套系统 Docker Compose 一键自托管,LLM、语音合成/识别、电话线路都接你自己的服务商。

为什么要绕开专有语音平台

语音系统可能同时产生模型、识别、合成、电话与平台费用。应比较具体服务商的定价、追踪和导出能力,不能说所有专有平台都没有执行轨迹。

自托管增加定制与运维控制,也增加升级、故障恢复、密钥和数据保留的责任;它不自动降低总成本。

三层架构

1. 语音引擎:管理实时音频流,连接来电者与 STT/TTS/LLM,处理打断检测与会话状态——这是语音 Agent 的技术核心,延迟与打断体验都取决于它。

2. 可视化编排器:节点画布上拖拽编排对话逻辑:Prompt 节点、条件分支、API 工具调用、变量抽取、转人工/转接。每个节点侧栏单独配置。

3. 平台层:通话追踪、录音、转写、分析内置——裸框架(LiveKit/Pipecat)要你自己建的就是这层。

本地安装

先阅读官方仓库并检查启动脚本及 Compose 配置,再在测试环境执行:

git clone https://github.com/dograh-hq/dograh
cd dograh
# 审查 scripts/start_docker.sh 和 docker-compose.yaml 后运行
ENABLE_TELEMETRY=false bash scripts/start_docker.sh
# 当前官方文档的本地入口为 http://localhost:3010

镜像、端口和服务以所选版本为准。正式部署需要认证、TLS、备份和网络限制;不要直接对公网开放开发入口。本地部署不代表音频不出网,云端 STT/TTS/LLM 和电话商仍可能处理数据;应检查录音、转写与电话号码的传输和保留范围。

实战:搭一个线索资格审查 Agent

典型流程:来电接入 → 逐题询问(预算、需求、时间)→ 变量抽取存字段 → 按回答分支(合格转销售/不合格礼貌结束)→ 在取得所需告知与授权后选择录音转写。节点数量取决于流程,每个环节的状态在通话追踪里可回放。

常见问题(FAQ)

Q:自托管语音 AI 最大的坑是什么?
A:延迟。STT→LLM→TTS 三段串行,每段几百毫秒累积起来用户就感到"迟钝"。选型时优先流式服务(边说边转、边生成边播),并把各段耗时纳入监控。

Q:电话线路怎么接?
A:通过 Twilio 等 CPaaS 或 SIP 中继接入,Dograh 负责媒体流对接。国内落地需评估合规(呼叫资质、录音告知)。

Q:和直接用 LiveKit/Pipecat 框架比?
A:框架给引擎,Dograh 多给编排器与平台层(追踪/录音/分析)。团队有强开发能力可基于框架自建,要快速上线选成品平台。

参考资料

资料核对日期:2026 年 9 月 29 日。本文基于公开文档整理,代码片段和评估方案未作独立运行或性能验证;厂商测试结果已注明来源。

延伸阅读

获取专属方案

联系我们

加入社区

微信扫码
加入官方交流群

立即体验

在线开通,按量计费,真正的云服务!

立即开始

选择观测云版本

代码托管平台