Dograh AI:开源自托管的语音 AI 平台
Dograh AI 是开源的语音 Agent 平台:节点式可视化编排、实时语音引擎、通话追踪分析一应俱全,全栈可自托管、模型无关。本文讲清架构与搭建方法。
直接回答:Dograh AI 是开源的对话式语音 Agent 构建平台:提供节点式可视化工作流编排器、管理实时音频流的语音引擎、以及含通话追踪/录音/分析的平台层。整套系统 Docker Compose 一键自托管,LLM、语音合成/识别、电话线路都接你自己的服务商。
为什么要绕开专有语音平台
语音系统可能同时产生模型、识别、合成、电话与平台费用。应比较具体服务商的定价、追踪和导出能力,不能说所有专有平台都没有执行轨迹。
自托管增加定制与运维控制,也增加升级、故障恢复、密钥和数据保留的责任;它不自动降低总成本。
三层架构
1. 语音引擎:管理实时音频流,连接来电者与 STT/TTS/LLM,处理打断检测与会话状态——这是语音 Agent 的技术核心,延迟与打断体验都取决于它。
2. 可视化编排器:节点画布上拖拽编排对话逻辑:Prompt 节点、条件分支、API 工具调用、变量抽取、转人工/转接。每个节点侧栏单独配置。
3. 平台层:通话追踪、录音、转写、分析内置——裸框架(LiveKit/Pipecat)要你自己建的就是这层。
本地安装
先阅读官方仓库并检查启动脚本及 Compose 配置,再在测试环境执行:
git clone https://github.com/dograh-hq/dograh
cd dograh
# 审查 scripts/start_docker.sh 和 docker-compose.yaml 后运行
ENABLE_TELEMETRY=false bash scripts/start_docker.sh
# 当前官方文档的本地入口为 http://localhost:3010
镜像、端口和服务以所选版本为准。正式部署需要认证、TLS、备份和网络限制;不要直接对公网开放开发入口。本地部署不代表音频不出网,云端 STT/TTS/LLM 和电话商仍可能处理数据;应检查录音、转写与电话号码的传输和保留范围。
实战:搭一个线索资格审查 Agent
典型流程:来电接入 → 逐题询问(预算、需求、时间)→ 变量抽取存字段 → 按回答分支(合格转销售/不合格礼貌结束)→ 在取得所需告知与授权后选择录音转写。节点数量取决于流程,每个环节的状态在通话追踪里可回放。
常见问题(FAQ)
Q:自托管语音 AI 最大的坑是什么?
A:延迟。STT→LLM→TTS 三段串行,每段几百毫秒累积起来用户就感到"迟钝"。选型时优先流式服务(边说边转、边生成边播),并把各段耗时纳入监控。
Q:电话线路怎么接?
A:通过 Twilio 等 CPaaS 或 SIP 中继接入,Dograh 负责媒体流对接。国内落地需评估合规(呼叫资质、录音告知)。
Q:和直接用 LiveKit/Pipecat 框架比?
A:框架给引擎,Dograh 多给编排器与平台层(追踪/录音/分析)。团队有强开发能力可基于框架自建,要快速上线选成品平台。
参考资料
资料核对日期:2026 年 9 月 29 日。本文基于公开文档整理,代码片段和评估方案未作独立运行或性能验证;厂商测试结果已注明来源。