Dograh终极指南:20个让语音Agent更聪明的调优技巧(提示词+模型+音频)
【免费下载链接】dograhOpen source voice AI platform. Self-hosted alternative to Vapi and Retell. On Prem, BYOK across Speech to Speech or LLM/STT/TTS, with a visual workflow builder, MCP native and telephony support.项目地址: https://gitcode.com/GitHub_Trending/do/dograh
Dograh 是一个开源的语音 AI 平台(Vapi、Retell 的自托管替代方案),支持 BYOK、可视化工作流构建器、电话集成与 MCP 原生能力。本文将通过 20 个可落地的语音 Agent 调优技巧,帮你从提示词工程、模型配置、音频体验三个维度,快速打造更聪明、更自然的 Dograh 语音 Agent,新手也能直接照做。
一、提示词调优:让 Agent 听懂人话
提示词是语音 Agent 的"大脑"。以下 7 个技巧直接决定对话质量。
技巧 1:在 Global Node 里写全局人设
角色设定、语气规则、合规红线这类"整通电话都要遵守"的指令,应该只写一次——放进Global Node的 Global Prompt 中。开启 "Add Global Prompt" 的节点会在运行时自动拼接这段内容,避免在每个节点里重复人设。
参考文档:docs/voice-agent/global.mdx
技巧 2:用明确顺序写 Agent Node 提示词
模糊的提示词会产生不稳定的行为。如果你的 Agent 应该"先确认身份,再谈付款",就在提示词里明确写出这个顺序。节点提示词只写本步骤该做什么,全局规则留给 Global Node。
技巧 3:让边(Edge)条件具体化
节点之间的连线靠"自然语言条件"路由。条件越模糊,路由越混乱:
| ❌ 模糊(避免) | ✅ 具体(推荐) |
|---|---|
| "债务人回复了" | "债务人确认了身份并准备讨论账户" |
| "通话结束" | "债务人选定了一种具体还款方式并报出金额" |
如果 Agent 总走错分支,把条件写得更具体即可。详见 docs/voice-agent/agent.mdx。
技巧 4:用模板变量实现个性化开场
在 Greeting Text 和 Prompt 中支持{{字段名}}模板变量,来自 API 触发、外呼任务表或 Pre-Call Data Fetch。例如开场白直接说"Hi {{user.name}}",比任何通用问候都像真人。
⚠️ 如果请求参数里缺少某个变量,Agent 会把原始占位符念出来。发布前务必用完整参数测试一次。详见 docs/voice-agent/template-variables.mdx。
技巧 5:开启变量抽取,把对话变成结构化数据
在节点设置中开启Enable Variable Extraction,配置抽取提示词和变量列表(名称 + 类型 + 说明)。通话结束后,这些信息会存入gathered_context,可以通过 Webhook 推送到 CRM,也可在运行记录中查看。
技巧 6:用 QA 节点自动评分每一通电话
QA Node 在通话结束后用 LLM 审查转录文本,输出 1–10 分质量分、情绪、标签(如"用户沮丧""Agent 打转")等。把默认 System Prompt 换成你自己的合规检查指令,就能批量发现 Bad Case——不用人工听录音。
详见 docs/voice-agent/qa.mdx
技巧 7:把知识库当"外挂大脑",而不是堆进提示词
产品手册、FAQ、政策文档上传到Knowledge Base,按节点挂载,Agent 会按需检索作答。小文件(菜单、价目表)用Full Document模式;大文档(政策、合同)用Chunked Search模式(需配置 Embedding 模型)。
详见 docs/voice-agent/knowledge-base.mdx
二、模型调优:选对 LLM、STT 与 TTS
模型选择直接影响延迟、音色和理解力。
技巧 8:三种模型配置模式按场景选择
Dograh 的Models页面分三个区:
- Speech to Speech:实时语音到语音模型直接处理对话,延迟最低,适合实时交互强的场景;
- Dograh:用一个 Service Key 使用 Dograh 托管的 LLM/语音/转录模型,零配置起步;
- BYOK:自带各厂商密钥,LLM、Voice、Transcriber、Embedding 分别配置,成本控制最灵活。
详见 docs/configurations/inference-providers.mdx
技巧 9:给每个 Agent 单独设模型覆盖
不同 Agent 需要不同模型时,在Agent 设置 → Model Overrides中只覆盖某一项(比如只换 Voice,保留组织的 LLM 配置),实现精细调优。
技巧 10:LLM 选不准?从下拉框开始再手动添加
平台内置 OpenAI、Google、AWS Bedrock、Groq、OpenRouter、MiniMax 等多家模型;本地部署的 Ollama、vLLM 等 OpenAI 兼容端点也支持。找不到心仪模型时,用 "Add manually" 手动填入模型名即可。
详见 docs/configurations/llm.mdx
技巧 11:STT 选支持你语言、能加关键词的转录引擎
Deepgram、OpenAI、Azure、AssemblyAI 等转录引擎语言支持各异。用户总被听错?检查转录引擎的语言设置,并为专有名词配置 keyterms——这是最被低估的"听懂用户"技巧。
详见 docs/configurations/transcriber.mdx
技巧 12:TTS 音色不满意?手动添加 Voice ID
ElevenLabs、OpenAI、Cartesia、MiniMax 等语音引擎各有音色库。下拉框里没有你想要的声音?用 "Add Voice ID manually" 直接粘贴音色 ID,并调整语速——稍快的语速能显著减少通话冷场感。
详见 docs/configurations/voice.mdx
三、音频调优:让声音更自然、更省钱
技巧 13:混合预录音频 + AI 生成(Hybrid Voice Agent)
为关键对话环节录制真人音频(开场白、重要声明),动态问答仍由克隆音色 TTS 生成。好处:省 TTS 费用、延迟更低、情绪更真实。在提示词编辑器里输入@即可插入已上传的录音。
详见 docs/voice-agent/pre-recorded-audio.mdx
技巧 14:先用语音克隆,让录音和 AI 声音"同一张脸"
在支持克隆的 TTS 服务商(如 Cartesia、ElevenLabs)上传 10 秒样音生成克隆音色,再把 Voice ID 填入 Dograh。这样预录音频与动态生成的语音音色一致,切换毫无违和感。
技巧 15:逐节点开关"Allow Interruption"
打断控制是每个节点独立的:
- 开场白、法律声明、关键指令→ 关闭打断,让 Agent 说完再听用户;
- 问答、异议处理、开放讨论→ 开启打断,体验更像真人对话。
背后由 Silero VAD 实时检测用户开口并触发抢话。详见 docs/configurations/interruption.mdx。
技巧 16:开场延迟微调(Delayed Start)
外呼场景下,对方接起电话需要一点反应时间。开启Delayed Start(0.1–10 秒)让 Agent 稍候再开口,避免抢话尴尬。
详见 docs/voice-agent/start-call.mdx
四、数据驱动的迭代调优
技巧 17:用 Traces 看穿 Agent 的"大脑"
每次通话结束后,在Traces标签页能看到:发给 LLM 的完整提示词(Global + 节点拼接)、完整对话历史、可用工具、工具调用与返回、STT 转录。Agent 答非所问时,90% 的原因都能在这里找到。
详见 docs/configurations/tracing.mdx
技巧 18:追踪"送出去"的提示词,而不只是"看到的"
Traces 中的 LLM 条目同时展示 Prompt 与 Conversation History——每次 LLM 调用都会携带完整历史。调优时对比"你以为的提示词"和"实际发出的提示词",常能发现重复拼接、缺失全局提示词等问题。
技巧 19:测试时手动注入上下文变量
在Settings > Context Variables里填入模拟数据(如customer_name),工作流编辑器里的 Web/电话测试拨号就会带上这些值;设置direction=outbound还能模拟外呼——不用真实电话也能完整调试。
技巧 20:建立"QA 评分 → 定位 Bad Case → 改提示词 → 回归测试"的闭环
把 20 个技巧串起来就是这套循环:用QA 节点批量打分找低分通话 → 用Traces定位具体哪一步提示词或模型出了问题 → 修改 Global/节点提示词或更换模型 → 用测试上下文变量回归验证。坚持一周,Agent 的合格率会肉眼可见地提升。
📌 调优速查清单
| 维度 | 关键动作 | 对应文档 |
|---|---|---|
| 提示词 | Global Node 写人设、Edge 条件具体化 | global.mdx、agent.mdx |
| 提示词 | 变量抽取 + QA 自动评分 | qa.mdx |
| 模型 | S2S / BYOK / 单 Agent 覆盖 | inference-providers.mdx |
| 音频 | 预录音频 + 语音克隆 + 打断开关 | pre-recorded-audio.mdx、interruption.mdx |
| 迭代 | Traces 闭环调优 | tracing.mdx |
更多完整说明可查阅官方文档入口:docs/README.md。现在就打开你的 Dograh 工作流,从技巧 1 开始逐个执行吧!
【免费下载链接】dograhOpen source voice AI platform. Self-hosted alternative to Vapi and Retell. On Prem, BYOK across Speech to Speech or LLM/STT/TTS, with a visual workflow builder, MCP native and telephony support.项目地址: https://gitcode.com/GitHub_Trending/do/dograh
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考