推出语音智能体构建器,基于我们所能找到的最难通话进行训练。两分钟即可构建一个智能体。了解成本。立即尝试。
今天,我们宣布推出语音智能体构建器(Beta 版):一个无代码平台,用于在 Grok Voice 上配置生产级语音智能体。
它面向那些希望拥有高并发生产级语音智能体、但又不想从头搭建周边技术栈的运营人员和开发者。开箱即用,你就能获得电话通信、知识检索、工具、护栏、MCP 以及可观测性,全部集成于一处。你也可以保留现有系统:通过 SIP 接入现有电话号码,将工具连接到你的 API 和 MCP 服务器,或通过 WebSocket 连接你自己的客户端。
大多数语音技术栈需要拼接三个 API——语音转文字、语言模型和文字转语音——而且每个环节通常由不同的供应商托管。每增加一个环节,都会带来额外的成本、延迟和新的故障模式。语音智能体构建器是一个基于 Grok Voice 构建的语音到语音路径上的统一接口,与模型紧密耦合,而非由三个独立组件拼凑而成。
基于我们所能找到的最难通话进行训练
真实通话包含低质量电话音频、背景噪音、浓重口音、打断,以及中途改变主意的来电者。背后的工作流程模糊不清,涉及数十种工具,并且可能以 25 种以上的语言进行。
我们使用这些通话对 Grok Voice 进行了训练。τ-voice Bench 在相同条件下对智能体进行评估。
τ-voice Bench 排行榜
Grok Voice Think Fast 1.0
67.3%
Gemini 3.1 Flash Live
43.8%
GPT Realtime 1.5
35.3%
总体 零售 航空 电信
两分钟即可构建一个智能体
设置非常简单:用通俗语言描述通话流程,然后附上你的文档、工具和护栏。你可以在大约两分钟内从零开始构建一个可用的智能体。
教会它你的业务
智能体从一个描述通话流程的提示词开始。模型会实时进行推理,因此能够遵循长指令并处理模糊的请求。
它所知道的内容来自知识库。你可以上传常见格式的文档(纯文本、Markdown、Word、PowerPoint、Excel、HTML、JSON 等),智能体在通话过程中会从中检索信息。文档按集合进行组织,你可以将集合附加到一个或多个智能体上,并在智能体之间共享,这样政策、产品规格和操作手册就能集中存放,而无需粘贴到每个提示词中。
采取行动
了解业务只是支持或销售通话的一半。智能体还需要采取行动。它们需要查询信息、修改记录、转接任务,或在通话结束后完成闭环。
工具和连接器就是实现这一点的途径。在预订热线中,智能体可能会在 Google 日历或 Outlook 日历中安排预约,然后通过你的电子邮件提供商发送确认信息。在支持场景中,API 请求可以检查订单状态或在你的系统中发起退款。当答案不在你的文档中时,网络搜索或 X 搜索可以获取当前的公开信息。工单可以在 Linear 或 Notion 中管理,文件则来自 Google Drive 或 OneDrive。
如果来电者需要人工服务,智能体可以将通话转接给你的团队。当任务完成时,它可以干净地结束通话。在整个对话过程中,它会发送实时通知,以便你的团队了解智能体的操作,并在需要时介入。
搜索帮助中心
转接人工
赋予它声音和号码
智能体可以使用任何内置语音,也可以使用基于大约两分钟音频克隆的品牌专属语音。每个账户都包含一个免费电话号码,可用于从首次测试通话到生产流量的任何场景,并且直接 SIP 连接可以接入任何主要电信运营商的现有号码。你还可以在浏览器中测试更改,无需使用电话。
回顾通话
每次通话都会被录制并转录。你可以回放音频、阅读转录文本,并查看智能体使用了哪些工具。防护栏设定了智能体不应做什么的限制,例如不得读出卡号或讨论脚本之外的话题。
费用是多少
我们坚信定价应当简单透明。智能体按我们的 API 费率计费(目前为每分钟音频 $0.05),语音包含在内,不另收平台费。使用免费提供的号码进行电话通信,每分钟额外收取 $0.01。
其他语音技术栈通常对每个独立组件(识别、推理、合成和平台)分别计费,每个组件都有自己的计量方式和定价。我们希望只使用少量计量项,你只需将其乘以通话量即可完成计费。
立即尝试
语音智能体更适合通过听觉而非基准测试来评判。构建一个智能体,将你最复杂的工作流程交给它,然后拨打电话测试。