你的声音。你的品牌。从一段简短录音中克隆声音,并在 Grok 文本转语音和语音智能体 API 中使用它。
自定义声音 自定义声音使用场景 自定义声音安全
今天,我们推出自定义声音。从几秒钟的音频中克隆你的声音,并立即在 Grok 文本转语音和语音智能体 API 中使用它。
泰勒
SpaceX 广播主持人
原始
克隆
使用场景
自定义声音解锁了一类全新的应用。
实时支持
我需要帮助处理我最近的订单。
当然!让我调出你的订单详情。
品牌语音智能体
为你的客户支持智能体赋予一个一致、可识别的声音,使其与你的品牌形象相匹配,而不是使用通用的预设声音。
录制
在今天的节目中,我们深入探讨了人工智能的未来,以及它对各地创作者的意义。
内容创作者
用自己的声音大规模地解说视频、播客和社交媒体帖子,无需每次都重新录制。
原始
保留
无障碍
为失去说话能力的个人创建个性化声音,保留他们的声音特征。
🇺🇸
🇪🇸
🇫🇷
🇩🇪
🇨🇳
🇯🇵
🇺🇸英语
🇪🇸西班牙语
🇫🇷法语
🇩🇪德语
🇨🇳中文
🇯🇵日语
多语言团队
用每种主要语言呈现你 CEO 的主题演讲——自然地使用英语、西班牙语、法语、德语、中文、日语等。
旁白:古老的门吱呀一声打开了……
琪拉:我们得走了。现在。
塞恩:我有种不好的预感。
游戏与娱乐
用独特的声音让角色栩栩如生,无需为每一句对白安排录音棚时间。
第三章
发现
她打开笔记本,发现笔迹毫无疑问是她自己的,尽管她完全不记得写过这些。
播客与有声读物解说
让你的叙述引人入胜。将脚本变成完整的有声读物,用你自己的声音逐章解说,无需踏入录音棚。
实时支持
我需要帮助处理我最近的订单。
当然!让我调出你的订单详情。
录制
在今天的节目中,我们深入探讨了人工智能的未来,以及它对各地创作者的意义。
原始
保留
🇺🇸
🇪🇸
🇫🇷
🇩🇪
🇨🇳
🇯🇵
🇺🇸英语
🇪🇸西班牙语
🇫🇷法语
🇩🇪德语
🇨🇳中文
🇯🇵日语
旁白:古老的门吱呀一声打开了……
琪拉:我们得走了。现在。
塞恩:我有种不好的预感。
第三章
发现
她打开笔记本,发现笔迹毫无疑问是她自己的,尽管她完全不记得写过这些内容。
品牌语音智能体
为你的客户支持智能体赋予一致且可辨识的声音,使其契合你的品牌形象,而非使用通用预设。
自定义声音
在不到两分钟内克隆你的声音。随处可用。
在 xAI 控制台中录制大约一分钟的自然语音。我们的流水线会验证你是声音所有者,处理你的录音,并在两分钟内交付一个可用于生产环境的声音模型。你的自定义声音继承了所有 TTS 能力:语音标签、多语言输出,以及 REST 和 WebSocket 流式传输。
口令验证
录制中
我的声音就是我的钥匙
步骤 1 朗读一段口令以确认你的身份
自定义声音在我们内置声音可用的所有地方都能使用。将 voice_id 传递给任意 TTS 端点,或将其与 Voice Agent API 配合使用,以构建实时对话智能体。
使用自定义声音调用文本转语音或 Voice Agent API 无需额外付费。
每个自定义声音在创建前都要经过两阶段验证流程。首先,说话者朗读一段验证短语,我们的 STT 引擎会实时转录并匹配,以确认意图和实时存在。然后,我们从验证片段和完整录音中计算说话者嵌入向量,以确认它们属于同一个人。
你不能从已有的录音中克隆声音,也不能克隆他人的声音。
口令验证
录制中
我的声音就是我的钥匙
口令验证
朗读一段验证短语。我们的 STT 引擎会实时转录并匹配,验证你的同意和实时存在。
说话者相似度
空闲
口令
–
录制中
说话者相似度
来自口令和完整录音的说话者嵌入向量会被比对,以确认它们属于同一个人。