xAI:News(网页)
精选
60AI 编辑部评分,满分 100

自定义语音与语音库

2026-04-30 08:00· 97天前
AI 导读

xAI于2026年4月30日推出自定义语音和语音库功能。用户可通过约1分钟录音快速克隆声音,并在Grok文本转语音及语音代理API中即时使用,整个过程仅需2分钟。语音库提供集中管理平台,内置语音已超80种,支持28种语言。为确保安全,系统采用两阶段验证,包括实时转录匹配和说话人嵌入确认,以防止未经授权的克隆。这些功能适用于品牌代理、内容创作、无障碍辅助、多语言团队及游戏娱乐等多种场景,且使用自定义语音无需额外费用。

推荐理由

xAI 这波‘声音克隆+管理’的更新很实用,安全验证做得细,创作品类和品牌方应该会喜欢,对开发者来说是个加分项,但不是那种能改变格局的大招。

正文 · AI 翻译

你的声音。你的品牌。从一段简短录音中克隆声音,并在 Grok 文本转语音和语音智能体 API 中使用它。

自定义声音 自定义声音使用场景 自定义声音安全

今天,我们推出自定义声音。从几秒钟的音频中克隆你的声音,并立即在 Grok 文本转语音和语音智能体 API 中使用它。

泰勒

SpaceX 广播主持人

原始

克隆

使用场景

自定义声音解锁了一类全新的应用。

实时支持

我需要帮助处理我最近的订单。

当然!让我调出你的订单详情。

品牌语音智能体

为你的客户支持智能体赋予一个一致、可识别的声音,使其与你的品牌形象相匹配,而不是使用通用的预设声音。

录制

在今天的节目中,我们深入探讨了人工智能的未来,以及它对各地创作者的意义。

内容创作者

用自己的声音大规模地解说视频、播客和社交媒体帖子,无需每次都重新录制。

原始

保留

无障碍

为失去说话能力的个人创建个性化声音,保留他们的声音特征。

🇺🇸

🇪🇸

🇫🇷

🇩🇪

🇨🇳

🇯🇵

🇺🇸英语

🇪🇸西班牙语

🇫🇷法语

🇩🇪德语

🇨🇳中文

🇯🇵日语

多语言团队

用每种主要语言呈现你 CEO 的主题演讲——自然地使用英语、西班牙语、法语、德语、中文、日语等。

旁白:古老的门吱呀一声打开了……

琪拉:我们得走了。现在。

塞恩:我有种不好的预感。

游戏与娱乐

用独特的声音让角色栩栩如生,无需为每一句对白安排录音棚时间。

第三章

发现

她打开笔记本,发现笔迹毫无疑问是她自己的,尽管她完全不记得写过这些。

播客与有声读物解说

让你的叙述引人入胜。将脚本变成完整的有声读物,用你自己的声音逐章解说,无需踏入录音棚。

实时支持

我需要帮助处理我最近的订单。

当然!让我调出你的订单详情。

录制

在今天的节目中,我们深入探讨了人工智能的未来,以及它对各地创作者的意义。

原始

保留

🇺🇸

🇪🇸

🇫🇷

🇩🇪

🇨🇳

🇯🇵

🇺🇸英语

🇪🇸西班牙语

🇫🇷法语

🇩🇪德语

🇨🇳中文

🇯🇵日语

旁白:古老的门吱呀一声打开了……

琪拉:我们得走了。现在。

塞恩:我有种不好的预感。

第三章

发现

她打开笔记本,发现笔迹毫无疑问是她自己的,尽管她完全不记得写过这些内容。

品牌语音智能体

为你的客户支持智能体赋予一致且可辨识的声音,使其契合你的品牌形象,而非使用通用预设。

自定义声音

在不到两分钟内克隆你的声音。随处可用。

在 xAI 控制台中录制大约一分钟的自然语音。我们的流水线会验证你是声音所有者,处理你的录音,并在两分钟内交付一个可用于生产环境的声音模型。你的自定义声音继承了所有 TTS 能力:语音标签、多语言输出,以及 REST 和 WebSocket 流式传输。

口令验证

录制中

我的声音就是我的钥匙

步骤 1 朗读一段口令以确认你的身份

自定义声音在我们内置声音可用的所有地方都能使用。将 voice_id 传递给任意 TTS 端点,或将其与 Voice Agent API 配合使用,以构建实时对话智能体。

使用自定义声音调用文本转语音或 Voice Agent API 无需额外付费。

每个自定义声音在创建前都要经过两阶段验证流程。首先,说话者朗读一段验证短语,我们的 STT 引擎会实时转录并匹配,以确认意图和实时存在。然后,我们从验证片段和完整录音中计算说话者嵌入向量,以确认它们属于同一个人。

你不能从已有的录音中克隆声音,也不能克隆他人的声音。

口令验证

录制中

我的声音就是我的钥匙

口令验证

朗读一段验证短语。我们的 STT 引擎会实时转录并匹配,验证你的同意和实时存在。

说话者相似度

空闲

口令

录制中

说话者相似度

来自口令和完整录音的说话者嵌入向量会被比对,以确认它们属于同一个人。

来源:xAI:News(网页) · x.ai

自定义语音与语音库

xAI:News(网页)·2026-04-30 08:00·97天前
AI 导读

xAI于2026年4月30日推出自定义语音和语音库功能。用户可通过约1分钟录音快速克隆声音,并在Grok文本转语音及语音代理API中即时使用,整个过程仅需2分钟。语音库提供集中管理平台,内置语音已超80种,支持28种语言。为确保安全,系统采用两阶段验证,包括实时转录匹配和说话人嵌入确认,以防止未经授权的克隆。这些功能适用于品牌代理、内容创作、无障碍辅助、多语言团队及游戏娱乐等多种场景,且使用自定义语音无需额外费用。

正文 · AI 翻译

你的声音。你的品牌。从一段简短录音中克隆声音,并在 Grok 文本转语音和语音智能体 API 中使用它。

自定义声音 自定义声音使用场景 自定义声音安全

今天,我们推出自定义声音。从几秒钟的音频中克隆你的声音,并立即在 Grok 文本转语音和语音智能体 API 中使用它。

泰勒

SpaceX 广播主持人

原始

克隆

使用场景

自定义声音解锁了一类全新的应用。

实时支持

我需要帮助处理我最近的订单。

当然!让我调出你的订单详情。

品牌语音智能体

为你的客户支持智能体赋予一个一致、可识别的声音,使其与你的品牌形象相匹配,而不是使用通用的预设声音。

录制

在今天的节目中,我们深入探讨了人工智能的未来,以及它对各地创作者的意义。

内容创作者

用自己的声音大规模地解说视频、播客和社交媒体帖子,无需每次都重新录制。

原始

保留

无障碍

为失去说话能力的个人创建个性化声音,保留他们的声音特征。

🇺🇸

🇪🇸

🇫🇷

🇩🇪

🇨🇳

🇯🇵

🇺🇸英语

🇪🇸西班牙语

🇫🇷法语

🇩🇪德语

🇨🇳中文

🇯🇵日语

多语言团队

用每种主要语言呈现你 CEO 的主题演讲——自然地使用英语、西班牙语、法语、德语、中文、日语等。

旁白:古老的门吱呀一声打开了……

琪拉:我们得走了。现在。

塞恩:我有种不好的预感。

游戏与娱乐

用独特的声音让角色栩栩如生,无需为每一句对白安排录音棚时间。

第三章

发现

她打开笔记本,发现笔迹毫无疑问是她自己的,尽管她完全不记得写过这些。

播客与有声读物解说

让你的叙述引人入胜。将脚本变成完整的有声读物,用你自己的声音逐章解说,无需踏入录音棚。

实时支持

我需要帮助处理我最近的订单。

当然!让我调出你的订单详情。

录制

在今天的节目中,我们深入探讨了人工智能的未来,以及它对各地创作者的意义。

原始

保留

🇺🇸

🇪🇸

🇫🇷

🇩🇪

🇨🇳

🇯🇵

🇺🇸英语

🇪🇸西班牙语

🇫🇷法语

🇩🇪德语

🇨🇳中文

🇯🇵日语

旁白:古老的门吱呀一声打开了……

琪拉:我们得走了。现在。

塞恩:我有种不好的预感。

第三章

发现

她打开笔记本,发现笔迹毫无疑问是她自己的,尽管她完全不记得写过这些内容。

品牌语音智能体

为你的客户支持智能体赋予一致且可辨识的声音,使其契合你的品牌形象,而非使用通用预设。

自定义声音

在不到两分钟内克隆你的声音。随处可用。

在 xAI 控制台中录制大约一分钟的自然语音。我们的流水线会验证你是声音所有者,处理你的录音,并在两分钟内交付一个可用于生产环境的声音模型。你的自定义声音继承了所有 TTS 能力:语音标签、多语言输出,以及 REST 和 WebSocket 流式传输。

口令验证

录制中

我的声音就是我的钥匙

步骤 1 朗读一段口令以确认你的身份

自定义声音在我们内置声音可用的所有地方都能使用。将 voice_id 传递给任意 TTS 端点,或将其与 Voice Agent API 配合使用,以构建实时对话智能体。

使用自定义声音调用文本转语音或 Voice Agent API 无需额外付费。

每个自定义声音在创建前都要经过两阶段验证流程。首先,说话者朗读一段验证短语,我们的 STT 引擎会实时转录并匹配,以确认意图和实时存在。然后,我们从验证片段和完整录音中计算说话者嵌入向量,以确认它们属于同一个人。

你不能从已有的录音中克隆声音,也不能克隆他人的声音。

口令验证

录制中

我的声音就是我的钥匙

口令验证

朗读一段验证短语。我们的 STT 引擎会实时转录并匹配,验证你的同意和实时存在。

说话者相似度

空闲

口令

录制中

说话者相似度

来自口令和完整录音的说话者嵌入向量会被比对,以确认它们属于同一个人。

来源:xAI:News(网页)· x.ai