MiniMax Speech 2.6:终极语音智能体已到来
访问 API
立即体验音频
今天,我们激动地推出 MiniMax Speech 2.6——这是我们最新的语音模型,带来了全方位的升级,包括
超低延迟、增强的格式处理能力,
以及更加
自然、逼真的
语音,专为语音智能体场景打造。
自发布以来,MiniMax Speech 凭借其卓越的语音技术和极高的性价比,已成为全球语音智能领域的基础设施核心组件。
从为 ChatGPT 高级语音模式提供支持的 LiveKit、GitHub 上流行的开源框架 Pipecat,到 YC 孵化的语音平台 Vapi,均选择 MiniMax Speech 作为其底层技术引擎。在智能硬件领域,诸如 Haivivi Bubble Pal、Fuzozo 和 Rokid Glasses 等创新产品,同样由 MiniMax Speech 驱动,以实现其自然的语音交互体验。
MiniMax 持续通过技术创新推动新型生产力,打破语言与文化的壁垒,提供自然流畅的交互,连接世界各地的每一个声音。
1. 超低延迟,响应更迅速:实现更流畅的整体交互
我们全面优化了音频生成管线,实现了低于 250 毫秒的端到端延迟——达到行业顶尖水平。在实时对话等对响应时间要求严苛的场景中,音频生成不再是瓶颈,确保了更流畅的整体交互体验。
聆听 Speech 2.6 扮演 AI 客服智能体的效果:
AI 客服
2. 无缝处理特殊格式,更智能:实现更流畅的信息传递
Speech 2.6 现在能直接转换多种语言中的非标准文本格式,包括 URL、电子邮件地址、电话号码、日期和货币金额。无论你是将其与大语言模型配合使用,还是需要在业务中处理动态变化的实体信息,都无需再进行繁琐的文本预处理。输入内容从一开始就能被正确朗读,从而实现更流畅的信息传递。
例如,要正确朗读以下段落,传统 TTS 需要进行一系列转换:
- +1 415 415 9921 → “加一,四一五,四一五,九九二一”
- $1,234.56 → “一千二百三十四美元五十六美分”
- 192.168.1.1 → “一九二点一六八点一点一”
- 2032-5-6 → “二零三二年五月六日”
- support-vip@technet.com → “support 横杠 vip at technet 点 com”
复杂格式段落处理
原文:
“你好,Oliver Smith,我是你的智能虚拟助手 Max!感谢你的来电。我已找到你的档案。电话号码 +1 415 415 9921 的未结余额为 $1,234.56。关联的 IP 地址是 192.168.1.1。你的下一期付款应于 2032-5-6 前支付。如有任何疑问,请联系 support-vip@technet.com。”
3. 更高的自然度与 Fluent LoRA:实现更流畅的语音表达
除了进一步提升韵律自然度,Speech 2.6 还引入了 Fluent LoRA。
Speech 2.5 已经提供了便捷、高保真的声音克隆功能,允许用户保留原始声音的独特特征,例如口音和说话习惯。这一能力满足了真实应用场景中多样化的语音需求。
现在,你在克隆声音时不再需要担心源素材不完美。即使录音带有口音或不流畅的非母语录音,Fluent LoRA 也能完美复刻声音的音色,同时生成与目标文本匹配的流畅、自然的语音,让你的语音表达更加清晰。
除了视频中展示的英文示例外,该功能支持在该模型所支持的 40 多种语言中实现声音克隆的一键流畅化。以下是一个日语场景的示例:
原始录音
未使用 Fluent LoRA
使用 Fluent LoRA 优化后
Speech 2.6 现已全面上线。欢迎试用:
MiniMax 开放平台:
https://www.minimax.io/platform_overview
MiniMax Audio:
https://www.minimax.io/audio
智能与每个人同行。
