MiniMax Speech 2.8:为 AI 语音注入生命
访问 API
立即体验音频
MiniMax Speech 2.8:为 AI 语音注入生命
今天,我们激动地推出 MiniMax Speech 2.8。
这不仅仅是一次技术升级,更是语音真实感方面的突破。通过引入原生音效标签支持、高保真克隆以及录音棚级清晰度,我们正在缩小 AI 与人声之间的差距。
我们的使命始终明确:让合成语音真正听起来像人声,且难以分辨。
1. 重拾“细微之处”:教会 AI 停顿与呼吸
过去,AI 语音常常因为“过于完美”而显得冰冷。真实的人类语言充满了不完美的呼吸、停顿和迟疑——这些细微信号能够传达情感并强调重点。
Speech 2.8 引入了原生音效标签。通过对“嗯”、“呃”、“啊”等口语填充词进行建模,我们保留了人类对话中自然的节奏、音高和停顿。
不再有机械、平淡的语音;温暖就藏在这些细节之中。
Speech-2.8 音效标签演示
文本:“嘿,是我。你好吗?(轻笑)希望你今天过得超棒!我们昨天其实经历了一场有点疯狂的发布日,你知道的,但是(呼吸)我刚恢复过来,准备大干一场。你听到这个,可能觉得我就是在对着麦克风聊天,对吧?但这里有个反转:(清嗓子)我其实不是人类。我是 MiniMax 全新的 Speech 2.8 模型。很疯狂,对吧?(笑声)如果你仔细听,就能听出我是如何把控节奏、那些细微的呼吸,甚至那种随意的感觉。祝你有美好的一天!”
2. 语音克隆:10 秒内复制你的“声音指纹”
我们优化了特征提取流程,在语音克隆方面达到了新的相似度水平。仅需 10 秒的样本,Speech 2.8 就能精确捕捉你独特的音色、气息感,甚至是你特定的说话节奏。
结果不仅仅是听起来“像”你的声音——它就是你。
原始音频
Speech-2.8 克隆结果
这个英文演示展示了 Speech 2.8 如何捕捉专业解说员的“灵魂”:
真实对话感:声音带有一种“生活化”的特质。它不像刻板的播音员,而更像一位值得信赖的朋友在咖啡桌旁分享故事。
动态节奏:该说话者使用自然的填充词和节奏性停顿(例如“不过话说回来”、“你知道的”),营造出一种即兴感和临场感。
温暖的中频共鸣:音色沉稳而稳定,带来舒适与可靠的感觉,能迅速与听者建立融洽关系。
3. 纯净音频:消除背景噪音与数字伪影
音频纯净度是优质体验的基础。
我们重新设计了处理引擎,以消除背景噪音和合成失真。其结果是输出清晰透明、纯净无瑕的声音,带来专业解说员在录音棚录制般的临场感。
Speech-2.8 无噪音演示
在森林深处,存在着一种未被触碰的寂静。当第一缕晨光透过茂密的树冠洒下时,世界仿佛屏住了呼吸。仔细聆听——那是风穿过松林的轻柔低语,如此细腻,几乎比秘密还要隐秘。
让我们在这份宁静中稍作停留,重新发现那个喧嚣世界常常隐藏起来的、本质的温柔。
更智能的跨语言表现:为每个市场提供全球化的声音
我们正在通过消除AI语音中常见的“口音渗透”现象来打破语言障碍。
从我们的普通话-日语语对开始,我们修复了不自然的语调和发音变化,确保每个声音听起来都像真正的母语者。敬请期待,我们很快会将这种无缝体验带到更多语言中。
Speech-2.8 跨语言演示
MiniMax Speech 2.8 现已上线。体验下一代智能。
• MiniMax 开放平台:Platform.minimax.io/docs/guides/models-intro
• MiniMax 音频:Minimax.io/audio
智能,与每个人同行。