MiniMax:Blog(网页)
精选

MiniMax Speech 2.8 语音模型

2026-01-23 00:00· 206天前· MiniMax
AI 导读

MiniMax 发布新一代语音模型 MiniMax Speech 2.8,通过原生声音标签技术模拟人类口语中的"嗯"、"啊"等填充词及呼吸停顿,显著提升对话自然度。该模型支持10秒样本高保真声音克隆,精准还原音色与语速,同时消除背景噪音与数字伪影,输出录音室级纯净音质。此外,模型优化了跨语言表现,从普通话-日语对开始解决口音渗透问题,实现更接近母语者的发音效果。

推荐理由

10秒样本克隆真人声线,AI说话带'嗯啊'呼吸声,MiniMax语音模型上新

正文 · AI 翻译

MiniMax Speech 2.8:为 AI 语音注入生命

访问 API

立即体验音频

https://filecdn.minimax.chat/public/45c1ba31-b49a-41b4-bd04-2970fbc337b1.png

MiniMax Speech 2.8:为 AI 语音注入生命

今天,我们激动地推出 MiniMax Speech 2.8。

这不仅仅是一次技术升级,更是语音真实感方面的突破。通过引入原生音效标签支持、高保真克隆以及录音棚级清晰度,我们正在缩小 AI 与人声之间的差距。

我们的使命始终明确:让合成语音真正听起来像人声,且难以分辨。

1. 重拾“细微之处”:教会 AI 停顿与呼吸

过去,AI 语音常常因为“过于完美”而显得冰冷。真实的人类语言充满了不完美的呼吸、停顿和迟疑——这些细微信号能够传达情感并强调重点。

Speech 2.8 引入了原生音效标签。通过对“嗯”、“呃”、“啊”等口语填充词进行建模,我们保留了人类对话中自然的节奏、音高和停顿。

不再有机械、平淡的语音;温暖就藏在这些细节之中。

Speech-2.8 音效标签演示

文本:“嘿,是我。你好吗?(轻笑)希望你今天过得超棒!我们昨天其实经历了一场有点疯狂的发布日,你知道的,但是(呼吸)我刚恢复过来,准备大干一场。你听到这个,可能觉得我就是在对着麦克风聊天,对吧?但这里有个反转:(清嗓子)我其实不是人类。我是 MiniMax 全新的 Speech 2.8 模型。很疯狂,对吧?(笑声)如果你仔细听,就能听出我是如何把控节奏、那些细微的呼吸,甚至那种随意的感觉。祝你有美好的一天!”

2. 语音克隆:10 秒内复制你的“声音指纹”

我们优化了特征提取流程,在语音克隆方面达到了新的相似度水平。仅需 10 秒的样本,Speech 2.8 就能精确捕捉你独特的音色、气息感,甚至是你特定的说话节奏。

结果不仅仅是听起来“像”你的声音——它就是你。

原始音频

Speech-2.8 克隆结果

这个英文演示展示了 Speech 2.8 如何捕捉专业解说员的“灵魂”:

真实对话感:声音带有一种“生活化”的特质。它不像刻板的播音员,而更像一位值得信赖的朋友在咖啡桌旁分享故事。

动态节奏:该说话者使用自然的填充词和节奏性停顿(例如“不过话说回来”、“你知道的”),营造出一种即兴感和临场感。

温暖的中频共鸣:音色沉稳而稳定,带来舒适与可靠的感觉,能迅速与听者建立融洽关系。

3. 纯净音频:消除背景噪音与数字伪影

音频纯净度是优质体验的基础。

我们重新设计了处理引擎,以消除背景噪音和合成失真。其结果是输出清晰透明、纯净无瑕的声音,带来专业解说员在录音棚录制般的临场感。

Speech-2.8 无噪音演示

在森林深处,存在着一种未被触碰的寂静。当第一缕晨光透过茂密的树冠洒下时,世界仿佛屏住了呼吸。仔细聆听——那是风穿过松林的轻柔低语,如此细腻,几乎比秘密还要隐秘。

让我们在这份宁静中稍作停留,重新发现那个喧嚣世界常常隐藏起来的、本质的温柔。

更智能的跨语言表现:为每个市场提供全球化的声音

我们正在通过消除AI语音中常见的“口音渗透”现象来打破语言障碍。

从我们的普通话-日语语对开始,我们修复了不自然的语调和发音变化,确保每个声音听起来都像真正的母语者。敬请期待,我们很快会将这种无缝体验带到更多语言中。

Speech-2.8 跨语言演示

MiniMax Speech 2.8 现已上线。体验下一代智能。

• MiniMax 开放平台:Platform.minimax.io/docs/guides/models-intro

• MiniMax 音频:Minimax.io/audio

智能,与每个人同行。

来源:MiniMax:Blog(网页) · minimax.io

MiniMax Speech 2.8 语音模型

MiniMax:Blog(网页)·2026-01-23 00:00·206天前·MiniMax
AI 导读

MiniMax 发布新一代语音模型 MiniMax Speech 2.8,通过原生声音标签技术模拟人类口语中的"嗯"、"啊"等填充词及呼吸停顿,显著提升对话自然度。该模型支持10秒样本高保真声音克隆,精准还原音色与语速,同时消除背景噪音与数字伪影,输出录音室级纯净音质。此外,模型优化了跨语言表现,从普通话-日语对开始解决口音渗透问题,实现更接近母语者的发音效果。

正文 · AI 翻译

MiniMax Speech 2.8:为 AI 语音注入生命

访问 API

立即体验音频

https://filecdn.minimax.chat/public/45c1ba31-b49a-41b4-bd04-2970fbc337b1.png

MiniMax Speech 2.8:为 AI 语音注入生命

今天,我们激动地推出 MiniMax Speech 2.8。

这不仅仅是一次技术升级,更是语音真实感方面的突破。通过引入原生音效标签支持、高保真克隆以及录音棚级清晰度,我们正在缩小 AI 与人声之间的差距。

我们的使命始终明确:让合成语音真正听起来像人声,且难以分辨。

1. 重拾“细微之处”:教会 AI 停顿与呼吸

过去,AI 语音常常因为“过于完美”而显得冰冷。真实的人类语言充满了不完美的呼吸、停顿和迟疑——这些细微信号能够传达情感并强调重点。

Speech 2.8 引入了原生音效标签。通过对“嗯”、“呃”、“啊”等口语填充词进行建模,我们保留了人类对话中自然的节奏、音高和停顿。

不再有机械、平淡的语音;温暖就藏在这些细节之中。

Speech-2.8 音效标签演示

文本:“嘿,是我。你好吗?(轻笑)希望你今天过得超棒!我们昨天其实经历了一场有点疯狂的发布日,你知道的,但是(呼吸)我刚恢复过来,准备大干一场。你听到这个,可能觉得我就是在对着麦克风聊天,对吧?但这里有个反转:(清嗓子)我其实不是人类。我是 MiniMax 全新的 Speech 2.8 模型。很疯狂,对吧?(笑声)如果你仔细听,就能听出我是如何把控节奏、那些细微的呼吸,甚至那种随意的感觉。祝你有美好的一天!”

2. 语音克隆:10 秒内复制你的“声音指纹”

我们优化了特征提取流程,在语音克隆方面达到了新的相似度水平。仅需 10 秒的样本,Speech 2.8 就能精确捕捉你独特的音色、气息感,甚至是你特定的说话节奏。

结果不仅仅是听起来“像”你的声音——它就是你。

原始音频

Speech-2.8 克隆结果

这个英文演示展示了 Speech 2.8 如何捕捉专业解说员的“灵魂”:

真实对话感:声音带有一种“生活化”的特质。它不像刻板的播音员,而更像一位值得信赖的朋友在咖啡桌旁分享故事。

动态节奏:该说话者使用自然的填充词和节奏性停顿(例如“不过话说回来”、“你知道的”),营造出一种即兴感和临场感。

温暖的中频共鸣:音色沉稳而稳定,带来舒适与可靠的感觉,能迅速与听者建立融洽关系。

3. 纯净音频:消除背景噪音与数字伪影

音频纯净度是优质体验的基础。

我们重新设计了处理引擎,以消除背景噪音和合成失真。其结果是输出清晰透明、纯净无瑕的声音,带来专业解说员在录音棚录制般的临场感。

Speech-2.8 无噪音演示

在森林深处,存在着一种未被触碰的寂静。当第一缕晨光透过茂密的树冠洒下时,世界仿佛屏住了呼吸。仔细聆听——那是风穿过松林的轻柔低语,如此细腻,几乎比秘密还要隐秘。

让我们在这份宁静中稍作停留,重新发现那个喧嚣世界常常隐藏起来的、本质的温柔。

更智能的跨语言表现:为每个市场提供全球化的声音

我们正在通过消除AI语音中常见的“口音渗透”现象来打破语言障碍。

从我们的普通话-日语语对开始,我们修复了不自然的语调和发音变化,确保每个声音听起来都像真正的母语者。敬请期待,我们很快会将这种无缝体验带到更多语言中。

Speech-2.8 跨语言演示

MiniMax Speech 2.8 现已上线。体验下一代智能。

• MiniMax 开放平台:Platform.minimax.io/docs/guides/models-intro

• MiniMax 音频:Minimax.io/audio

智能,与每个人同行。

来源:MiniMax:Blog(网页)· minimax.io