通义发布 Qwen-Audio-3.0-TTS 语音模型
一段参考音能说 16 种语言和 20 种方言
首包延迟做到 300 毫秒级
同一段参考音可以跨 16 种语言念,音色不走样:CV3-Eval 上说话人相似度 16 个语种全部排第一,Plus 平均 82.75 分(百分制,越接近 100 越像本人)。
https://best.xiaohu.ai/article/qwen-audio-3-tts/
通义发布Qwen-Audio-3.0-TTS语音模型,一段参考音即可跨16种语言和20种方言生成语音,且音色不走样。首包延迟低至300毫秒级。在CV3-Eval评测中,该模型在16个语种的说话人相似度上均排名第一,Plus版本平均得分82.75分(百分制)。
通义发布 Qwen-Audio-3.0-TTS 语音模型
一段参考音能说 16 种语言和 20 种方言
首包延迟做到 300 毫秒级
同一段参考音可以跨 16 种语言念,音色不走样:CV3-Eval 上说话人相似度 16 个语种全部排第一,Plus 平均 82.75 分(百分制,越接近 100 越像本人)。
https://best.xiaohu.ai/article/qwen-audio-3-tts/
通义发布Qwen-Audio-3.0-TTS语音模型,一段参考音即可跨16种语言和20种方言生成语音,且音色不走样。首包延迟低至300毫秒级。在CV3-Eval评测中,该模型在16个语种的说话人相似度上均排名第一,Plus版本平均得分82.75分(百分制)。
通义发布 Qwen-Audio-3.0-TTS 语音模型
一段参考音能说 16 种语言和 20 种方言
首包延迟做到 300 毫秒级
同一段参考音可以跨 16 种语言念,音色不走样:CV3-Eval 上说话人相似度 16 个语种全部排第一,Plus 平均 82.75 分(百分制,越接近 100 越像本人)。
https://best.xiaohu.ai/article/qwen-audio-3-tts/