推出 Qwen-Audio-3.0-TTS。
我们最新的文本转语音模型,提供两个版本: • Flash:实时交互 • Plus:高质量生成
新特性: • 细粒度内联标签控制——[低语]、[愤怒]、[呼吸声] 和 [笑声] • 自由风格的自然语言控制——“读慢一点,像讲睡前故事一样” • 支持 16 种语言 • 即使参考音频有噪音,也能输出干净语音 • 一次生成长文本最长可达 3 分钟
目前在 Artificial Analysis TTS 排行榜上排名第一。
博客:https://funaudiollm.github.io/qwen-audio-3.0-tts/ API:https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide