公众号:通义实验室(千问)
精选
75AI 编辑部评分,满分 100

Qwen-Audio-3.0-TTS 发布:从"能说话"到"会表达"

2026-07-20 16:54· 14天前· 通义实验室
精选理由

从「能说话」到「会表达」,区别在于用自然语言指令和标签精确控制情绪与细节,这为需要多语种和方言的商业场景降低了声音设计门槛。

AI 摘要

通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,含 Flash 与 Plus 两个版本,首包延迟约 300ms。模型支持 16 种语言和 20 种方言,Plus 版在 Artificial Analysis 榜单夺冠,平均说话人相似度达 82.75。新增 Free-style 自然语言指令、细粒度标签控制及嘈杂环境鲁棒性,音频输出提升至 48K,单次合成最长 3 分钟。

公众号正文需在微信内阅读,站内仅提供摘要。

Qwen-Audio-3.0-TTS 发布:从"能说话"到"会表达"

公众号:通义实验室(千问)·2026-07-20 16:54·14天前·通义实验室
精选理由

从「能说话」到「会表达」,区别在于用自然语言指令和标签精确控制情绪与细节,这为需要多语种和方言的商业场景降低了声音设计门槛。

事件有新进展通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜本文发布后另有 1 篇报道 · 查看事件全貌 →
AI 摘要

通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,含 Flash 与 Plus 两个版本,首包延迟约 300ms。模型支持 16 种语言和 20 种方言,Plus 版在 Artificial Analysis 榜单夺冠,平均说话人相似度达 82.75。新增 Free-style 自然语言指令、细粒度标签控制及嘈杂环境鲁棒性,音频输出提升至 48K,单次合成最长 3 分钟。

公众号正文需在微信内阅读,站内仅提供摘要。

在微信中打开原文mp.weixin.qq.com(在新标签页打开)