# 阿里发布实时语音交互对话模型 Qwen-Audio-3.0-Realtime

- 来源：IT之家（RSS）
- 发布时间：2026-07-15 11:00
- AIHOT 分数：62
- AIHOT 链接：https://aihot.virxact.com/items/cmrlj9p000bqibi2b760rgikp
- 原文链接：https://www.ithome.com/0/976/865.htm

## AI 摘要

阿里巴巴今日发布实时语音交互对话模型 Qwen-Audio-3.0-Realtime，包含推理更强的 Plus 版本和速度更快的 Flash 版本。该模型在 S2S 语音指令遵循基准 VStyle 上取得 SOTA 效果，并在 Artificial Analysis 子项中综合排名第一，超越 OpenAI GPT-Realtime-2。

## 正文

IT之家 7 月 15 日消息，阿里巴巴实时语音交互对话模型 Qwen-Audio-3.0-Realtime 今天（15 日）正式发布，在智商、Agent 工具调用、共情对话和双工交互流畅度四条主线上同步升级，力求“又快又聪明”。

模型包括推理更强的 Plus 版本和速度更快的 Flash 版本，适用于智能客服、教育培训、娱乐互动与情感陪伴等场景。官方表示，该模型将让语音交互“懂倾听，更聪明”。

针对自定义音色需求，也提供了音色克隆能力配置用于实际业务应用。在 S2S 语音指令遵循公开 Benchmark VStyle 上取得 SOTA 效果。

官方公布了该模型的一系列亮点如下：

根据语境动态调整语气与情感表达，支持音色克隆，告别机械朗读感；

内置多模态双工控制模型，支持声纹级背景过滤，嘈杂环境下对话依然流畅，不易被打断；

Artificial Analysis 子项中综合排名第一，超越 OpenAI GPT-Realtime-2。

支持动态工具调用，可完成路线规划、信息查询等任务，不止是聊天。

模型能够根据对话语境动态调整语气、节奏、音调和情感表达，实现真正拟人化的语音交互。

在激烈的辩论场景中，准确理解对方论点、快速组织反驳逻辑，同时保持口语化表达和适当的语气强度。

角色扮演时，能根据设定的角色（如历史人物、职业身份等）调整说话风格、用词习惯和情感表达，并响应显式指令进行风格切换。

在情感陪伴中，当你倾诉烦恼或分享喜悦时，通过语调、节奏和内容表达共情，提供温暖的情感支持。

该模型实现生成侧的深度优化。

情感感知生成：识别你的情绪状态，并给予有温度的共情回应。

韵律动态调整：根据语义重点与对话节奏，自动调整语速、停顿、重音等韵律特征。

副语言信息处理：能够理解和生成笑声、叹息、犹豫等非语言声音信号，还原真人交流的细腻。

个性化风格适配：一秒切换专属说话风格，完美演绎你设定的任何角色。

无论身处何种复杂声场，它都能保持从容：

嘈杂背景环境下的双工对话：在餐厅、开放工区等嘈杂环境中，不受干扰，精准锁定你的声音。

多人交谈不打断：在多人讨论中，准确识别主对话对象，不被旁听者干扰。

多说话人智能切换：根据上下文和语义线索，智能判断当前对话对象，在不同说话人间自然切换。

IT之家附体验地址如下：

qwen-audio-3.0-realtime-plus API: 点此前往

qwen-audio-3.0-realtime-flash API: 点此前往

Qwen-Audio-3.0-Realtime 文档：点此前往

Demo：点此前往
