IT之家(RSS)
62AI 编辑部评分,满分 100

阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别大模型,让 AI 更好听懂专业词汇

2026-07-31 11:57· 14分钟前
跳到正文
AI 摘要

阿里巴巴发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度做了系统性优化,并具备语音润色能力,可直接输出结构化文本。

IT之家 7 月 31 日消息,阿里巴巴今日发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash。简单来说,就是让 AI 更好地听懂专业词汇。

Qwen-Audio-3.0-ASR-Flash 主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时让模型具备语音润色能力,可直接输出结构化文本。

研究团队持续从医疗、IT 编程、股票、社会名人等领域里挖掘专业词汇,建成了覆盖多行业的高质量词库,加强模型对专业术语和冷门词的识别。在最新的行业词汇内部评测中,新模型对各行业专业词的“听中率”都有明显提升,其中医疗场景更是突破了 95.36%

图片

目前,Qwen-Audio-ASR-Flash 系列已经在会议纪要整理、实时字幕、教育录播、智能客服等场景里得到验证,曾在 AI 评测平台 Artificial Analysis 上,以 1.7% 的错字率拿下全球第一

Qwen-Audio-3.0-ASR—— 现已通过阿里云百炼平台开放调用,提供三个版本:

  • Qwen-Audio-3.0-ASR-Flash:语音识别,最长 5 分钟

  • Qwen-Audio-3.0-ASR-Filetrans:离线文件转写

  • Qwen-Audio-3.0-ASR-Streaming:实时语音识别

IT之家附 Qwen-Audio-3.0-ASR-Flash 体验地址如下:

Qwen-Audio-3.0-ASR-Flash:

Qwen-Audio-3.0-ASR-Flash-Filetrans

Qwen-Audio-3.0-ASR-Flash-Streaming

阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别大模型,让 AI 更好听懂专业词汇

IT之家(RSS)·2026-07-31 11:57·14分钟前
阅读原文· ithome.com
AI 摘要

阿里巴巴发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度做了系统性优化,并具备语音润色能力,可直接输出结构化文本。

原文

IT之家 7 月 31 日消息,阿里巴巴今日发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash。简单来说,就是让 AI 更好地听懂专业词汇。

Qwen-Audio-3.0-ASR-Flash 主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时让模型具备语音润色能力,可直接输出结构化文本。

研究团队持续从医疗、IT 编程、股票、社会名人等领域里挖掘专业词汇,建成了覆盖多行业的高质量词库,加强模型对专业术语和冷门词的识别。在最新的行业词汇内部评测中,新模型对各行业专业词的“听中率”都有明显提升,其中医疗场景更是突破了 95.36%

图片

目前,Qwen-Audio-ASR-Flash 系列已经在会议纪要整理、实时字幕、教育录播、智能客服等场景里得到验证,曾在 AI 评测平台 Artificial Analysis 上,以 1.7% 的错字率拿下全球第一

Qwen-Audio-3.0-ASR—— 现已通过阿里云百炼平台开放调用,提供三个版本:

  • Qwen-Audio-3.0-ASR-Flash:语音识别,最长 5 分钟

  • Qwen-Audio-3.0-ASR-Filetrans:离线文件转写

  • Qwen-Audio-3.0-ASR-Streaming:实时语音识别

IT之家附 Qwen-Audio-3.0-ASR-Flash 体验地址如下:

Qwen-Audio-3.0-ASR-Flash:

Qwen-Audio-3.0-ASR-Flash-Filetrans

Qwen-Audio-3.0-ASR-Flash-Streaming

阅读原文ithome.com