内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态一手 · 154 条
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「语音」清除

8月13日周四

18:01公众号:小红书技术(dots.llm)75精选小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座

8月12日周三

19:02公众号:火山引擎39奇瑞×火山引擎:东南亚首个AI大模型座舱发布,OMODA 4搭载豆包大模型亮相

8月11日周二

22:33Sierra:Blog(RSS)37Sierra 教智能体应对难缠的 IVR 电话菜单系统

8月8日周六

02:31Sierra:Blog(RSS)24Sierra 推出 Voice Personas,让智能体同时定制行为与表达

8月7日周五

16:01公众号:面壁智能(MiniCPM)41独立开发者用VoxCPM克隆网红声音实现实时对话,获百万播放
14:51公众号:面壁智能(MiniCPM)65精选独立开发者用 VoxCPM 克隆网红声音,让 AI 终于"会聊天"了

8月6日周四

02:16Claude:YouTube(RSS)23What happens when you talk to AI?

8月5日周三

12:12字节 Seed:Research Feed(网页内嵌数据)78精选字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互
01:29LangChain:Blog(RSS)64如何用 LangSmith 评估语音智能体

8月4日周二

16:20公众号:腾讯混元65精选腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别
04:33OpenAI:官网动态(RSS · 排除企业/客户案例)50GPT-Live 如何在六个月内构建响应式语音 AI 实时系统

7月31日周五

12:57公众号:昆仑万维(天工)48Skywork Note 上线一周售罄,昆仑万维将推 Recall 与 TriRing 全套智能硬件家族
09:57OpenAI:官网动态(RSS · 排除企业/客户案例)46avatarin 如何用 GPT-Realtime 为山田电机打造 24/7 零售智能体

7月29日周三

05:50Apple Machine Learning Research(RSS)55Apple 为 Siri Expressive Voices 推出内存高效的音频合成架构

7月27日周一

18:00公众号:腾讯混元47腾讯微证券早报接入混元大模型,推出可随时打断的AI播客与记忆助手
14:16公众号:腾讯混元54腾讯微证券早报上线混元 AI 播客,支持边听边互动

7月24日周五

00:30Microsoft AI:官方博客(网页)43Introducing MAI-Image-2.5-Pro and MAI-Voice-2-Flash

7月22日周三

13:53OpenRouter:Announcements(RSS)72精选OpenRouter 新增音频转写 API,支持 Whisper 与 token 计价 STT 模型
00:02LangChain:Blog(RSS)54LangSmith 新增对 Pipecat、LiveKit、OpenAI Realtime 和 Gemini Live 语音智能体的追踪支持

7月20日周一

17:10公众号:通义实验室(千问)70精选通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型
16:54公众号:通义实验室(千问)75精选Qwen-Audio-3.0-TTS 发布:从"能说话"到"会表达"
11:48字节 Seed:Research Feed(网页内嵌数据)79精选字节跳动发布 Seed Audio 1.0 音频创作模型,统一建模人声与音效实现端到端影视级音频生成

7月17日周五

17:06公众号:千问APP(阿里)45这届WAIC,千问AI智能体眼镜、耳机申请出战!

7月15日周三

10:40公众号:通义实验室(千问)73精选阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一
10:31公众号:通义实验室(千问)78精选Qwen-Audio-3.0-Realtime 如何让语音交互"懂倾听,更聪明"?

7月9日周四

15:50Microsoft AI:官方博客(网页)15Bringing Ode Poetry to life with MAI's audio models
01:08OpenAI:官网动态(RSS · 排除企业/客户案例)77精选OpenAI 发布 GPT-Live 新一代全双工语音模型

7月7日周二

06:43xAI:News(网页)68精选xAI 为 Grok Voice 新增 21 个旗舰语音
02:09Apple Machine Learning Research(RSS)39段注意力解码与长格式声学编码

7月6日周一

22:08Apple Machine Learning Research(RSS)53Apple 提出专用小型 seq2seq 模型用于 ASR 纠错
22:08Apple Machine Learning Research(RSS)49连续扩散口语语言模型的缩放性质研究
14:20公众号:通义实验室(千问)73精选Fun-ASR-Realtime 发布:单模型支持30种语言与16种方言,识别准确率领先
14:09公众号:通义实验室(千问)65精选Fun-ASR-Realtime 发布:单模型支持 30 种语言与 16 种方言,流式识别准确率接近离线水平

7月3日周五

23:46公众号:京东JoyAI68精选JoyAI App 上线 UGC 数字人功能,用户可"捏"出专属虚拟玩伴

7月2日周四

00:20xAI:News(网页)77精选xAI 发布 Voice Agent Builder 测试版

7月1日周三

05:25Suno:Blog(网页)40Dream Relic:用 Suno 为超现实影像配乐
01:29Apple:Newsroom(RSS)66精选Apple Creator Studio 更新:更智能、更快速、更互联

6月25日周四

00:15Hugging Face:Blog(RSS)61精选FFASR 排行榜发布:真实远场条件下 ASR 评测

6月23日周二

13:50公众号:火山引擎71精选豆包音频生成模型1.0发布,重新定义AI音频创作

6月18日周四

18:40公众号:火山引擎72精选火山引擎上线豆包实时语音模型3.0 API 服务,开启邀测
已加载 40 条
全部 AI 动态
2026年8月17日星期一 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
一手信源 · 标签「语音」 · 154 条清除

8月13日

星期四 · 1 条
18:01
公众号:小红书技术(dots.llm)精选
AI 评分 75/100
小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座

小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。

开源生态模型发布语音

推荐理由:连续自回归跳过离散 Token 的信息损失,又用语义编码器回灌历史抑制累积误差,为音色克隆和低步数流式共用同一基座提供了路径。

8月12日

星期三 · 1 条
19:02
公众号:火山引擎
AI 评分 39/100
奇瑞×火山引擎:东南亚首个AI大模型座舱发布,OMODA 4搭载豆包大模型亮相

奇瑞旗下品牌OMODA&JAECOO携手火山引擎在印尼发布东南亚首个具备完整AI原生能力、规模化量产落地的智能座舱方案,首款搭载豆包大模型的车型OMODA 4同步亮相。该座舱依托豆包大模型与Agentic AI架构,由主智能体驱动十大车载智能体协同运作,支持英语、中文、印尼语、泰语、马来语五种语言交互,并采用端云协同架构确保无网、弱网场景下核心功能稳定运行。

产品更新端侧语音

8月11日

星期二 · 1 条
22:33
Sierra:Blog(RSS)
AI 评分 37/100
Sierra 教智能体应对难缠的 IVR 电话菜单系统

Sierra 的智能体现在开箱即可应对最具挑战性的 IVR 电话系统,它们能判断何时拨打电话、如何穿越多层菜单、何时保持沉默,以及如何识别已接通真人。

智能体产品更新语音

8月8日

星期六 · 1 条
02:31
Sierra:Blog(RSS)
AI 评分 24/100
Sierra 推出 Voice Personas,让智能体同时定制行为与表达

Sierra 今日发布 Voice Personas,将智能体的行为与表达方式解耦,允许企业分别设计“做什么”和“怎么说”。该功能旨在让 AI 智能体在完成任务的同时,以更贴合品牌调性的语气与用户互动,提升客户体验的个性化程度。

智能体产品更新语音

8月7日

星期五 · 2 条
16:01
公众号:面壁智能(MiniCPM)
AI 评分 41/100
独立开发者用VoxCPM克隆网红声音实现实时对话,获百万播放

独立开发者叶小叔用面壁智能开源的VoxCPM声音克隆模型,成功让AI克隆网红声音并实现实时对话,视频在抖音获100万播放、X上5.9万人围观。此前他尝试本地开源模型(TTS合成需14-40秒)和云端Cartesia Pro(中文效果不佳)均失败,最终租用RunPod L4 GPU($0.4/小时)部署VoxCPM,TTS首包延迟不到1秒,端到端体感2-3秒。

开源生态教程/实践语音
14:51
公众号:面壁智能(MiniCPM)精选
AI 评分 65/100
独立开发者用 VoxCPM 克隆网红声音,让 AI 终于"会聊天"了

独立开发者叶小叔用面壁智能开源的 VoxCPM 克隆千万粉丝网红声音,搭建 STT → LLM → VoxCPM(TTS)三段式实时对话管道,TTS 首包延迟不到 1 秒,端到端体感 2 到 3 秒。

Hugging Face开源生态教程/实践语音

推荐理由:案例的实践价值在于澄清了实时对话 TTS 环节的选择逻辑:中文原生支持与默认参数平衡往往优于盲目追求极致克隆,这一取舍对同类项目具直接参考。

8月6日

星期四 · 1 条
02:16
Claude:YouTube(RSS)
AI 评分 23/100
What happens when you talk to AI?
Anthropic现象/趋势语音

8月5日

星期三 · 2 条
12:12
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 78/100
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。

多模态模型发布视频语音
另有 3 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)
推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。
01:29
LangChain:Blog(RSS)
AI 评分 64/100
如何用 LangSmith 评估语音智能体

LangChain 官方博客介绍如何用 LangSmith 评估语音智能体,覆盖执行、结果与来电者体验三个层面。评估手段包括 LangSmith traces、代码评估器、LLM judges 和人工审查,帮助开发者系统化验证语音智能体的实际表现。

智能体教程/实践语音

8月4日

星期二 · 2 条
16:20
公众号:腾讯混元精选
AI 评分 65/100
腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。

模型发布语音部署/工程
另有 2 家信源报道IT之家(RSS)X:腾讯混元 (@TencentHunyuan)
推荐理由:将 LLM 语义理解融入语音识别,上下文纠错和热词注入降低了专业场景的接入成本,元宝已集成可体验。
04:33
OpenAI:官网动态(RSS · 排除企业/客户案例)
AI 评分 50/100
GPT-Live 如何在六个月内构建响应式语音 AI 实时系统

OpenAI 推出 GPT-Live,实现与 AI 的连续语音交互。该系统采用无轮次语音模型和低延迟架构,使对话更快、更自然。GPT-Live 的构建耗时六个月,核心在于减少交互延迟并支持不间断对话。

OpenAI产品更新语音

7月31日

星期五 · 2 条
12:57
公众号:昆仑万维(天工)
AI 评分 48/100
Skywork Note 上线一周售罄,昆仑万维将推 Recall 与 TriRing 全套智能硬件家族

Skywork Note 上线七天,首批海外库存全部售罄。昆仑万维宣布加速推进整套智能硬件家族,包括录音背夹、AI 挂件 Recall(17.4 克,内置 VAD 语音检测)与 AI 戒指 TriRing(4 至 6 克,行业首个双麦克风降噪算法,可监测心率、HRV、血氧和睡眠)。Note 升级版 Skywork Mate 即将发售,支持 8 米拾音与 6nm AI 音频芯片。

智能体产品更新语音
09:57
OpenAI:官网动态(RSS · 排除企业/客户案例)
AI 评分 46/100
avatarin 如何用 GPT-Realtime 为山田电机打造 24/7 零售智能体

avatarin 借助 OpenAI 的 GPT-Realtime,为山田电机顾客提供 24/7 多语言支持。上线两周内,已有 3 万人使用该智能体,92% 的调研反馈为正面评价。

OpenAI行业动态语音

7月29日

星期三 · 1 条
05:50
Apple Machine Learning Research(RSS)
AI 评分 55/100
Apple 为 Siri Expressive Voices 推出内存高效的音频合成架构

Apple 为 Siri Expressive Voices 推出了一种内存高效的音频合成架构,其 detokenizer 在 AMX 上以约 10ms/步运行,峰值内存仅约 21MB。相比此前设备端系统,该架构将 Mean Opinion Score (MOS) 整体提升 +0.28(4.15 vs. 3.87),对话语音提升 +0.42(4.24 vs. 3.82)。

论文/研究语音

7月27日

星期一 · 2 条
18:00
公众号:腾讯混元
AI 评分 47/100
腾讯微证券早报接入混元大模型,推出可随时打断的AI播客与记忆助手

腾讯自选股旗下微证券早报正式接入腾讯混元大模型,推出AI语音播客,支持用户收听时随时打断并提问,AI主播能即时解答后接回主线。播客提供简洁/深度两种模式及单人/双人播报形态。同时,微证券AI智能助手接入腾讯混元记忆(Hy-Memory),在记忆评测中综合得分79.6,多跳召回率达90%。

产品更新语音
14:16
公众号:腾讯混元
AI 评分 54/100
腾讯微证券早报上线混元 AI 播客,支持边听边互动

腾讯自选股旗下微证券早报接入腾讯混元大模型,推出支持实时互动与随时打断的 AI 语音播客,用户可开口提问,AI 主播即时解答后续接回主线。播客提供简洁版与深度版、单人/双人播报模式。同时,微证券 AI 智能助手接入腾讯混元记忆(Hy-Memory),在记忆评测中综合得分 79.6,多跳召回率达 90%。

产品更新语音

7月24日

星期五 · 1 条
00:30
Microsoft AI:官方博客(网页)
AI 评分 43/100
Introducing MAI-Image-2.5-Pro and MAI-Voice-2-Flash
Microsoft图像生成模型发布语音

7月22日

星期三 · 2 条
13:53
OpenRouter:Announcements(RSS)精选
AI 评分 72/100
OpenRouter 新增音频转写 API,支持 Whisper 与 token 计价 STT 模型

OpenRouter 推出 POST /api/v1/audio/transcriptions 端点,用户可使用同一 API key 将 base64 编码音频发送至该端点,返回 JSON 格式文本与用量对象。

产品更新语音部署/工程

推荐理由:OpenRouter 把语音转录集成进 API,一份 key 搞定聊天和转写,对已经在用的团队省心不少,这篇教程直接可跑。
00:02
LangChain:Blog(RSS)
AI 评分 54/100
LangSmith 新增对 Pipecat、LiveKit、OpenAI Realtime 和 Gemini Live 语音智能体的追踪支持

LangSmith 现已支持追踪基于 Pipecat、LiveKit、OpenAI Realtime 和 Gemini Live 构建的语音智能体。开发者可在单次追踪中捕获音频、语音转文字(STT)和文字转语音(TTS)延迟、中断事件以及工具调用等关键指标。

智能体产品更新语音

7月20日

星期一 · 3 条
17:10
公众号:通义实验室(千问)精选
AI 评分 70/100
通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。

多模态模型发布语音

推荐理由:通义实验室的 TTS 模型更新,把精力花在了真实落地痛点——多语种方言覆盖、自然语言导演式控制、嘈杂环境音色复刻,而且直接可用。做语音交互的产品人可以立刻试试。
16:54
公众号:通义实验室(千问)精选
AI 评分 75/100
Qwen-Audio-3.0-TTS 发布:从"能说话"到"会表达"

通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,含 Flash 与 Plus 两个版本,首包延迟约 300ms。模型支持 16 种语言和 20 种方言,Plus 版在 Artificial Analysis 榜单夺冠,平均说话人相似度达 82.75。新增 Free-style 自然语言指令、细粒度标签控制及嘈杂环境鲁棒性,音频输出提升至 48K,单次合成最长 3 分钟。

模型发布语音
另有 1 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)
推荐理由:从「能说话」到「会表达」,区别在于用自然语言指令和标签精确控制情绪与细节,这为需要多语种和方言的商业场景降低了声音设计门槛。
11:48
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 79/100
字节跳动发布 Seed Audio 1.0 音频创作模型,统一建模人声与音效实现端到端影视级音频生成

字节跳动 Seed 团队发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,支持 100ms 间隔精度的时间控制、单次约 2 分钟音频的延展生成及 20+ 语种自然生成。该模型已在火山方舟体验中心上线,多数场景音频可用率达 90% 以上,多语言音频自然度 MOS 超 4 分。

产品更新多模态语音

推荐理由:字节这次发布的 Seed Audio 1.0 不是又一个 TTS 模型,它把台词、音效、氛围统一编排,并支持百毫秒级时间线控制,对做视频和出海内容的团队是个立刻能用的创作升级。

7月17日

星期五 · 1 条
17:06
公众号:千问APP(阿里)
AI 评分 45/100
这届WAIC,千问AI智能体眼镜、耳机申请出战!

2026世界人工智能大会首日,千问推出AI智能体眼镜与首款AI智能体耳机两大硬件。智能体眼镜升级全双工语音、眼动追踪、体征监测等技术,并实现行业首个用户体征实时监测,可测量心率、血氧、HRV等数据。上述技术年内应用于千问AI智能体眼镜,已发售的千问AI眼镜S1、G1将通过OTA引入Agent能力;耳机由千问与Bose联合打造,支持同声传译、会议纪要等功能。

产品更新多模态端侧语音

7月15日

星期三 · 2 条
10:40
公众号:通义实验室(千问)精选
AI 评分 73/100
阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一

阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。

智能体多模态模型发布语音

推荐理由:我觉得Qwen-Audio-3.0-Realtime把情感表达和背景降噪结合得很好,加上工具调用,语音交互终于从聊天走向任务执行,有API可以直接上手,推荐语音产品经理试试。
10:31
公众号:通义实验室(千问)精选
AI 评分 78/100
Qwen-Audio-3.0-Realtime 如何让语音交互"懂倾听,更聪明"?

阿里语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,支持根据语境动态调整语气与情感、音色克隆,并内置多模态双工控制模型,实现声纹级背景过滤。

智能体模型发布语音

推荐理由:把文本推理能力蒸馏到语音模型同时保留毫秒级响应,这种架构为需要复杂决策的语音智能体提供了可行路径。

7月9日

星期四 · 2 条
15:50
Microsoft AI:官方博客(网页)
AI 评分 15/100
Bringing Ode Poetry to life with MAI's audio models
Microsoft其他语音
01:08
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 77/100
OpenAI 发布 GPT-Live 新一代全双工语音模型

OpenAI 今日推出 GPT‑Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT‑5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT‑Live‑1 和 GPT‑Live‑1 mini 两个版本。人类评估显示,在 5‑10 分钟对话中,GPT‑Live‑1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、BrowseComp 和 τ³‑Voice Telecom 基准测试中也表现更强。未来将开放 API。

OpenAI推理模型发布语音
另有 11 家信源报道The Verge:AI(RSS)X:Jason Liu (@jxnlco)X:OpenAI (@OpenAI)IT之家(RSS)X:Greg Brockman (@gdb)X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)TechCrunch:AI(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Sam Altman (@sama)The Decoder:AI News(RSS)
推荐理由:GPT‑Live 不是简单的语音版本升级,全双工架构让 AI 终于能同时听和说,加上后台调用 GPT‑5.5,对话体验跨了一大步,做语音应用的产品人该重新思考交互流程了。

7月7日

星期二 · 2 条
06:43
xAI:News(网页)精选
AI 评分 68/100
xAI 为 Grok Voice 新增 21 个旗舰语音

xAI 发布 21 个新旗舰语音,加入原有的 5 个语音。所有新语音均支持多语言,已在实时 Voice Agent API、Text to Speech API 及新推出的 Grok Voice Agent Builder 中可用。每个语音针对客服、角色、解说、广告、教育等场景定制,支持通过 [pause] 等语音标签控制表达。原始 5 个语音(Ara、Eve、Leo、Rex、Sal)经重训练后,节奏、措辞和重音的自然度提升。所有语音原生支持 Grok Voice 的 25 种以上语言。

xAI产品更新语音

推荐理由:Grok 一口气放出21种多语言语音,对做语音 agent 的团队是个弹药库更新,但影响的半径基本止于 xAI 生态内部。
02:09
Apple Machine Learning Research(RSS)
AI 评分 39/100
段注意力解码与长格式声学编码

针对基于注意力的编码器-解码器(AED)模型无法直接处理长格式声学编码的问题,研究提出四项改进:在交叉注意力中注入显式的绝对位置编码;采用扩展声学上下文的长格式训练以消除隐式绝对位置编码;通过片段拼接覆盖训练中的多种分段方式;使用语义分割对齐AED解码片段与训练片段。这些方法消除了连续编码与分段编码之间的精度差距,使注意力解码器能够以自回归方式用于长格式解码。

数据/训练论文/研究语音

7月6日

星期一 · 4 条
22:08
Apple Machine Learning Research(RSS)
AI 评分 53/100
Apple 提出专用小型 seq2seq 模型用于 ASR 纠错

Apple 机器学习研究团队采用紧凑的 seq2seq 模型进行 ASR 纠错,训练数据来自真实和合成音频的 ASR 错误。通过级联 TTS 和 ASR 构建合成语料,关键在于匹配真实错误分布的多样性。模型采用 correction-first 解码,生成候选后利用 ASR 声学分数重新排序。与 LLM 相比,该模型参数少 15 倍,在 LibriSpeech test-clean/other 上分别达到 1.5% 和 3.3% 的词错误率(WER),优于 LLM,并能泛化至 CTC、Seq2seq、Transducer 等多种 ASR 架构,在低错误率场景中提供精确纠错。

论文/研究语音
22:08
Apple Machine Learning Research(RSS)
AI 评分 49/100
连续扩散口语语言模型的缩放性质研究

Apple与Google团队研究连续扩散(CD)口语语言模型(SLM)的缩放性质。CD SLM直接处理连续语音,避免离散化瓶颈。引入音素Jensen-Shannon散度(pJSD)评估语言质量,发现验证损失和pJSD均遵循缩放定律,最优token-to-parameter比率随计算量增加而下降。扩展至16B参数并采用数千万小时对话数据训练后,可生成富有情感、韵律、多说话人、多语言的语音,但长文连贯性仍为显著挑战。

数据/训练论文/研究语音
14:20
公众号:通义实验室(千问)精选
AI 评分 73/100
Fun-ASR-Realtime 发布:单模型支持30种语言与16种方言,识别准确率领先

通义实验室发布Fun-ASR-Realtime实时语音识别模型。单模型覆盖30种语言及16种方言,针对东亚、东南亚地区重点优化。在工业级方言测评inhouse上取得87.8%的语义准确率,大幅领先,多地方言接近人工水平。引入上下文理解与动态热词注入,实现同音词、品牌名等语义消歧。流式识别首字延迟控制在百毫秒级,准确率接近离线水平,支持多语言无缝切换。API已上线阿里云百炼平台。

模型发布语音
另有 1 家信源报道IT之家(RSS)
推荐理由:Fun-ASR Realtime把多语言方言和流式一体化做得很扎实,特别是对东亚东南亚的优化,准确率提升明显,做语音应用的产品人可以直接关注。
14:09
公众号:通义实验室(千问)精选
AI 评分 65/100
Fun-ASR-Realtime 发布:单模型支持 30 种语言与 16 种方言,流式识别准确率接近离线水平

通义实验室发布 Fun-ASR-Realtime,单模型支持 30 种语言和 16 种方言,在工业级方言测评 inhouse 上取得 87.8% 的语义准确率。该模型支持动态注入热词与对话上下文实现语义消歧,首字延迟控制在百毫秒级别,流式识别准确率接近离线水平,并支持多语言无缝切换。API 现已上线阿里云百炼平台。

模型发布语音

推荐理由:多语言方言的流式识别将语音交互的可用边界从英语推向了东亚与方言市场,使原先因识别不准而难以落地的本地化客服、语音助手等应用获得了新的技术基础。

7月3日

星期五 · 1 条
23:46
公众号:京东JoyAI精选
AI 评分 68/100
JoyAI App 上线 UGC 数字人功能,用户可"捏"出专属虚拟玩伴

JoyAI App 近日上线 UGC 数字人功能,用户只需上传一张照片即可生成专属虚拟数字分身,支持一键复刻写实形象或通过模板重塑为卡通风格,搭配用户自己的语音即可解锁专属陪伴。该功能复用“万能博士”技术底座,集成 JoyAI 语言、语音、数字人大模型,实现行业领先的全双工对话,支持随时打断、自然接话。数字人兼具情绪陪伴与全能助手属性,可提供点外卖、金融咨询、学英语、规划行程等生活服务。

产品更新多模态语音

推荐理由:京东把数字人技术做成了「传一张照片就能捏」的大众玩具,虽然看不出硬核突破,但对普通用户来说,这是第一次零门槛体验有形象有语音的 AI 玩伴,上手即用。

7月2日

星期四 · 1 条
00:20
xAI:News(网页)精选
AI 评分 77/100
xAI 发布 Voice Agent Builder 测试版

xAI 推出 Voice Agent Builder 测试版,这是一个基于 Grok Voice 的无代码平台,可在两分钟内创建生产级语音智能体。它集成电话、知识检索、工具、MCP、Guardrails 及可观测性,支持连接现有 SIP 号码、API 和 WebSocket,采用语音到语音路径。在 τ-voice Bench 上,Grok Voice Think Fast 1.0 得分 67.3%,领先 Gemini 3.1 Flash Live(43.8%)和 GPT Realtime 1.5(35.3%)。定价为每分钟音频 0.05 美元、电话费 0.01 美元,提供 80+ 种语音及声音克隆,每个账户附赠一个免费电话号码。

智能体MCP/工具xAI产品更新
另有 1 家信源报道X:SpaceXAI (@SpaceXAI)
推荐理由:xAI 用 Grok Voice 原生的语音到语音路径,把生产级语音代理的搭建门槛降到了无代码、两分钟,计费也简单,做语音业务的人值得试试。

7月1日

星期三 · 2 条
05:25
Suno:Blog(网页)
AI 评分 40/100
Dream Relic:用 Suno 为超现实影像配乐

AI 视觉艺术家 Dream Relic(Broc Vaughn)通过 Suno 的 Create 功能,将多年来积累的歌词转化为配乐歌曲,为其超现实、怀旧风格的影像世界赋予声音。他在 TikTok 和 Hooks 上发布的一首 Suno 生成曲目获得数百条评论,甚至有人表示“讨厌 AI 音乐但这是例外”。这一反响促使他更认真对待音乐创作——此前他曾与唱片公司和制作人合作但效果不佳。Dream Relic 正筹备发布全长专辑,并在 TikTok、Hooks、Spotify 等平台上线多首作品。

其他语音
01:29
Apple:Newsroom(RSS)精选
AI 评分 66/100
Apple Creator Studio 更新:更智能、更快速、更互联

Apple Creator Studio 推出多项 AI 增强更新。Final Cut Pro 新增 on-device AI 驱动的 Generate Captions(自动转录音频生成字幕)和 Edit Detection(自动检测剪辑点)。Mac 版加入 Auto Mask(自动识别皮肤、天空等主体)、增强的 Match Color 和 Advanced Trimming。支持将帧发送至 Pixelmator Pro 编辑,并在 Keynote、Pages、Numbers 中直接调用 Pixelmator Pro 修改图片。Logic Pro 新增 Grammy 制作人制作的 Producer Project 及 Chord ID 改进。订阅价 $12.99/月或 $129/年,新用户免费试用一个月,教育用户 $2.99/月。

产品更新图像生成语音

推荐理由:Final Cut Pro 的自动字幕和遮罩是实打实的工作流提升,Pixelmator Pro 的深度整合也让设计更顺畅,虽然没有颠覆性突破,但创意工作者今天就能用上。

6月25日

星期四 · 1 条
00:15
Hugging Face:Blog(RSS)精选
AI 评分 61/100
FFASR 排行榜发布:真实远场条件下 ASR 评测

Treble Technologies 与 Hugging Face 联合推出 FFASR(Far-Field ASR)排行榜,这是首个开源社区驱动的真实远场声学条件 ASR 评测基准。传统近场评测无法反映混响、背景噪声和麦克风距离带来的性能下降。FFASR 使用混合波模拟引擎生成声学数据,涵盖 14 种房间(20–470 m³)和三个信噪比级别(远场高 SNR >14 dB、中 SNR 8–12 dB、低 SNR <6 dB),加上近场干燥条件,共四类条件决定主排名。另有实验室实测/模拟验证轨道和移动声源 beta 版。性能指标同时报告词错误率(WER)和实时因子(RTFx,在 NVIDIA L4 GPU 上评估)。未来将支持多说话人场景、麦克风阵列和回声消除。

Hugging Face评测/基准语音

推荐理由:远场语音的‘实验室-生产’性能差终于有了量化指标,这个排行榜把 ASR 的真实世界鲁棒性公开化,做语音产品的团队该看看。

6月23日

星期二 · 1 条
13:50
公众号:火山引擎精选
AI 评分 71/100
豆包音频生成模型1.0发布,重新定义AI音频创作

火山引擎正式发布豆包音频生成模型1.0(Doubao-Seed-Audio 1.0),支持文本与音频参考生成,端到端输出目标音频。单条Prompt可编排多角色对白、情绪语气、背景音乐及环境氛围,长时生成中保持多角色音色一致性,无需后期多轨混音。模型支持0样本多模态输入,无需额外训练即可生成;实现音色与风格解耦控制及“一声多角”能力。一次支持2分钟音频创作,多次延长保持音色统一。已开启火山方舟API邀测,个人用户享30分钟创作额度,即将上线剪映、即梦、番茄等产品。

多模态模型发布语音

推荐理由:豆包音频生成模型把多角色配音、音效、配乐压缩进一条 Prompt,长时一致性解决了一直以来‘串戏’的痛点,音频创作者的生产流程可能会被改写。

6月18日

星期四 · 1 条
18:40
公众号:火山引擎精选
AI 评分 72/100
火山引擎上线豆包实时语音模型3.0 API 服务,开启邀测

火山引擎上线豆包实时语音模型3.0(Seeduplex)API 服务并开启邀测。该模型为原生全双工端到端语音大模型,具备精准遵循、抗干扰、动态判停三大优势。可在多人对话中安静待命,指定话题出现时主动加入;支持通过自定义工具在实时交互中完成预定日历、发送邮件等任务。抗干扰力提升,误回复率与误打断率大幅降低;判停延迟缩短约250ms,复杂场景抢话比例下降40%,用户主动打断延迟缩短约300ms。适用于汽车智能座舱、智能硬件、智能客服等场景。

模型发布语音

推荐理由:豆包实时语音模型3.0带来的全双工实时工具调用,把语音助手从对讲机变成了真人助理,判停延迟和抢话率的改善数据扎实,做车载和智能硬件的团队该认真看看。
已加载 40 条