小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。
小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。
奇瑞旗下品牌OMODA&JAECOO携手火山引擎在印尼发布东南亚首个具备完整AI原生能力、规模化量产落地的智能座舱方案,首款搭载豆包大模型的车型OMODA 4同步亮相。该座舱依托豆包大模型与Agentic AI架构,由主智能体驱动十大车载智能体协同运作,支持英语、中文、印尼语、泰语、马来语五种语言交互,并采用端云协同架构确保无网、弱网场景下核心功能稳定运行。
Sierra 的智能体现在开箱即可应对最具挑战性的 IVR 电话系统,它们能判断何时拨打电话、如何穿越多层菜单、何时保持沉默,以及如何识别已接通真人。
Sierra 今日发布 Voice Personas,将智能体的行为与表达方式解耦,允许企业分别设计“做什么”和“怎么说”。该功能旨在让 AI 智能体在完成任务的同时,以更贴合品牌调性的语气与用户互动,提升客户体验的个性化程度。
独立开发者叶小叔用面壁智能开源的VoxCPM声音克隆模型,成功让AI克隆网红声音并实现实时对话,视频在抖音获100万播放、X上5.9万人围观。此前他尝试本地开源模型(TTS合成需14-40秒)和云端Cartesia Pro(中文效果不佳)均失败,最终租用RunPod L4 GPU($0.4/小时)部署VoxCPM,TTS首包延迟不到1秒,端到端体感2-3秒。
独立开发者叶小叔用面壁智能开源的 VoxCPM 克隆千万粉丝网红声音,搭建 STT → LLM → VoxCPM(TTS)三段式实时对话管道,TTS 首包延迟不到 1 秒,端到端体感 2 到 3 秒。
字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。
另有 3 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)LangChain 官方博客介绍如何用 LangSmith 评估语音智能体,覆盖执行、结果与来电者体验三个层面。评估手段包括 LangSmith traces、代码评估器、LLM judges 和人工审查,帮助开发者系统化验证语音智能体的实际表现。
腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。
另有 2 家信源报道IT之家(RSS)X:腾讯混元 (@TencentHunyuan)OpenAI 推出 GPT-Live,实现与 AI 的连续语音交互。该系统采用无轮次语音模型和低延迟架构,使对话更快、更自然。GPT-Live 的构建耗时六个月,核心在于减少交互延迟并支持不间断对话。
Skywork Note 上线七天,首批海外库存全部售罄。昆仑万维宣布加速推进整套智能硬件家族,包括录音背夹、AI 挂件 Recall(17.4 克,内置 VAD 语音检测)与 AI 戒指 TriRing(4 至 6 克,行业首个双麦克风降噪算法,可监测心率、HRV、血氧和睡眠)。Note 升级版 Skywork Mate 即将发售,支持 8 米拾音与 6nm AI 音频芯片。
avatarin 借助 OpenAI 的 GPT-Realtime,为山田电机顾客提供 24/7 多语言支持。上线两周内,已有 3 万人使用该智能体,92% 的调研反馈为正面评价。
Apple 为 Siri Expressive Voices 推出了一种内存高效的音频合成架构,其 detokenizer 在 AMX 上以约 10ms/步运行,峰值内存仅约 21MB。相比此前设备端系统,该架构将 Mean Opinion Score (MOS) 整体提升 +0.28(4.15 vs. 3.87),对话语音提升 +0.42(4.24 vs. 3.82)。
腾讯自选股旗下微证券早报正式接入腾讯混元大模型,推出AI语音播客,支持用户收听时随时打断并提问,AI主播能即时解答后接回主线。播客提供简洁/深度两种模式及单人/双人播报形态。同时,微证券AI智能助手接入腾讯混元记忆(Hy-Memory),在记忆评测中综合得分79.6,多跳召回率达90%。
腾讯自选股旗下微证券早报接入腾讯混元大模型,推出支持实时互动与随时打断的 AI 语音播客,用户可开口提问,AI 主播即时解答后续接回主线。播客提供简洁版与深度版、单人/双人播报模式。同时,微证券 AI 智能助手接入腾讯混元记忆(Hy-Memory),在记忆评测中综合得分 79.6,多跳召回率达 90%。
OpenRouter 推出 POST /api/v1/audio/transcriptions 端点,用户可使用同一 API key 将 base64 编码音频发送至该端点,返回 JSON 格式文本与用量对象。
LangSmith 现已支持追踪基于 Pipecat、LiveKit、OpenAI Realtime 和 Gemini Live 构建的语音智能体。开发者可在单次追踪中捕获音频、语音转文字(STT)和文字转语音(TTS)延迟、中断事件以及工具调用等关键指标。
通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。
通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,含 Flash 与 Plus 两个版本,首包延迟约 300ms。模型支持 16 种语言和 20 种方言,Plus 版在 Artificial Analysis 榜单夺冠,平均说话人相似度达 82.75。新增 Free-style 自然语言指令、细粒度标签控制及嘈杂环境鲁棒性,音频输出提升至 48K,单次合成最长 3 分钟。
另有 1 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)字节跳动 Seed 团队发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,支持 100ms 间隔精度的时间控制、单次约 2 分钟音频的延展生成及 20+ 语种自然生成。该模型已在火山方舟体验中心上线,多数场景音频可用率达 90% 以上,多语言音频自然度 MOS 超 4 分。
2026世界人工智能大会首日,千问推出AI智能体眼镜与首款AI智能体耳机两大硬件。智能体眼镜升级全双工语音、眼动追踪、体征监测等技术,并实现行业首个用户体征实时监测,可测量心率、血氧、HRV等数据。上述技术年内应用于千问AI智能体眼镜,已发售的千问AI眼镜S1、G1将通过OTA引入Agent能力;耳机由千问与Bose联合打造,支持同声传译、会议纪要等功能。
阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。
阿里语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,支持根据语境动态调整语气与情感、音色克隆,并内置多模态双工控制模型,实现声纹级背景过滤。
OpenAI 今日推出 GPT‑Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT‑5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT‑Live‑1 和 GPT‑Live‑1 mini 两个版本。人类评估显示,在 5‑10 分钟对话中,GPT‑Live‑1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、BrowseComp 和 τ³‑Voice Telecom 基准测试中也表现更强。未来将开放 API。
另有 11 家信源报道The Verge:AI(RSS)X:Jason Liu (@jxnlco)X:OpenAI (@OpenAI)IT之家(RSS)X:Greg Brockman (@gdb)X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)TechCrunch:AI(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Sam Altman (@sama)The Decoder:AI News(RSS)xAI 发布 21 个新旗舰语音,加入原有的 5 个语音。所有新语音均支持多语言,已在实时 Voice Agent API、Text to Speech API 及新推出的 Grok Voice Agent Builder 中可用。每个语音针对客服、角色、解说、广告、教育等场景定制,支持通过 [pause] 等语音标签控制表达。原始 5 个语音(Ara、Eve、Leo、Rex、Sal)经重训练后,节奏、措辞和重音的自然度提升。所有语音原生支持 Grok Voice 的 25 种以上语言。
针对基于注意力的编码器-解码器(AED)模型无法直接处理长格式声学编码的问题,研究提出四项改进:在交叉注意力中注入显式的绝对位置编码;采用扩展声学上下文的长格式训练以消除隐式绝对位置编码;通过片段拼接覆盖训练中的多种分段方式;使用语义分割对齐AED解码片段与训练片段。这些方法消除了连续编码与分段编码之间的精度差距,使注意力解码器能够以自回归方式用于长格式解码。
Apple 机器学习研究团队采用紧凑的 seq2seq 模型进行 ASR 纠错,训练数据来自真实和合成音频的 ASR 错误。通过级联 TTS 和 ASR 构建合成语料,关键在于匹配真实错误分布的多样性。模型采用 correction-first 解码,生成候选后利用 ASR 声学分数重新排序。与 LLM 相比,该模型参数少 15 倍,在 LibriSpeech test-clean/other 上分别达到 1.5% 和 3.3% 的词错误率(WER),优于 LLM,并能泛化至 CTC、Seq2seq、Transducer 等多种 ASR 架构,在低错误率场景中提供精确纠错。
Apple与Google团队研究连续扩散(CD)口语语言模型(SLM)的缩放性质。CD SLM直接处理连续语音,避免离散化瓶颈。引入音素Jensen-Shannon散度(pJSD)评估语言质量,发现验证损失和pJSD均遵循缩放定律,最优token-to-parameter比率随计算量增加而下降。扩展至16B参数并采用数千万小时对话数据训练后,可生成富有情感、韵律、多说话人、多语言的语音,但长文连贯性仍为显著挑战。
通义实验室发布Fun-ASR-Realtime实时语音识别模型。单模型覆盖30种语言及16种方言,针对东亚、东南亚地区重点优化。在工业级方言测评inhouse上取得87.8%的语义准确率,大幅领先,多地方言接近人工水平。引入上下文理解与动态热词注入,实现同音词、品牌名等语义消歧。流式识别首字延迟控制在百毫秒级,准确率接近离线水平,支持多语言无缝切换。API已上线阿里云百炼平台。
另有 1 家信源报道IT之家(RSS)通义实验室发布 Fun-ASR-Realtime,单模型支持 30 种语言和 16 种方言,在工业级方言测评 inhouse 上取得 87.8% 的语义准确率。该模型支持动态注入热词与对话上下文实现语义消歧,首字延迟控制在百毫秒级别,流式识别准确率接近离线水平,并支持多语言无缝切换。API 现已上线阿里云百炼平台。
JoyAI App 近日上线 UGC 数字人功能,用户只需上传一张照片即可生成专属虚拟数字分身,支持一键复刻写实形象或通过模板重塑为卡通风格,搭配用户自己的语音即可解锁专属陪伴。该功能复用“万能博士”技术底座,集成 JoyAI 语言、语音、数字人大模型,实现行业领先的全双工对话,支持随时打断、自然接话。数字人兼具情绪陪伴与全能助手属性,可提供点外卖、金融咨询、学英语、规划行程等生活服务。
xAI 推出 Voice Agent Builder 测试版,这是一个基于 Grok Voice 的无代码平台,可在两分钟内创建生产级语音智能体。它集成电话、知识检索、工具、MCP、Guardrails 及可观测性,支持连接现有 SIP 号码、API 和 WebSocket,采用语音到语音路径。在 τ-voice Bench 上,Grok Voice Think Fast 1.0 得分 67.3%,领先 Gemini 3.1 Flash Live(43.8%)和 GPT Realtime 1.5(35.3%)。定价为每分钟音频 0.05 美元、电话费 0.01 美元,提供 80+ 种语音及声音克隆,每个账户附赠一个免费电话号码。
另有 1 家信源报道X:SpaceXAI (@SpaceXAI)AI 视觉艺术家 Dream Relic(Broc Vaughn)通过 Suno 的 Create 功能,将多年来积累的歌词转化为配乐歌曲,为其超现实、怀旧风格的影像世界赋予声音。他在 TikTok 和 Hooks 上发布的一首 Suno 生成曲目获得数百条评论,甚至有人表示“讨厌 AI 音乐但这是例外”。这一反响促使他更认真对待音乐创作——此前他曾与唱片公司和制作人合作但效果不佳。Dream Relic 正筹备发布全长专辑,并在 TikTok、Hooks、Spotify 等平台上线多首作品。
Apple Creator Studio 推出多项 AI 增强更新。Final Cut Pro 新增 on-device AI 驱动的 Generate Captions(自动转录音频生成字幕)和 Edit Detection(自动检测剪辑点)。Mac 版加入 Auto Mask(自动识别皮肤、天空等主体)、增强的 Match Color 和 Advanced Trimming。支持将帧发送至 Pixelmator Pro 编辑,并在 Keynote、Pages、Numbers 中直接调用 Pixelmator Pro 修改图片。Logic Pro 新增 Grammy 制作人制作的 Producer Project 及 Chord ID 改进。订阅价 $12.99/月或 $129/年,新用户免费试用一个月,教育用户 $2.99/月。
Treble Technologies 与 Hugging Face 联合推出 FFASR(Far-Field ASR)排行榜,这是首个开源社区驱动的真实远场声学条件 ASR 评测基准。传统近场评测无法反映混响、背景噪声和麦克风距离带来的性能下降。FFASR 使用混合波模拟引擎生成声学数据,涵盖 14 种房间(20–470 m³)和三个信噪比级别(远场高 SNR >14 dB、中 SNR 8–12 dB、低 SNR <6 dB),加上近场干燥条件,共四类条件决定主排名。另有实验室实测/模拟验证轨道和移动声源 beta 版。性能指标同时报告词错误率(WER)和实时因子(RTFx,在 NVIDIA L4 GPU 上评估)。未来将支持多说话人场景、麦克风阵列和回声消除。
火山引擎正式发布豆包音频生成模型1.0(Doubao-Seed-Audio 1.0),支持文本与音频参考生成,端到端输出目标音频。单条Prompt可编排多角色对白、情绪语气、背景音乐及环境氛围,长时生成中保持多角色音色一致性,无需后期多轨混音。模型支持0样本多模态输入,无需额外训练即可生成;实现音色与风格解耦控制及“一声多角”能力。一次支持2分钟音频创作,多次延长保持音色统一。已开启火山方舟API邀测,个人用户享30分钟创作额度,即将上线剪映、即梦、番茄等产品。
火山引擎上线豆包实时语音模型3.0(Seeduplex)API 服务并开启邀测。该模型为原生全双工端到端语音大模型,具备精准遵循、抗干扰、动态判停三大优势。可在多人对话中安静待命,指定话题出现时主动加入;支持通过自定义工具在实时交互中完成预定日历、发送邮件等任务。抗干扰力提升,误回复率与误打断率大幅降低;判停延迟缩短约250ms,复杂场景抢话比例下降40%,用户主动打断延迟缩短约300ms。适用于汽车智能座舱、智能硬件、智能客服等场景。