Topic · 主题全部主题 →

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

1,140条收录
133条精选
● 持续更新

8月13日

星期四 · 1 条
18:01
公众号:小红书技术(dots.llm)精选
AI 评分 75/100
小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座

小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。


推荐理由:连续自回归跳过离散 Token 的信息损失,又用语义编码器回灌历史抑制累积误差,为音色克隆和低步数流式共用同一基座提供了路径。

8月10日

星期一 · 1 条
08:14
MarkTechPost(RSS)精选
AI 评分 75/100
NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。


推荐理由:端到端语音模型消除级联延迟,而工具调用侧通道和保留消息设计在不中断对话的前提下补齐了API等待期,让实时语音智能体更容易工程化。

8月9日

星期日 · 1 条
07:11
IT之家(RSS)精选
AI 评分 72/100
OpenAI 桌面端 ChatGPT 上线语音交互功能,可语音操控电脑执行多步骤任务

OpenAI 更新 ChatGPT 桌面应用,新增对 ChatGPT Voice 的支持,用户可直接通过语音对话控制 AI 智能体并让其在电脑上执行任务。该功能基于全新语音模型系列 ChatGPT-Live,支持 ChatGPT Work 和 Codex,在 macOS 上还可借助 Appshots 访问屏幕内容。


推荐理由:桌面端语音不再只是对话,演示中一条指令完成创建线程、提PR和定位Bug,语音开始成为开发者工作流中的可执行指令层。

8月7日

星期五 · 2 条
14:51
公众号:面壁智能(MiniCPM)精选
AI 评分 65/100
独立开发者用 VoxCPM 克隆网红声音,让 AI 终于"会聊天"了

独立开发者叶小叔用面壁智能开源的 VoxCPM 克隆千万粉丝网红声音,搭建 STT → LLM → VoxCPM(TTS)三段式实时对话管道,TTS 首包延迟不到 1 秒,端到端体感 2 到 3 秒。


推荐理由:案例的实践价值在于澄清了实时对话 TTS 环节的选择逻辑:中文原生支持与默认参数平衡往往优于盲目追求极致克隆,这一取舍对同类项目具直接参考。

8月6日

星期四 · 1 条
21:11
OpenBMB@OpenBMB精选
AI 评分 65/100
面壁智能 AMNESIAC:反向图灵测试 AI 审讯游戏

面壁智能 OpenBMB 在 #BuildSmall 黑客松推出 AMNESIAC,一款反向图灵测试交互游戏:玩家需说服 AI 审讯官 A.M.N. 自己是人类。该游戏由 MiniCPM-o 4.5 驱动实时对话与推理,VoxCPM 生成审讯官语音,并结合摄像头面部表情、脉搏信号与响应计时进行多模态审讯。项目已开源至 HuggingFace。


推荐理由:将摄像头面部信号、语音对话和LoRA角色塑形组合进一个可玩演示,为交互式AI角色提供了比常见聊天机器人更丰富的多模态模板。

8月5日

星期三 · 1 条
12:12
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 78/100
字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。

另有 3 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)
推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。

8月4日

星期二 · 3 条
16:20
公众号:腾讯混元精选
AI 评分 65/100
腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。

另有 2 家信源报道IT之家(RSS)X:腾讯混元 (@TencentHunyuan)
推荐理由:将 LLM 语义理解融入语音识别,上下文纠错和热词注入降低了专业场景的接入成本,元宝已集成可体验。
11:54
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成

SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。


推荐理由:通过 SwanData-Caption 数据管线和统一模型,让内容创作者能够以自然语言描述生成定制声音,并复用参考音频,减少了动画、游戏等场景中音频合成的碎片化。
06:35
Greg Brockman@gdb精选
AI 评分 66/100
GPT-Live 是一种用于实时音频的新架构和栈:GPT-Live 可以在说话的同时聆听。为了让这种体验在 ChatGPT 规模下显得自然,我们从客户端到模型重建了语音栈。这一新架构让音频持续流动,因此更深入的推理和工具使用不会打断对话。

OpenAI: GPT-Live 可以在说话的同时聆听。 为了让这种体验在 ChatGPT 的规模下显得自然,我们从客户端到模型彻底重建了语音技术栈。 这一新架构让音频持续流动,因此更深入的推理和工具调用不会打断对话。

另有 1 家信源报道X:OpenAI (@OpenAI)
推荐理由:在 GPT-Live 架构下推理与工具调用期间音频流不间断,语音交互的等待感和打断感被显著消除,适用于需要持续对话的陪伴和协作场景。

7月29日

星期三 · 1 条
04:56
OpenAI Developers@OpenAIDevs精选
AI 评分 65/100
我们在 API 中引入了两种新的转录模型:• GPT-Live-Transcribe:专为低延迟实时转录而构建。 • GPT-Transcribe:针对已完成音频文件和批量工作负载的异步转录进行了优化。两种模型都能更好地理解上下文,并在跨口音和语言的实际音频上提供更准确的转录,包括短句、数字、专业术语以及背景噪音较大的语音。
另有 3 家信源报道The Decoder:AI News(RSS)X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)
推荐理由:OpenAI 正式把转录拆成实时和异步两个模型,这是一个信号,语音 AI 的落地正在从通用走向场景专用,做语音产品的都该看一眼。

7月24日

星期五 · 1 条
03:53
OpenAI@OpenAI精选
AI 评分 79/100
ChatGPT 语音功能现已登陆桌面应用。只需使用语音,即可控制你的电脑,并指挥在 ChatGPT Work 或 Codex 中运行的多个智能体。该功能由 GPT-Live 驱动,因此它能够同时在该应用中说话、聆听并协调工作。今日起,面向 macOS 和 Windows 平台的 Plus、Pro、Business、Edu 及 Enterprise 计划用户全球推送。
另有 3 家信源报道IT之家(RSS)X:Testing Catalog (@testingcatalog)TechCrunch:AI(RSS)
推荐理由:ChatGPT 的语音助手正式上岸桌面,关键是能同时指挥多个代理干活,一边写代码一边查资料,全程动嘴就行。对重度用户来说,这可能比任何新模型都更直接影响工作流。

7月23日

星期四 · 1 条
20:52
Qwen@Alibaba_Qwen精选
AI 评分 79/100
通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜

阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如[whisper]、[angry])、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在Artificial Analysis TTS排行榜上排名第一。


推荐理由:TTS 模型终于学会控制情感和语调了,Qwen 这次把自然语言提示和细粒度标签一起放进去,做语音助手的可以直接从‘能说话’跳进‘有性格’。

7月22日

星期三 · 2 条
13:53
OpenRouter:Announcements(RSS)精选
AI 评分 72/100
OpenRouter 新增音频转写 API,支持 Whisper 与 token 计价 STT 模型

OpenRouter 推出 POST /api/v1/audio/transcriptions 端点,用户可使用同一 API key 将 base64 编码音频发送至该端点,返回 JSON 格式文本与用量对象。


推荐理由:OpenRouter 把语音转录集成进 API,一份 key 搞定聊天和转写,对已经在用的团队省心不少,这篇教程直接可跑。
01:22
Andrej Karpathy@karpathy精选
AI 评分 78/100
Karpathy:用语音与LLM长谈可提升理解效率

Andrej Karpathy分享了一种与LLM协作的有效模式:开启语音输入,进行10分钟左右的自由漫谈,即使内容混乱、意识流式也无妨。他发现LLM擅长从长篇不连贯的语音中重构意图,回应的内容往往比用户最初的思路更清晰,从而减少后续修正次数、提升人机对齐效率。

另有 1 家信源报道X:Elvis Saravia (@omarsar0, DAIR.AI)
推荐理由:Karpathy 这条语音输入 ramble 技巧,比精心写 prompt 更符合人性,读完后你也会想试试。

7月20日

星期一 · 3 条
17:10
公众号:通义实验室(千问)精选
AI 评分 70/100
通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。


推荐理由:通义实验室的 TTS 模型更新,把精力花在了真实落地痛点——多语种方言覆盖、自然语言导演式控制、嘈杂环境音色复刻,而且直接可用。做语音交互的产品人可以立刻试试。
16:54
公众号:通义实验室(千问)精选
AI 评分 75/100
Qwen-Audio-3.0-TTS 发布:从"能说话"到"会表达"

通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,含 Flash 与 Plus 两个版本,首包延迟约 300ms。模型支持 16 种语言和 20 种方言,Plus 版在 Artificial Analysis 榜单夺冠,平均说话人相似度达 82.75。新增 Free-style 自然语言指令、细粒度标签控制及嘈杂环境鲁棒性,音频输出提升至 48K,单次合成最长 3 分钟。


推荐理由:从「能说话」到「会表达」,区别在于用自然语言指令和标签精确控制情绪与细节,这为需要多语种和方言的商业场景降低了声音设计门槛。
11:48
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 79/100
字节跳动发布 Seed Audio 1.0 音频创作模型,统一建模人声与音效实现端到端影视级音频生成

字节跳动 Seed 团队发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,支持 100ms 间隔精度的时间控制、单次约 2 分钟音频的延展生成及 20+ 语种自然生成。该模型已在火山方舟体验中心上线,多数场景音频可用率达 90% 以上,多语言音频自然度 MOS 超 4 分。


推荐理由:字节这次发布的 Seed Audio 1.0 不是又一个 TTS 模型,它把台词、音效、氛围统一编排,并支持百毫秒级时间线控制,对做视频和出海内容的团队是个立刻能用的创作升级。

7月19日

星期日 · 1 条
11:06
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 78/100
transcribe.cpp 发布:基于 ggml 的跨平台语音转录库,支持 16 个 ASR 模型族

transcribe.cpp v0.1.0 发布,一个基于 ggml 的语音转录库,支持 16 个 ASR 模型族(60+ 模型),并通过 Vulkan、Metal、CUDA 和 TinyBLAS 实现 GPU 加速。


推荐理由:本地语音转录一直缺一个好用的跨平台引擎,transcribe.cpp 不仅支持 60+ 模型、跑在 GPU 上,还带了 Python/JS/Rust/Swift 绑定,想把语音功能嵌进应用的开发者可以直接拿来用。

7月16日

星期四 · 2 条
15:43
MarkTechPost(RSS)精选
AI 评分 72/100
Patter SDK 教程:构建餐厅预订电话智能体,支持动态变量、护栏、延迟仪表盘与评估检查

Patter SDK 发布教程,演示如何构建一个餐厅预订场景的语音智能体工作流。该流程支持动态调用变量、注册可调用工具、应用输出护栏(如PII脱敏、脏话过滤、话题范围限制),并可在无需实时电话凭证的情况下运行脚本化通话模拟。教程还涵盖延迟与成本指标追踪、回归式评估检查,以及将智能体逻辑、工具调用、安全检查和通话模拟整合为单一结构化管线。


推荐理由:这个教程把 Patter SDK 的语音代理从模拟到部署跑了一遍,代码能直接抄,想上手电话 AI 的开发者可以当样板,不过工具本身还比较新,生态有待验证。
01:00
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 72/100
AI语音诈骗:退休老人因合成女儿哭声被骗1.5万美元

2025年夏季,美国佛罗里达州一名退休老人接到“女儿”哭诉车祸需保释金的电话,一小时内取现1.5万美元交给冒充法院的快递员——实际上,哭声是从一段音频片段合成的AI语音。FBI 2026年4月报告首次将AI欺诈列为独立类别,2025年收到超2.2万起AI相关投诉,调整后损失超8.93亿美元,其中60岁以上受害者占3.52亿美元。


推荐理由:FBI首次将AI诈骗单独统计,老年人成最大受害群体。这篇分析点破了防范盲区:别再指望靠人分辨真假语音,责任该压在银行和平台身上。

7月15日

星期三 · 2 条
10:40
公众号:通义实验室(千问)精选
AI 评分 73/100
阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一

阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。


推荐理由:我觉得Qwen-Audio-3.0-Realtime把情感表达和背景降噪结合得很好,加上工具调用,语音交互终于从聊天走向任务执行,有API可以直接上手,推荐语音产品经理试试。
10:31
公众号:通义实验室(千问)精选
AI 评分 78/100
Qwen-Audio-3.0-Realtime 如何让语音交互"懂倾听,更聪明"?

阿里语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,支持根据语境动态调整语气与情感、音色克隆,并内置多模态双工控制模型,实现声纹级背景过滤。


推荐理由:把文本推理能力蒸馏到语音模型同时保留毫秒级响应,这种架构为需要复杂决策的语音智能体提供了可行路径。

7月14日

星期二 · 1 条
23:33
Google AI Developers@googleaidevs精选
AI 评分 70/100
Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译

Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言、近实时延迟的语音到语音翻译。该模型直接处理原始音频流,保留说话者语调、节奏和音高。东南亚超级应用 Grab 正探索将其用于司机与乘客间的跨语言沟通,其用户每月发起超 1000 万次语音通话。开发者可通过 Gemini Live API 集成 LiveKit、Fishjam、Pipecat 或 Vision Agents 构建应用。LiveKit 已实现虚拟会议室多语言即时理解;Software Mansion 结合 MoQ 协议突破流媒体瓶颈;VisionAgents AI 展示了动态多语言切换能力。开发者可在 Google AI Studio 试用并获取 Cookbook 示例代码。


推荐理由:Google把Gemini 3.5的语音翻译做到了近实时、保持语调,这对出海产品是个很实际的升级,实时通话翻译终于从demo走向可用。

7月11日

星期六 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
GigaChat Audio:支持120分钟输入的时间感知音频大语言模型

GigaChat Audio 是一种时间感知的音频大语言模型,支持长达120分钟的输入,并能生成带有明确时间戳的问答、片段描述和摘要。该模型通过将周期性时间标记与连续音频 token 交错,并利用级联合成数据管道进行大规模训练,在短时和长时基准上均实现了强时间定位精度。研究团队已开源模型权重及超过1万小时的时序数据集。


推荐理由:首个大规模时间感知音频LLM开源,把长音频问答的时间定位做到可验证,且附带完整数据集和消融分析,做语音产品的该认真看一下。

7月9日

星期四 · 1 条
01:08
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 77/100
OpenAI 发布 GPT-Live 新一代全双工语音模型

OpenAI 今日推出 GPT‑Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT‑5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT‑Live‑1 和 GPT‑Live‑1 mini 两个版本。人类评估显示,在 5‑10 分钟对话中,GPT‑Live‑1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、BrowseComp 和 τ³‑Voice Telecom 基准测试中也表现更强。未来将开放 API。

另有 11 家信源报道X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)TechCrunch:AI(RSS)X:Sam Altman (@sama)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)The Decoder:AI News(RSS)The Verge:AI(RSS)X:Jason Liu (@jxnlco)
推荐理由:GPT‑Live 不是简单的语音版本升级,全双工架构让 AI 终于能同时听和说,加上后台调用 GPT‑5.5,对话体验跨了一大步,做语音应用的产品人该重新思考交互流程了。

7月7日

星期二 · 2 条
21:18
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 80/100
统一音频智能模型 Nemotron-Labs-Audex-30B-A3B 发布

Nemotron-Labs-Audex-30B-A3B(Audex)是基于Nemotron-Cascade-2-30B-A3B的MoE大语言模型,采用单一Transformer解码器统一处理文本与量化音频token。训练使用157.4B音频token和320.5B文本token,经多阶段监督训练、文本Cascade RL和多域on-policy蒸馏优化。在音频理解、语音识别/翻译、文本转语音、音频生成及语音到语音生成任务上达SOTA,同时保持原文本LLM的推理、对齐等能力几乎无退化。模型权重已开源。

另有 1 家信源报道MarkTechPost(RSS)
推荐理由:多模态LLM常捡芝麻丢西瓜,Audex难得做到音频全面增强而文本智能不退化。开源模型让语音产品人可以立刻评估,不是研究Demo。
06:43
xAI:News(网页)精选
AI 评分 68/100
xAI 为 Grok Voice 新增 21 个旗舰语音

xAI 发布 21 个新旗舰语音,加入原有的 5 个语音。所有新语音均支持多语言,已在实时 Voice Agent API、Text to Speech API 及新推出的 Grok Voice Agent Builder 中可用。每个语音针对客服、角色、解说、广告、教育等场景定制,支持通过 [pause] 等语音标签控制表达。原始 5 个语音(Ara、Eve、Leo、Rex、Sal)经重训练后,节奏、措辞和重音的自然度提升。所有语音原生支持 Grok Voice 的 25 种以上语言。


推荐理由:Grok 一口气放出21种多语言语音,对做语音 agent 的团队是个弹药库更新,但影响的半径基本止于 xAI 生态内部。

7月6日

星期一 · 3 条
14:20
公众号:通义实验室(千问)精选
AI 评分 73/100
Fun-ASR-Realtime 发布:单模型支持30种语言与16种方言,识别准确率领先

通义实验室发布Fun-ASR-Realtime实时语音识别模型。单模型覆盖30种语言及16种方言,针对东亚、东南亚地区重点优化。在工业级方言测评inhouse上取得87.8%的语义准确率,大幅领先,多地方言接近人工水平。引入上下文理解与动态热词注入,实现同音词、品牌名等语义消歧。流式识别首字延迟控制在百毫秒级,准确率接近离线水平,支持多语言无缝切换。API已上线阿里云百炼平台。

另有 1 家信源报道IT之家(RSS)
推荐理由:Fun-ASR Realtime把多语言方言和流式一体化做得很扎实,特别是对东亚东南亚的优化,准确率提升明显,做语音应用的产品人可以直接关注。
14:09
公众号:通义实验室(千问)精选
AI 评分 65/100
Fun-ASR-Realtime 发布:单模型支持 30 种语言与 16 种方言,流式识别准确率接近离线水平

通义实验室发布 Fun-ASR-Realtime,单模型支持 30 种语言和 16 种方言,在工业级方言测评 inhouse 上取得 87.8% 的语义准确率。该模型支持动态注入热词与对话上下文实现语义消歧,首字延迟控制在百毫秒级别,流式识别准确率接近离线水平,并支持多语言无缝切换。API 现已上线阿里云百炼平台。


推荐理由:多语言方言的流式识别将语音交互的可用边界从英语推向了东亚与方言市场,使原先因识别不准而难以落地的本地化客服、语音助手等应用获得了新的技术基础。
01:53
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
三周前,我不小心创办了一家小公司

一位父亲为患有自闭症的非语言儿子开发了一款沟通应用,在言语治疗室的等候区展示时,所有非语言儿童的母亲看到后都忍不住流泪,言语治疗师也啜泣了五分钟。他意外发现产品市场匹配,决定腾出时间让更多孩子能用上,即使这意味着几周睡眠不足。应用本身是专为理解语言困难的儿童设计的,与传统的AAC设备不同——后者主要面向身体障碍但语言理解正常的成人。


推荐理由:这篇文章读来会让人看天花板,一位父亲用 AI 图像和声音克隆为儿子创造了沟通工具,意外找到了产品市场契合。它比任何融资新闻都更让我相信,AI 的真正价值在于解决那些被忽视的具体问题。

7月3日

星期五 · 1 条
23:46
公众号:京东JoyAI精选
AI 评分 68/100
JoyAI App 上线 UGC 数字人功能,用户可"捏"出专属虚拟玩伴

JoyAI App 近日上线 UGC 数字人功能,用户只需上传一张照片即可生成专属虚拟数字分身,支持一键复刻写实形象或通过模板重塑为卡通风格,搭配用户自己的语音即可解锁专属陪伴。该功能复用“万能博士”技术底座,集成 JoyAI 语言、语音、数字人大模型,实现行业领先的全双工对话,支持随时打断、自然接话。数字人兼具情绪陪伴与全能助手属性,可提供点外卖、金融咨询、学英语、规划行程等生活服务。


推荐理由:京东把数字人技术做成了「传一张照片就能捏」的大众玩具,虽然看不出硬核突破,但对普通用户来说,这是第一次零门槛体验有形象有语音的 AI 玩伴,上手即用。

7月2日

星期四 · 1 条
00:20
xAI:News(网页)精选
AI 评分 77/100
xAI 发布 Voice Agent Builder 测试版

xAI 推出 Voice Agent Builder 测试版,这是一个基于 Grok Voice 的无代码平台,可在两分钟内创建生产级语音智能体。它集成电话、知识检索、工具、MCP、Guardrails 及可观测性,支持连接现有 SIP 号码、API 和 WebSocket,采用语音到语音路径。在 τ-voice Bench 上,Grok Voice Think Fast 1.0 得分 67.3%,领先 Gemini 3.1 Flash Live(43.8%)和 GPT Realtime 1.5(35.3%)。定价为每分钟音频 0.05 美元、电话费 0.01 美元,提供 80+ 种语音及声音克隆,每个账户附赠一个免费电话号码。

另有 1 家信源报道X:SpaceXAI (@SpaceXAI)
推荐理由:xAI 用 Grok Voice 原生的语音到语音路径,把生产级语音代理的搭建门槛降到了无代码、两分钟,计费也简单,做语音业务的人值得试试。

7月1日

星期三 · 1 条
01:29
Apple:Newsroom(RSS)精选
AI 评分 66/100
Apple Creator Studio 更新:更智能、更快速、更互联

Apple Creator Studio 推出多项 AI 增强更新。Final Cut Pro 新增 on-device AI 驱动的 Generate Captions(自动转录音频生成字幕)和 Edit Detection(自动检测剪辑点)。Mac 版加入 Auto Mask(自动识别皮肤、天空等主体)、增强的 Match Color 和 Advanced Trimming。支持将帧发送至 Pixelmator Pro 编辑,并在 Keynote、Pages、Numbers 中直接调用 Pixelmator Pro 修改图片。Logic Pro 新增 Grammy 制作人制作的 Producer Project 及 Chord ID 改进。订阅价 $12.99/月或 $129/年,新用户免费试用一个月,教育用户 $2.99/月。


推荐理由:Final Cut Pro 的自动字幕和遮罩是实打实的工作流提升,Pixelmator Pro 的深度整合也让设计更顺畅,虽然没有颠覆性突破,但创意工作者今天就能用上。

6月27日

星期六 · 2 条
11:59
IT之家(RSS)精选
AI 评分 73/100
阿里千问输入法上线 macOS 版:最快 300 字/分,AI 自动润色

阿里千问输入法 macOS 版今日上线官网,支持最快 300 字/分的 AI 语音输入,可自动润色、将口语转为工整文字,并支持 9 种方言,纯净无广告。官方预告 iOS、Android、Windows 版将于近日发布。此前千问团队已于今年 5 月推出千问语音输入法(千问 App 内的组件),具备去语气词、纠错、格式化整理及基于上下文的智能回复等能力,而本次上线的输入法则定位为独立 App,填补千问在移动端 AI 输入法赛道的空白。


推荐理由:阿里千问把AI语音能力做成了独立输入法,300字/分+9种方言让语音转文字实用性大增,对不习惯打字的普通用户可能比单纯聊天工具更有粘性。
00:16
AYi@AYi_AInotes精选
AI 评分 76/100
Leaf 开源项目:将网红峰哥做成实时通话 AI 分身

开发者 Leaf 开源项目,将网红峰哥做成能实时通话的 AI 分身,集成实时对话、音色克隆和人格注入,工程延迟压到 1 秒内。技术拆解:语音识别用 Cartesia ink-whisper 降噪防误触发;大模型选 MiniMax 高速版,首字响应 361ms;语音合成用 VoxCPM 开源克隆,15 秒素材即可复刻。整体从最初 8-20 秒优化至体感 2-3 秒。人格通过女娲 Skill 从直播语料蒸馏出口头禅和思维逻辑。普通人半小时可跑通:克隆项目后,用 Claude Code 或 Cursor 配置,填两个 API Key 即可使用。

Leaf Yeah!: http://x.com/i/article/2070103285181349888


推荐理由:Leaf 开源的这个实时语音分身项目,把工程延迟拆解到毫秒级,选型和人格蒸馏细节全公开,想做个性化语音机器人的可以直接复用,实践导向很强。

6月25日

星期四 · 1 条
00:15
Hugging Face:Blog(RSS)精选
AI 评分 61/100
FFASR 排行榜发布:真实远场条件下 ASR 评测

Treble Technologies 与 Hugging Face 联合推出 FFASR(Far-Field ASR)排行榜,这是首个开源社区驱动的真实远场声学条件 ASR 评测基准。传统近场评测无法反映混响、背景噪声和麦克风距离带来的性能下降。FFASR 使用混合波模拟引擎生成声学数据,涵盖 14 种房间(20–470 m³)和三个信噪比级别(远场高 SNR >14 dB、中 SNR 8–12 dB、低 SNR <6 dB),加上近场干燥条件,共四类条件决定主排名。另有实验室实测/模拟验证轨道和移动声源 beta 版。性能指标同时报告词错误率(WER)和实时因子(RTFx,在 NVIDIA L4 GPU 上评估)。未来将支持多说话人场景、麦克风阵列和回声消除。


推荐理由:远场语音的‘实验室-生产’性能差终于有了量化指标,这个排行榜把 ASR 的真实世界鲁棒性公开化,做语音产品的团队该看看。

6月24日

星期三 · 1 条
12:42
IT之家(RSS)精选
AI 评分 74/100
OpenAI ChatGPT 语音最大规模升级:双向AI语音模型 Bidi 1 已上线测试

6月23日,部分用户反馈 ChatGPT 网页版和 App 版上线了双向 AI 语音模型 Bidi 1,位于设置模型选择器中,与标准语音和高级语音并列。该模型支持边说话边监听,用户可在对话中途打断并发出新指令,例如要求从1数到10时中途喊停倒数,模型会立即切换执行。OpenAI 尚未官宣,预计本周启动更大范围测试。


推荐理由:Bidi 1 让 ChatGPT 语音从回合制变成双向并行,打断后能立即响应,这是语音交互真正的升维,普通人很快就能感受到对话自然感的质变。

6月23日

星期二 · 2 条
19:10
IT之家(RSS)精选
AI 评分 72/100
网易有道发布 Confucius4-TTS:14 语种跨语种无口音语音克隆开源模型

网易有道推出“子曰 4.0”TTS 引擎 Confucius4-TTS,声称是业内首个支持 14 种语言跨语种无口音、且无需参考文本即可完成语音克隆的开源模型。用户仅需 3 秒音频即可实现零样本音色克隆,克隆音色与原声相似度超 85%,任务准确度达 97%。模型支持中文、英语等 14 种语言,首创音频 Prompt 情感克隆迁移。底层采用 GPT 式语义大模型、SSL 预训练特征与 ECAPA-TDNN 说话人编码器、Flow Matching 框架。已全量开源(Apache 协议),提供 54GB 资源包供本地部署。


推荐理由:网易有道把语音克隆的门槛压到了 3 秒,跨 14 种语言还能保持无口音,而且全量开源、商用无限制,对多语种配音和短剧出海是直接可用的工具。
13:50
公众号:火山引擎精选
AI 评分 71/100
豆包音频生成模型1.0发布,重新定义AI音频创作

火山引擎正式发布豆包音频生成模型1.0(Doubao-Seed-Audio 1.0),支持文本与音频参考生成,端到端输出目标音频。单条Prompt可编排多角色对白、情绪语气、背景音乐及环境氛围,长时生成中保持多角色音色一致性,无需后期多轨混音。模型支持0样本多模态输入,无需额外训练即可生成;实现音色与风格解耦控制及“一声多角”能力。一次支持2分钟音频创作,多次延长保持音色统一。已开启火山方舟API邀测,个人用户享30分钟创作额度,即将上线剪映、即梦、番茄等产品。


推荐理由:豆包音频生成模型把多角色配音、音效、配乐压缩进一条 Prompt,长时一致性解决了一直以来‘串戏’的痛点,音频创作者的生产流程可能会被改写。