内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
内部员工登录
精选全部日报更多
反馈
内部员工登录

精选

AIHT7月17日 · 周五
最新精选
全部模型产品行业论文技巧

7月16日周四

02:09Thinking Machines70Thinking Machines 发布多模态模型 Inkling多模态推理终于有了开放权重的选项,Inkling不是最强的,但可能是最方便你上手微调的。想试试多模态Agent的,今天就能在Playground玩。
01:09OpenAI:官网动态(RSS · 排除企业/客户案例)67OpenAI 发布 GPT-Red:通过自动化红队测试提升模型鲁棒性OpenAI 用自博弈训练出的红队模型 GPT-Red,把直接提示注入攻击成功率压到了 0.05%,而且没有降低模型能力。做 AI 安全的人应该好好读一下他们怎么实现这个飞轮的。

7月15日周三

10:40公众号:通义实验室(千问)73阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一我觉得Qwen-Audio-3.0-Realtime把情感表达和背景降噪结合得很好,加上工具调用,语音交互终于从聊天走向任务执行,有API可以直接上手,推荐语音产品经理试试。
03:55Hacker News 热门(buzzing.cc 中文翻译)76Bonsai 27B:首款可在手机上运行的27B级多模态模型1-bit 量化把 27B 模型压到 4GB,首次能在 iPhone 上跑,agent 循环零边际成本,做端侧产品的该坐不住了。
00:51Google Developers Blog(RSS)58Google 在 I/O Connect India 展示由 Tensor SoC 和 TPU 驱动的 Pixel 10 端侧 AI 未来我觉得这是端侧 AI 从实验到落地的信号,Gemma 4 E2B 的离线能力搭配新 SDK,让完全本地的多模态应用不再是期货,做移动隐私 AI 的开发者该上手试试了。

7月14日周二

17:00公众号:腾讯混元73腾讯混元 Hy3 量化版发布:1bit 版本单卡可部署,4bit 版本接近满血性能295B 的旗舰模型压到一张 96G 卡就能跑,1bit 量化在长文理解和代码上居然没崩,对于想本地跑大模型的开发者是个实打实的好消息。
09:05SenseTime74商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。
08:00HuggingFace Daily Papers(社区热门论文)74Boogu-Image-0.1 发布:开源统一多模态理解与生成模型,训练成本仅约 40 万美元开源多模态模型终于有一个能打闭源系统的了,40万美元训练成本刷到接近GPT-Image-2的水平,想自己部署图像生成和编辑产品的开发者可以认真看看。

7月13日周一

20:02The Decoder:AI News(RSS)70德国AI协会发布开源模型Soofi S,在英语和德语基准测试中领先德国联盟用 Mamba-Transformer 混合架构做出一个 30B 开源模型,德语基准横扫,长上下文推理吞吐八倍于同级密集模型,想做德语 AI 的可以认真看了。
19:20公众号:腾讯混元76腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍我觉得这是近期最实在的OCR开源,1B参数覆盖多任务、推理加速6倍,还支持llama.cpp本地部署,做文档解析的同学可以直接上车。
00:35AYi75腾讯混元发布Hy3模型:295B参数MoE架构,Agent向LLM定位,已集成微信服务10亿+用户腾讯Hy3 不拼参数拼干活效率,直接集成十亿用户,这是国产模型第一次把 Agent 底座铺到日常生活里,比刷榜重要得多。

7月12日周日

00:55Sam Altman68OpenAI 发布 GPT-5.6 系列医疗评估结果GPT-5.6 在医疗任务上被医生评价比真人医生缺陷更少, 这是AI辅助诊断的分水岭, 产品人和医疗从业者值得看具体数据。

7月11日周六

16:17MarkTechPost(RSS)74蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型具身智能领域第一个从零预训练的因果视频-动作模型,将世界状态和动作统一在一个隐空间,异步推理优化到 225Hz,做机器人的值得仔细研究。

7月10日周五

12:01公众号:龙猫LongCat(美团)74美团 LongCat-2.0 正式开源,同步开放国产卡推理代码国产算力跑万亿模型的第一份完整开源答卷,代码、芯片适配细节全公开,做国产大模型落地的直接抄作业。
08:20Google Research:Blog(网页)70Google Research 推出 SensorFM:面向可穿戴健康数据的通用基础模型SensorFM 在 500 万人、万亿分钟传感器数据上训练出一个通用生理基础模型,35 项任务全面领先,自动调参的代理教室也很有想法,做健康 AI 的人值得细读。
06:21Hacker News 热门(buzzing.cc 中文翻译)71Cognition 推出 SWE-1.7,接近 GPT 5.5 与 Opus 智能水平Cognition 把 RL 训练的编码模型推到了和 GPT-5.5 叫板的水平,成本还低得多,做代码 agent 的值得认真看看他们的训练稳定性、多集群等思路。
03:59OpenAI:官网动态(RSS · 排除企业/客户案例)69GPT-5.6 成为 Microsoft 365 Copilot 首选模型GPT-5.6进入Microsoft 365 Copilot,标志着OpenAI的最强模型直接嵌入全球最广泛使用的办公套件,普通用户终于能无感体验到前沿AI,但别期望太多颠覆,只是模型升级带来的自然提升。
01:12OpenAI:官网动态(RSS · 排除企业/客户案例)80OpenAI 推出 ChatGPT Work:可跨应用自主工作的 AI 智能体ChatGPT Work 把代理能力真正派发给了普通用户,配合插件、定时任务和电脑控制,这是 ChatGPT 从问答工具迈向自主完成复杂工作的关键一步。但我更关心 GPT-5.6 的推理提升到底多大,案例里没给数字。
01:12OpenAI:官网动态(RSS · 排除企业/客户案例)85GPT-5.6 系列模型发布:Sol、Terra、LunaGPT-5.6 在编码、安全、知识工作上全面领先,且 token 效率大幅优化,是我今年见过的真正能改变 agent 开发成本结构的发布。程序化工具调用和 ultra 模式值得立即试用。

7月9日周四

22:30AI at Meta65Meta 发布 Muse Spark 1.1 模型Muse Spark 1.1 主打 agent 和 coding 能力,同时压到极低价,这可能是 Meta 低价模型策略的正式开场。虽然这次没给具体数据,但后续模型、API 的布局值得关注。
16:57MarkTechPost(RSS)70NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合 MoE 模型,服务器吞吐量提升 2.03 倍把120B MoE压到75B后,同节点服务吞吐几乎翻倍,单张H100百万token并发从1涨到8。对长上下文RAG和AI编码助手这类对吞吐敏感的产品来说,这不是论文调优,是实打实的降本方案。
15:16IT之家(RSS)73蚂蚁灵波开源实时交互世界模型 LingBot-World 2.0蚂蚁灵波这个开源世界模型把实时世界生成推到了小时级还不崩,720p/60fps实时交互,做开放世界游戏或自动驾驶仿真的团队值得上手测。
15:16IT之家(RSS)72蚂蚁灵波开源全球首个面向具身智能的MoE视频基模LingBot-Video蚂蚁灵波开源了首个面向具身智能的视频基模,用MoE控制推理成本,对机器人仿真和世界模型研究是个真工具,做具身的可以跑起来了。
08:57MarkTechPost(RSS)70Robbyant 发布 LingBot-VLA 2.0:开源 6B 跨实体机器人视觉-语言-动作模型蚂蚁Robbyant放出的开源VLA 2.0把通用机器人策略往前推了一步,60,000小时跨具身数据、统一动作空间和MoE设计对做机器人的团队是实打实的参考,不是又一个lab-only的demo。
02:50xAI:News(网页)85xAI 发布 Grok 4.5Grok 4.5 在编码任务上追平第一梯队,但真正的杀手锏是极致性价比——输出成本只有对手的四分之一,还会倒逼编码模型继续降价。
01:08OpenAI:官网动态(RSS · 排除企业/客户案例)77OpenAI 发布 GPT-Live 新一代全双工语音模型GPT‑Live 不是简单的语音版本升级,全双工架构让 AI 终于能同时听和说,加上后台调用 GPT‑5.5,对话体验跨了一大步,做语音应用的产品人该重新思考交互流程了。

7月8日周三

22:33Mistral AI:News(网页)70Robostral Navigate:Mistral AI 首个具身导航模型Mistral 首个具身导航模型,只用单 RGB 摄像头就在未见环境中跑赢深度传感器方案,对机器人行业是个真信号,做物流和制造的可以仔细看看。
21:22字节 Seed:Research Feed(网页内嵌数据)78Seedream 5.0 Pro 发布:不止"生成",更懂"设计"字节这次发布的 Seedream 5.0 Pro 把图像生成从「画得好看」推进到「能输出信息图、能精准编辑」的实用设计工具,尤其复杂信息图和交互编辑是当前竞品明显短板,做设计的值得立刻试试。
11:24MarkTechPost(RSS)71蚂蚁集团旗下Robbyant开源LingBot-Vision:1B参数边界中心视觉基础模型,用于密集空间感知在视觉基础模型里把边界当作核心信号,这个思路很反常识,1B模型在深度估计上超过7B的DINOv3,做机器人的可以认真看看。
10:18HuggingFace Daily Papers(社区热门论文)72Nemotron-Labs-Diffusion:统一自回归、扩散与自我推测解码的三模式语言模型NVIDIA 把自回归和扩散塞进同一个模型,吞吐量拉高 4 倍,做实时应用的团队可以开始换架构了。
09:43Hacker News 热门(buzzing.cc 中文翻译)75Pulpie:用于清理网络的Pareto最优模型做网页清洗的同行该更新工具了,Pulpie 以二十分之一的成本追平 SOTA 质量,而且开箱即用,是今年数据管线里最值得换的组件之一。
03:58AI at Meta75Meta Superintelligence Labs 推出 Muse Image 和 Muse VideoMeta 超级智能实验室的首个媒体生成模型,把图像生成跟 Instagram 社交语境结合听起来很实用,但细节还少,期待后续实测。

7月6日周一

15:20公众号:腾讯混元70腾讯混元 Hy3 正式发布:智能体与产品体验显著提升腾讯混元 Hy3 不堆参数,靠 agent 能力和产品实测说话,幻觉率减半、多轮问题率大降,开源+降价让开发者能直接上手,是国内大模型里少见的产品导向发布。
14:20公众号:通义实验室(千问)73Fun-ASR-Realtime 发布:单模型支持30种语言与16种方言,识别准确率领先Fun-ASR Realtime把多语言方言和流式一体化做得很扎实,特别是对东亚东南亚的优化,准确率提升明显,做语音应用的产品人可以直接关注。

7月5日周日

22:21Meituan LongCat81美团 LongCat-2.0 完全开源(MIT 许可),1.6T MoE 模型开放权重与推理代码国内大厂首个在 SWE-bench Pro 上超过 GPT-5.5 的开源模型,MIT 协议无任何限制,搞 agentic coding 的团队可以直接用,是个重要转折。

7月3日周五

23:46公众号:生数科技(Vidu·视频)70生数科技发布 Vidu S1,推动视频生成迈向"实时交互"新时代Vidu S1 把视频生成从离线拉到了实时通话级交互,语音控制无限时长是质变,但只有540P,内测阶段实际延迟和稳定性待看,做虚拟陪伴和直播的可以跟。
23:19Mistral AI:News(网页)66Leanstral 1.5:人人可用的证明丰富性Leanstral 1.5饱和miniF2F基准,成本仅为同类模型1/75,并自动发现5个真实代码bug,表明AI形式验证开始实用化。虽然受众窄,但对代码正确性有执念的开发者必看。

7月2日周四

10:32腾讯混元:Research(API)69腾讯混元正式发布Hy3模型腾讯混元重建后的正式版,幻觉率砍半,工具调用稳定性大幅提升,内部盲测压过GLM5.1。做Agent和内部工具的团队值得重新评估这个高性价比选项。

7月1日周三

16:32MarkTechPost(RSS)73NVIDIA 发布 Nemotron-Labs-TwoTower 开放权重扩散语言模型NVIDIA这个TwoTower把扩散解码接在已有的AR骨干上,几乎无损质量却让吞吐翻倍,并且开源可商用,对批量文本生成的团队是实在的加速工具。
12:00公众号:龙猫LongCat(美团)82美团 LongCat-2.0 正式发布:国产算力集群训练的万亿参数大模型国产算力上首个全流程自训的万亿开源模型,1M上下文和动态专家架构直指Agentic Coding场景,OpenRouter调用量已经冲到前三,不是Demo是生产力。
精选
2026年7月17日星期五 · AI 自动挑选的高价值内容
全部模型产品行业论文技巧

7月16日

星期四 · 2 条
02:09
Thinking Machines@thinkymachines精选
70
今天,我们推出 Inkling。 Inkling 能高效地对文本、图像和音频模态进行推理。我们将提供完整权重。 https://thinkingmachines.ai/news/introducing-inkling/ 即日起可在 Tinker 上进行微调。在 Inkling Playground 中试用。🧵
多模态开源/仓库推理模型发布
另有 9 家信源报道X:Testing Catalog (@testingcatalog)IT之家(RSS)The Decoder:AI News(RSS)TechCrunch:AI(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Artificial Analysis (@ArtificialAnlys)X:Rohan Paul (@rohanpaul_ai)X:邵猛 (@shao__meng)X:歸藏 (@op7418)
推荐理由:多模态推理终于有了开放权重的选项,Inkling不是最强的,但可能是最方便你上手微调的。想试试多模态Agent的,今天就能在Playground玩。
01:09
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
67
OpenAI 发布 GPT-Red:通过自动化红队测试提升模型鲁棒性

OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。

OpenAI安全/对齐数据/训练
另有 4 家信源报道X:Greg Brockman (@gdb)IT之家(RSS)The Decoder:AI News(RSS)X:OpenAI (@OpenAI)
推荐理由:OpenAI 用自博弈训练出的红队模型 GPT-Red,把直接提示注入攻击成功率压到了 0.05%,而且没有降低模型能力。做 AI 安全的人应该好好读一下他们怎么实现这个飞轮的。

7月15日

星期三 · 3 条
10:40
公众号:通义实验室(千问)精选
73
阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一

阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。

智能体多模态模型发布语音
另有 1 家信源报道IT之家(RSS)
推荐理由:我觉得Qwen-Audio-3.0-Realtime把情感表达和背景降噪结合得很好,加上工具调用,语音交互终于从聊天走向任务执行,有API可以直接上手,推荐语音产品经理试试。
03:55
Hacker News 热门(buzzing.cc 中文翻译)精选
76
Bonsai 27B:首款可在手机上运行的27B级多模态模型

Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入 iPhone 17 Pro。模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。采用 Apache 2.0 许可证开源。

多模态推理模型发布端侧
另有 4 家信源报道X:Berry Xia (@berryxia)IT之家(RSS)The Decoder:AI News(RSS)X:小互 (@xiaohu)
推荐理由:1-bit 量化把 27B 模型压到 4GB,首次能在 iPhone 上跑,agent 循环零边际成本,做端侧产品的该坐不住了。
00:51
Google Developers Blog(RSS)精选
58
Google 在 I/O Connect India 展示由 Tensor SoC 和 TPU 驱动的 Pixel 10 端侧 AI 未来

在 Google I/O Connect India 上,Google 展示了由定制 Tensor SoC 和 TPU 驱动的 Pixel 10 系列所支持的 100% 私有端侧 AI 未来。活动首次推出轻量级 Gemma 4 E2B 模型,该模型原生运行于设备端,可实现完全离线的多模态功能,包括 AI 聊天、实时图像识别和个人智能体任务。开发者即日起可通过新发布的 Tensor SDK beta 及其配套开源资源,开始构建这些安全的边缘应用。

Google多模态模型发布端侧

推荐理由:我觉得这是端侧 AI 从实验到落地的信号,Gemma 4 E2B 的离线能力搭配新 SDK,让完全本地的多模态应用不再是期货,做移动隐私 AI 的开发者该上手试试了。

7月14日

星期二 · 3 条
17:00
公众号:腾讯混元精选
73
腾讯混元 Hy3 量化版发布:1bit 版本单卡可部署,4bit 版本接近满血性能

腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPTQ Int4 版本,支持 vLLM 部署。配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。

开源生态模型发布部署/工程
另有 1 家信源报道IT之家(RSS)
推荐理由:295B 的旗舰模型压到一张 96G 卡就能跑,1bit 量化在长文理解和代码上居然没崩,对于想本地跑大模型的开发者是个实打实的好消息。
09:05
SenseTime@SenseTime_AI精选
74
商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型

商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。

arXivGitHub多模态开源生态
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。
08:00
HuggingFace Daily Papers(社区热门论文)精选
74
Boogu-Image-0.1 发布:开源统一多模态理解与生成模型,训练成本仅约 40 万美元

Boogu-Image-0.1 系列开源统一多模态理解与生成模型发布,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体,支持高质量文生图、快速推理、指令编辑及中英双语文本渲染。

图像生成多模态开源/仓库模型发布

推荐理由:开源多模态模型终于有一个能打闭源系统的了,40万美元训练成本刷到接近GPT-Image-2的水平,想自己部署图像生成和编辑产品的开发者可以认真看看。

7月13日

星期一 · 3 条
20:02
The Decoder:AI News(RSS)精选
70
德国AI协会发布开源模型Soofi S,在英语和德语基准测试中领先

德国AI协会协调的研究联盟发布开源大语言模型Soofi S 30B-A3B。该模型总参数量316亿,每个token仅激活约32亿参数,采用Mamba-2与标准注意力层混合的MoE架构。模型完全在德国电信慕尼黑工业AI云上训练,训练数据中德语占比从第一阶段的7.2%提升至第二阶段的15.3%。在基准测试中,Soofi S在所有完全开源模型中取得英语和德语综合最高分,超越OLMo 3 32B和Apertus 70B。在HumanEval上得分73.8%,MBPP得分70.2,德语版MBPP得分84.2。上下文窗口支持最高100万token,在4万token长度下,生成吞吐量约为同规模稠密模型的8倍。模型权重已开源。

开源/仓库模型发布编码
另有 1 家信源报道HuggingFace Daily Papers(社区热门论文)
推荐理由:德国联盟用 Mamba-Transformer 混合架构做出一个 30B 开源模型,德语基准横扫,长上下文推理吞吐八倍于同级密集模型,想做德语 AI 的可以认真看了。
19:20
公众号:腾讯混元精选
76
腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍

腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。

arXivGitHub多模态开源生态

推荐理由:我觉得这是近期最实在的OCR开源,1B参数覆盖多任务、推理加速6倍,还支持llama.cpp本地部署,做文档解析的同学可以直接上车。
00:35
AYi@AYi_AInotes精选
75
腾讯混元发布Hy3模型:295B参数MoE架构,Agent向LLM定位,已集成微信服务10亿+用户

腾讯混元团队发布Hy3模型,采用295B总参数、21B激活参数的MoE架构,推理效率可打平参数规模2-5倍的旗舰模型。Hy3定位为Agent向LLM,从preview到正式版基于50多个真实业务反馈迭代,内部WorkBuddy任务成功率从72%提升至90%,耗时降低34%,幻觉和常识错误持续下降。实测显示其在coding、办公、复杂任务规划方面表现突出,纯视觉能力为短板。Hy3已集成至微信服务10亿+用户,视频演示包括生成HTML网页、Agent网页和10页PPT,模型具备自检和主动说明不足的能力。

AYi: 最近当大家都在刷屏Fable 5和GPT-5.6 的时候, 殊不知腾讯已经悄无声息的把大模型能力给追上来了。 你们知道腾讯低调到什么程度吗? 前几天发布的Hy3 ,21B的激活参数已经可以打平旗舰水准,并且直接塞进微信10 亿+用户手里 ,...

智能体推理模型发布
另有 1 家信源报道X:阿易 AI Notes (@AYi_AInotes)
推荐理由:腾讯Hy3 不拼参数拼干活效率,直接集成十亿用户,这是国产模型第一次把 Agent 底座铺到日常生活里,比刷榜重要得多。

7月12日

星期日 · 1 条
00:55
Sam Altman@sama精选
68
OpenAI 发布 GPT-5.6 系列在医疗领域的评估结果。最小变体 GPT-5.6 Luna 在最低推理强度下即超越最高推理强度的 GPT-5.5,且成本低 25 倍;最大变体 GPT-5.6 Sol 树立新标杆。在涵盖患者端与临床端的多样化任务中,专科医生被要求以无限时间和网络访问权限撰写回答,随后由其他医生盲评。评估基于准确性、沟通、完整性、指令遵循及健康决策帮助性五个维度,共 20000 次评分。结果显示,所有 GPT-5.6 模型表现均显著优于医生,且医生发现 GPT-5.6 回答中的缺陷少于医生自己撰写的回答。

Karan Singhal: ♥️ GPT-5.6 在健康领域迈出了重要一步,无论是在前沿性能还是成本方面。 这些模型推动了每美元性能的边界,将最优秀的健康智能带给所有人。最小的变体 GPT-5.6 Luna,在最低推理努力下进行评估,其表现超过了最高推理努力下的 GP...

OpenAI推理模型发布

推荐理由:GPT-5.6 在医疗任务上被医生评价比真人医生缺陷更少, 这是AI辅助诊断的分水岭, 产品人和医疗从业者值得看具体数据。

7月11日

星期六 · 1 条
16:17
MarkTechPost(RSS)精选
74
蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型

蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。

具身智能多模态开源/仓库模型发布
另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)
推荐理由:具身智能领域第一个从零预训练的因果视频-动作模型,将世界状态和动作统一在一个隐空间,异步推理优化到 225Hz,做机器人的值得仔细研究。

7月10日

星期五 · 6 条
12:01
公众号:龙猫LongCat(美团)精选
74
美团 LongCat-2.0 正式开源,同步开放国产卡推理代码

美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。

GitHub开源生态推理模型发布

推荐理由:国产算力跑万亿模型的第一份完整开源答卷,代码、芯片适配细节全公开,做国产大模型落地的直接抄作业。
08:20
Google Research:Blog(网页)精选
70
Google Research 推出 SensorFM:面向可穿戴健康数据的通用基础模型

Google Research 发布 SensorFM,一个在超过 100 万亿分钟多模态传感器数据上预训练的大规模基础模型,数据来自 500 万同意参与者,涵盖 100 多个国家及 20 余款 Fitbit 和 Pixel Watch 设备。SensorFM 学习通用的人体生理表征,可迁移至心血管、代谢、睡眠、心理健康及生活方式等 35 项健康预测任务,支持标签高效适配与数据填充,并可作为个人健康智能体的基础工具。该模型旨在解决传统可穿戴健康模型针对单一终点、难以泛化的问题。

Google多模态数据/训练模型发布

推荐理由:SensorFM 在 500 万人、万亿分钟传感器数据上训练出一个通用生理基础模型,35 项任务全面领先,自动调参的代理教室也很有想法,做健康 AI 的人值得细读。
06:21
Hacker News 热门(buzzing.cc 中文翻译)精选
71
Cognition 推出 SWE-1.7,接近 GPT 5.5 与 Opus 智能水平

Cognition 发布迄今最强模型 SWE-1.7,基于 Kimi K2.7 基座训练,通过强化学习管线改进(基础设施、训练稳定性、数据质量、长程任务技术)实现前沿智能水平并大幅降低成本。在 FrontierCode 1.1 Main 基准上达 42.3%(Kimi K2.7 Code 为 30.1%,GPT-5.5 为 43.0%,Opus 4.8 为 46.5%),Terminal-Bench 2.1 达 81.5%,SWE-Bench Multilingual 达 77.8%。模型针对长周期异步任务优化,现已在 Devin(Web、桌面、CLI)通过 Cerebras 以 1000 TPS 提供。

推理模型发布编码

推荐理由:Cognition 把 RL 训练的编码模型推到了和 GPT-5.5 叫板的水平,成本还低得多,做代码 agent 的值得认真看看他们的训练稳定性、多集群等思路。
03:59
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
69
GPT-5.6 成为 Microsoft 365 Copilot 首选模型

OpenAI 宣布 GPT-5.6 将作为 Microsoft 365 Copilot 的首选模型,覆盖 Word、Excel、PowerPoint、Chat 和 Cowork。该集成使用户能在日常工具中以更少提示轮次创建更高质量文档、进行更深入数据分析、生成更精美演示,并完成跨职能协作。GPT-5.6 在每个 token 上提供更实用的工作产出,性价比更强,并支持按需处理最复杂任务。微软通过 OpenAI API 直接调用该模型服务 Microsoft 365 客户。

MicrosoftOpenAI模型发布
另有 5 家信源报道X:歸藏 (@op7418)IT之家(RSS)公众号:卡尔的AI沃茨X:Sam Altman (@sama)X:Satya Nadella (@satyanadella)
推荐理由:GPT-5.6进入Microsoft 365 Copilot,标志着OpenAI的最强模型直接嵌入全球最广泛使用的办公套件,普通用户终于能无感体验到前沿AI,但别期望太多颠覆,只是模型升级带来的自然提升。
01:12
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
80
OpenAI 推出 ChatGPT Work:可跨应用自主工作的 AI 智能体

OpenAI 发布 ChatGPT Work,一个能跨应用和文件收集信息、将复杂项目分解为小步骤独立完成并持续工作数小时的 AI 智能体。它内置 Codex 技术,目前每周超 500 万用户使用 Codex,其中超 100 万用于非软件开发场景。ChatGPT Work 由今天同步推出的最新前沿模型 GPT‑5.6 驱动,具备多步骤推理和按模板生成材料的能力。该功能今天起面向 Pro、Enterprise 和 Edu 计划推出,未来几天扩展至 Plus 和 Business 计划。桌面版 ChatGPT 在所有计划(含免费版)中提供 Chat、Work 和 Codex 模式,且 Codex 应用已合并至新的桌面应用。

智能体OpenAI推理模型发布
另有 9 家信源报道X:OpenAI Developers (@OpenAIDevs)X:邵猛 (@shao__meng)X:OpenAI (@OpenAI)X:Tibo (@thsottiaux)Hacker News 热门(buzzing.cc 中文翻译)X:Sam Altman (@sama)X:宝玉 (@dotey)X:Testing Catalog (@testingcatalog)X:Greg Brockman (@gdb)
推荐理由:ChatGPT Work 把代理能力真正派发给了普通用户,配合插件、定时任务和电脑控制,这是 ChatGPT 从问答工具迈向自主完成复杂工作的关键一步。但我更关心 GPT-5.6 的推理提升到底多大,案例里没给数字。
01:12
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
85
GPT-5.6 系列模型发布:Sol、Terra、Luna

OpenAI 推出 GPT-5.6 系列,包括旗舰 Sol、平衡型 Terra 和成本最优 Luna。在 Agents' Last Exam 上,Sol 以 53.6 分超越 Claude Fable 5(自适应推理)13.1 分;中等推理时以约四分之一成本领先 11.4 分。Terra 和 Luna 以约十六分之一成本超越 Fable 5。在 Artificial Analysis Coding Agent Index 上,Sol 以 80 分创 SOTA,高于 Fable 5 的 2.8 分,使用不到一半输出 token、一半时间,成本低约三分之一。引入 Programmatic Tool Calling 减少中间数据往返,ultra 模式协调多个智能体加速复杂任务。模型配备迄今最强安全防护,经人类红队和自动化测试验证。

OpenAI推理模型发布编码
另有 18 家信源报道X:OpenRouter (@OpenRouter)The Decoder:AI News(RSS)X:OpenAI Developers (@OpenAIDevs)X:Greg Brockman (@gdb)X:OpenAI (@OpenAI)MarkTechPost(RSS)Hacker News 热门(buzzing.cc 中文翻译)OpenAI:官网动态(RSS · 排除企业/客户案例)X:Noam Brown (@polynoamial)X:Testing Catalog (@testingcatalog)X:卡兹克 (@Khazix0918)X:宝玉 (@dotey)公众号:数字生命卡兹克Simon Willison 博客TechCrunch:AI(RSS)X:Jason Liu (@jxnlco)X:Kim (@kimmonismus)X:Sam Altman (@sama)
推荐理由:GPT-5.6 在编码、安全、知识工作上全面领先,且 token 效率大幅优化,是我今年见过的真正能改变 agent 开发成本结构的发布。程序化工具调用和 ultra 模式值得立即试用。

7月9日

星期四 · 7 条
22:30
AI at Meta@AIatMeta精选
65
来自 @finkd 的消息 - Muse Spark 1.1 已上线。

Mark Zuckerberg: (1) 今天我们发布了 Muse Spark 1.1--一款价格极低但能力强大的智能体与编程模型。该模型已通过我们全新的 Meta Model API 以及 Meta AI 开放使用。

智能体Meta模型发布编码
另有 7 家信源报道The Decoder:AI News(RSS)Simon Willison 博客X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:邵猛 (@shao__meng)X:Elvis Saravia (@omarsar0, DAIR.AI)
推荐理由:Muse Spark 1.1 主打 agent 和 coding 能力,同时压到极低价,这可能是 Meta 低价模型策略的正式开场。虽然这次没给具体数据,但后续模型、API 的布局值得关注。
16:57
MarkTechPost(RSS)精选
70
NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合 MoE 模型,服务器吞吐量提升 2.03 倍

NVIDIA 发布 Nemotron-3-Super 的压缩变体 Nemotron-Labs-3-Puzzle-75B-A9B,总参数从 120.7B 降至 75.3B,活跃参数从 12.8B 降至 9.3B,保持 88 块混合布局(40 Mamba、40 MoE、8 注意力)。在 8×B200 节点上,8K/64K 场景匹配用户吞吐量≥100 tok/s 时,服务器吞吐量提升 2.03 倍。单 H100 上 1M-token 并发从 1 增至 8,权重占用从 70 GB 降至 44.5 GB。迭代式 Puzzle 方法平均得分比单步高 0.57。代价:Arena-Hard-V2 降 4.2 分、SWE-Bench 降 2.6 分。Hugging Face 提供 BF16、FP8、NVFP4 检查点。

模型发布部署/工程
另有 1 家信源报道MarkTechPost(RSS)
推荐理由:把120B MoE压到75B后,同节点服务吞吐几乎翻倍,单张H100百万token并发从1涨到8。对长上下文RAG和AI编码助手这类对吞吐敏感的产品来说,这不是论文调优,是实打实的降本方案。
15:16
IT之家(RSS)精选
73
蚂蚁灵波开源实时交互世界模型 LingBot-World 2.0

蚂蚁灵波开源新一代实时交互世界模型 LingBot-World 2.0(14B 参数),支持施法、攻击、跳跃等丰富角色动作及文本驱动事件(如切换场景、召唤风暴),内置 Pilot Agent 与 Director Agent 实现世界持续演化,并支持多人同时交互。模型采用因果预训练范式和混合双向自回归注意力掩码(MoBA),可稳定输出 720p/60fps 实时画面,长达一小时测试画质不衰减。通过一致性蒸馏与 DMD 降低采样成本,结合注意力 kernel 优化、混合并行推理、动态 KV 缓存调度和异步流媒体传输实现低延迟交互。模型权重及推理代码以非商用协议开源,SGLang 已适配,并提供 Reactor PC 端和灵光 APP 在线体验。

具身智能多模态开源生态模型发布

推荐理由:蚂蚁灵波这个开源世界模型把实时世界生成推到了小时级还不崩,720p/60fps实时交互,做开放世界游戏或自动驾驶仿真的团队值得上手测。
15:16
IT之家(RSS)精选
72
蚂蚁灵波开源全球首个面向具身智能的MoE视频基模LingBot-Video

蚂蚁灵波科技正式开源LingBot-Video,这是全球首个基于MoE架构、面向具身智能的视频生成基础模型。总参数30B,推理时仅激活约3B,效率较同规模Dense架构提升约3倍。模型引入7万小时VLA、VLN、Ego等机器人数据,并通过多维强化学习奖励系统对齐物理合理性与任务完成度。在RBench上总分0.620,超越Wan2.6等模型;在Physics-IQ Verified评测中排名第一。可用于机器人动作预测、仿真数据生成等方向。

具身智能开源/仓库模型发布

推荐理由:蚂蚁灵波开源了首个面向具身智能的视频基模,用MoE控制推理成本,对机器人仿真和世界模型研究是个真工具,做具身的可以跑起来了。
08:57
MarkTechPost(RSS)精选
70
Robbyant 发布 LingBot-VLA 2.0:开源 6B 跨实体机器人视觉-语言-动作模型

Robbyant 推出 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型。它以 Qwen3-VL-4B-Instruct 为骨干,采用 MoE 动作专家架构,通过 55 维规范向量统一表示不同机器人的状态和动作。训练数据涵盖约 60,000 小时高质量数据(50,000 小时机器人轨迹 + 10,000 小时第一人称人类视频),覆盖 20 种机器人配置。在 GM-100 双机械臂基准测试中,模型在多个平台上超越 π0.5 和之前版本。模型权重、代码和技术报告已以 Apache-2.0 许可开源。

具身智能开源生态模型发布

推荐理由:蚂蚁Robbyant放出的开源VLA 2.0把通用机器人策略往前推了一步,60,000小时跨具身数据、统一动作空间和MoE设计对做机器人的团队是实打实的参考,不是又一个lab-only的demo。
02:50
xAI:News(网页)精选
85
xAI 发布 Grok 4.5

xAI 今日推出 Grok 4.5,为其最强模型,专为编程、智能体任务和知识工作打造。模型训练于数万块 NVIDIA GB300 GPU,DeepSWE 1.0 得分 62.0%,DeepSWE 1.1 得分 53%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。服务速度 80 TPS,token 效率约为 Opus 4.8 (max) 的 4.2 倍,在 Harvey Legal Agent Benchmark 排名第一。定价 $2/百万输入 token、$6/百万输出 token。即日起在 Grok Build、Cursor 和 SpaceXAI API 可用,欧盟地区预计 7 月中旬上线。

智能体xAI推理模型发布
另有 8 家信源报道The Decoder:AI News(RSS)Cursor BlogX:Michael Truell (@mntruell)X:Elon Musk (@elonmusk, xAI)IT之家(RSS)X:Berry Xia (@berryxia)MarkTechPost(RSS)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:Grok 4.5 在编码任务上追平第一梯队,但真正的杀手锏是极致性价比——输出成本只有对手的四分之一,还会倒逼编码模型继续降价。
01:08
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
77
OpenAI 发布 GPT-Live 新一代全双工语音模型

OpenAI 今日推出 GPT‑Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT‑5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT‑Live‑1 和 GPT‑Live‑1 mini 两个版本。人类评估显示,在 5‑10 分钟对话中,GPT‑Live‑1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、BrowseComp 和 τ³‑Voice Telecom 基准测试中也表现更强。未来将开放 API。

OpenAI推理模型发布语音
另有 13 家信源报道X:Testing Catalog (@testingcatalog)X:宝玉 (@dotey)TechCrunch:AI(RSS)X:Jason Liu (@jxnlco)X:OpenAI (@OpenAI)The Verge:AI(RSS)X:Greg Brockman (@gdb)X:Kim (@kimmonismus)The Decoder:AI News(RSS)IT之家(RSS)X:Berry Xia (@berryxia)Hacker News 热门(buzzing.cc 中文翻译)X:Sam Altman (@sama)
推荐理由:GPT‑Live 不是简单的语音版本升级,全双工架构让 AI 终于能同时听和说,加上后台调用 GPT‑5.5,对话体验跨了一大步,做语音应用的产品人该重新思考交互流程了。

7月8日

星期三 · 6 条
22:33
Mistral AI:News(网页)精选
70
Robostral Navigate:Mistral AI 首个具身导航模型

Robostral Navigate 是 Mistral AI 首个具身导航模型(8B 参数),仅用单 RGB 摄像头,在 R2R-CE 验证集上取得 76.6%(unseen)和 79.4%(seen)的成功率,超越最佳单摄像头方法 9.7 个百分点,超越使用深度或多摄像头的系统 4.5 个百分点。模型通过 pointing 预测目标坐标并结合强化学习持续改进,全部在模拟中训练(约 40 万轨迹、6000 场景),采用 prefix-caching 实现高效训练。通用适配轮式、腿式和飞行机器人,能适应真实环境中未训练的障碍。

具身智能多模态模型发布

推荐理由:Mistral 首个具身导航模型,只用单 RGB 摄像头就在未见环境中跑赢深度传感器方案,对机器人行业是个真信号,做物流和制造的可以仔细看看。
21:22
字节 Seed:Research Feed(网页内嵌数据)精选
78
Seedream 5.0 Pro 发布:不止"生成",更懂"设计"

字节 Seed 今日发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面升级。四大核心突破:复杂信息可视化,可生成高密度信息图;交互式精准编辑,支持点选、圈选、草图渲染、色彩与材质替换、图层分离及多图融合,实现像素级编辑;真实的影像与人像质感,还原光影、材质与皮肤肌理;原生多语种输入与生成,支持十余种语言及本地化视觉特征。已陆续在豆包、即梦、火山方舟等平台上线。

图像生成多模态模型发布
另有 1 家信源报道IT之家(RSS)
推荐理由:字节这次发布的 Seedream 5.0 Pro 把图像生成从「画得好看」推进到「能输出信息图、能精准编辑」的实用设计工具,尤其复杂信息图和交互编辑是当前竞品明显短板,做设计的值得立刻试试。
11:24
MarkTechPost(RSS)精选
71
蚂蚁集团旗下Robbyant开源LingBot-Vision:1B参数边界中心视觉基础模型,用于密集空间感知

蚂蚁集团旗下具身智能公司Robbyant开源LingBot-Vision,一套自监督视觉Transformer家族,专为密集空间感知设计。旗舰ViT-g/16参数约1.1B,采用掩膜边界建模训练,将边界作为原生预训练信号。在密集空间任务中,该1B模型匹配或超越参数规模高达7倍的大模型(如7B DINOv3)。模型以Apache-2.0许可证在Hugging Face开源,提供ViT-g、ViT-L(300M)、ViT-B(86M)、ViT-S四个规模。

具身智能多模态模型发布
另有 1 家信源报道X:karminski (@karminski3)
推荐理由:在视觉基础模型里把边界当作核心信号,这个思路很反常识,1B模型在深度估计上超过7B的DINOv3,做机器人的可以认真看看。
10:18
HuggingFace Daily Papers(社区热门论文)精选
72
Nemotron-Labs-Diffusion:统一自回归、扩散与自我推测解码的三模式语言模型

Nemotron-Labs-Diffusion 是一种三模式语言模型,通过联合自回归(AR)和扩散损失训练,在单一架构中统一了 AR、扩散和自我推测解码。研究显示 AR 与扩散目标互补:扩散增强前瞻规划,AR 提供从左至右的语言先验。自我推测模式下,扩散充当草稿模型、AR 负责验证,其接受率和实际设备效率均优于多 token 预测(MTP)。在最优化采样器下,单次前向传播产出 token 数比自我推测最多高 76.5%。该系列包含 3B、8B、14B 参数的基础、指令和视觉语言模型,在准确率和速度上均超越现有开源 AR 和扩散 LM。例如 8B 模型单次前向解码 token 数是 Qwen3-8B 的 6 倍,在 GB200 GPU 上使用 SGLang 运行 SPEED-Bench 时吞吐量提升 4 倍。

arXiv多模态推理模型发布

推荐理由:NVIDIA 把自回归和扩散塞进同一个模型,吞吐量拉高 4 倍,做实时应用的团队可以开始换架构了。
09:43
Hacker News 热门(buzzing.cc 中文翻译)精选
75
Pulpie:用于清理网络的Pareto最优模型

Pulpie是一族Pareto最优模型,用于从HTML页面提取主要内容。其最小模型pulpie-orange-small(210M参数)在WebMainBench上取得0.862的ROUGE-5 F1分数,接近600M参数的Dripper(0.864),但成本仅1/20。在NVIDIA L4 GPU上,Pulpie处理速度13.7页/秒,Dripper仅0.68页/秒。清理10亿页HTML,Pulpie成本约$7,900,Dripper需$159,000。模型采用编码器架构,单次前向传播即可标记每个HTML块为内容或模板,已在HuggingFace开源。

Hugging Face开源生态数据/训练模型发布

推荐理由:做网页清洗的同行该更新工具了,Pulpie 以二十分之一的成本追平 SOTA 质量,而且开箱即用,是今年数据管线里最值得换的组件之一。
03:58
AI at Meta@AIatMeta精选
75
Meta Superintelligence Labs 推出 Muse Image 和 Muse Video

Meta Superintelligence Labs 发布首个媒体生成模型 Muse Image 和 Muse Video。Muse Image 是目前最先进的图像生成模型,能精确遵循指令、精准编辑、多参考构图,并利用 Instagram 社交上下文。它还具备智能体工具使用能力并集成 Muse Spark。用户可通过 Meta AI 应用、网页、Instagram Stories 和 WhatsApp 试用,初始限于部分国家。Muse Video 基于相同预训练基础,实现高视觉保真度并原生支持音频。

Meta图像生成模型发布视频
另有 6 家信源报道X:AI at Meta (@AIatMeta)The Decoder:AI News(RSS)The Verge:AI(RSS)X:Testing Catalog (@testingcatalog)IT之家(RSS)TechCrunch:AI(RSS)
推荐理由:Meta 超级智能实验室的首个媒体生成模型,把图像生成跟 Instagram 社交语境结合听起来很实用,但细节还少,期待后续实测。

7月6日

星期一 · 2 条
15:20
公众号:腾讯混元精选
70
腾讯混元 Hy3 正式发布:智能体与产品体验显著提升

腾讯混元发布 Hy3,在推理、智能体、长上下文等任务上显著进步,比肩 2~5 倍参数规模旗舰模型。内部盲测均分 2.67/4,优于 GLM5.1(2.51/4)。幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,多轮问题率降至 7.9%,MRCR 从 42.9% 升至 75.1%。任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。API 价格为输入 1 元、输出 4 元(每百万 tokens),命中缓存 0.25 元。已以 Apache 2.0 协议在 GitHub、HuggingFace 等平台开源。

智能体GitHubHugging Face开源生态
另有 6 家信源报道X:腾讯混元 (@TencentHunyuan)IT之家(RSS)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)
推荐理由:腾讯混元 Hy3 不堆参数,靠 agent 能力和产品实测说话,幻觉率减半、多轮问题率大降,开源+降价让开发者能直接上手,是国内大模型里少见的产品导向发布。
14:20
公众号:通义实验室(千问)精选
73
Fun-ASR-Realtime 发布:单模型支持30种语言与16种方言,识别准确率领先

通义实验室发布Fun-ASR-Realtime实时语音识别模型。单模型覆盖30种语言及16种方言,针对东亚、东南亚地区重点优化。在工业级方言测评inhouse上取得87.8%的语义准确率,大幅领先,多地方言接近人工水平。引入上下文理解与动态热词注入,实现同音词、品牌名等语义消歧。流式识别首字延迟控制在百毫秒级,准确率接近离线水平,支持多语言无缝切换。API已上线阿里云百炼平台。

模型发布语音
另有 1 家信源报道IT之家(RSS)
推荐理由:Fun-ASR Realtime把多语言方言和流式一体化做得很扎实,特别是对东亚东南亚的优化,准确率提升明显,做语音应用的产品人可以直接关注。

7月5日

星期日 · 1 条
22:21
Meituan LongCat@Meituan_LongCat精选
81
美团 LongCat-2.0 完全开源(MIT 许可),1.6T MoE 模型开放权重与推理代码

美团今日宣布 LongCat-2.0 完全开源(MIT 许可),公开模型权重与推理代码。该模型为 MoE 架构,总参数量 1.6T,每 token 激活约 48B,支持 1M token 上下文。技术亮点包括 LongCat Sparse Attention 高效处理长文本、Zero-Compute Experts 动态激活 33B–56B 零浪费计算、MOPD 按任务路由 Agent/Reasoning/Interaction 三组专家。Benchmark 成绩:Terminal-Bench 2.1 70.8;SWE-bench Pro 59.5(超越 GPT-5.5 的 58.6);SWE-bench Multilingual 77.3;FORTE 73.2;RWSearch 78.8;BrowseComp 79.9。原生集成 Claude Code、OpenClaw、Hermes Agent 等工具,支持 GPU 与 NPU 部署,已在大规模国内集群验证。

Meituan LongCat: 推出 LongCat-2.0 🐱 1.6T 参数 · MoE 架构,约 48B 活跃参数 · 1M 上下文窗口 这是 @OpenRouter 上 Owl Alpha 背后的完整模型--现已可用。 从零开始为智能体编程构建: ◆ LongC...

智能体开源生态模型发布编码
另有 1 家信源报道MarkTechPost(RSS)
推荐理由:国内大厂首个在 SWE-bench Pro 上超过 GPT-5.5 的开源模型,MIT 协议无任何限制,搞 agentic coding 的团队可以直接用,是个重要转折。

7月3日

星期五 · 2 条
23:46
公众号:生数科技(Vidu·视频)精选
70
生数科技发布 Vidu S1,推动视频生成迈向"实时交互"新时代

7月3日,生数科技在2026全球数字经济大会上发布Vidu S1实时交互模型,支持实时视频通话和语音控制视频走向,实现无限时长连续互动。模型采用自回归扩散路线,基于已生成画面和语音指令持续预测后续内容;无需传统建模,一张图片即可创建角色并自定义音色。Vidu S1在540P分辨率下实现25FPS(最高42FPS)实时生成,通过TurboDiffusion等技术降低计算成本,已开启内测。

多模态模型发布视频
另有 1 家信源报道HuggingFace Daily Papers(社区热门论文)
推荐理由:Vidu S1 把视频生成从离线拉到了实时通话级交互,语音控制无限时长是质变,但只有540P,内测阶段实际延迟和稳定性待看,做虚拟陪伴和直播的可以跟。
23:19
Mistral AI:News(网页)精选
66
Leanstral 1.5:人人可用的证明丰富性

Mistral AI 今日发布 Leanstral 1.5,一款 Apache-2.0 许可的开源形式化验证模型,119B 总参数仅 6B 活跃。在 miniF2F 上达 100% 饱和,PutnamBench 解决 587/672 题,FATE-H(87%)和 FATE-X(34%)创 SOTA。训练经历 mid-training、SFT 和基于 CISPO 的强化学习。具备智能体式证明能力,在 57 个开源仓库中发现 5 个未知 bug。模型已通过 HuggingFace 和免费 API 开放使用。

Hugging Face开源/仓库推理模型发布
另有 1 家信源报道Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:Leanstral 1.5饱和miniF2F基准,成本仅为同类模型1/75,并自动发现5个真实代码bug,表明AI形式验证开始实用化。虽然受众窄,但对代码正确性有执念的开发者必看。

7月2日

星期四 · 1 条
10:32
腾讯混元:Research(API)精选
69
腾讯混元正式发布Hy3模型

腾讯混元于7月6日正式发布Hy3模型。相比preview版,任务解决率从72%升至90%,平均耗时缩短34%;幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%,多轮问题率从17.4%降至7.9%,长对话基准MRCR从42.9%升至75.1%。在270位专家盲测中均分2.67/4,优于GLM5.1的2.51/4。API价格为输入1元/百万tokens、输出4元、缓存命中0.25元。模型已基于Apache 2.0协议开源。

智能体开源/仓库模型发布编码

推荐理由:腾讯混元重建后的正式版,幻觉率砍半,工具调用稳定性大幅提升,内部盲测压过GLM5.1。做Agent和内部工具的团队值得重新评估这个高性价比选项。

7月1日

星期三 · 2 条
16:32
MarkTechPost(RSS)精选
73
NVIDIA 发布 Nemotron-Labs-TwoTower 开放权重扩散语言模型

NVIDIA 发布 Nemotron-Labs-TwoTower,基于冻结的自回归骨干 Nemotron-3-Nano-30B-A3B 的扩散语言模型。采用双塔架构:上下文塔冻结,降噪器塔训练,通过层对齐交叉注意力和状态播种协作。在 2×H100 上 BF16 评估,保留 98.7% 的 AR 基线质量,生成吞吐量提升 2.42 倍(γ=0.8,块大小 S=16)。降噪器在约 2.1T token 上训练,骨干使用 25T token 预训练。总参数约 60B,每 token 活跃参数约 3B/塔。支持扩散、模拟 AR 和 AR 三种解码模式。

开源生态推理模型发布部署/工程

推荐理由:NVIDIA这个TwoTower把扩散解码接在已有的AR骨干上,几乎无损质量却让吞吐翻倍,并且开源可商用,对批量文本生成的团队是实在的加速工具。
12:00
公众号:龙猫LongCat(美团)精选
82
美团 LongCat-2.0 正式发布:国产算力集群训练的万亿参数大模型

美团于6月30日发布新一代万亿参数大模型LongCat-2.0并开源。总参数1.6T,平均激活约48B,原生支持1M超长上下文,在五万卡国产算力集群上完成全流程训练与推理。采用LSA稀疏注意力、零计算专家、ScMoE及MOPD多专家融合(Agent/Reasoning/Interaction三组专家)架构。评测中SWE-bench Pro获59.5,SWE-bench Multilingual获77.3。预览版已通过OpenRouter和longcat.ai开放,月调用量跻身OpenRouter全球前三。

开源生态推理模型发布编码
另有 8 家信源报道X:邵猛 (@shao__meng)Hacker News 热门(buzzing.cc 中文翻译)X:Testing Catalog (@testingcatalog)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)公众号:卡尔的AI沃茨X:硅基流动 SiliconFlow (@SiliconFlowAI)X:美团 LongCat (@Meituan_LongCat)
推荐理由:国产算力上首个全流程自训的万亿开源模型,1M上下文和动态专家架构直指Agentic Coding场景,OpenRouter调用量已经冲到前三,不是Demo是生产力。