腾讯混元开源算子库 HPC-Ops 已集成至 SGLang 主分支,其 Dynamic Attention 与 Fused MoE 在 Hy3 模型上最高降低 TPOT 48.8%。
推理能力
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
8月8日
8月7日
千问今日上线多项新功能,并支持最新旗舰模型 Qwen3.8-MAX。其中“思考研究”在原“深度思考”基础上升级,强化复杂推理与工具调用;“定时任务”可预设执行时间自动完成行业简报梳理等周期工作;“办公助理”能连接备忘录、日历等应用并操作电脑浏览器,直接输出可用的 Office 文档。语音通话支持 7x24 小时多场景,智能体广场首批覆盖物流、房产等十多个领域。
另有 1 家信源报道IT之家(RSS)OpenAI 更新 ChatGPT:Plus 和 Pro 用户的 GPT-5.6 Sol 在事实准确性和回答聚焦度上有所提升,新增滑块可控制模型思考投入。免费用户默认模型升级为 GPT-5.6 Luna,并开放无限文本聊天,新增 Think 按钮以处理更复杂问题。
另有 10 家信源报道X:Greg Brockman (@gdb)TechCrunch:AI(RSS)X:OpenAI (@OpenAI)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)OpenAI:官网动态(RSS · 排除企业/客户案例)The Verge:AI(RSS)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)8月6日
OpenAI 于 2026 年 5 月 20 日宣布,其内部 AI 模型对埃尔德什 1946 年提出的“单位距离”问题给出了反例,成为首个由 AI 模型完成的历史性重要证明;8 月 1 日又宣布未发布模型 Astra 取得 10 项数学进展,其中解决了埃尔德什提出的另外 3 个问题。
8月5日
Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。
SpecForge v0.3.0 将目标模型推理与草稿模型训练分离,支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并统一在线、离线与解耦工作流。
8月4日
NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。
另有 2 家信源报道X:Jensen Huang (@JensenHuang)IT之家(RSS)蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。
另有 3 家信源报道X:Artificial Analysis (@ArtificialAnlys)X:蚂蚁百灵 (@AntLingAGI)IT之家(RSS)Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。
8月3日
OpenAI 内部测试的新模型 Astra 在数学问题上表现惊艳,但 Gary Marcus 指出相关讨论犯了“合成谬误”:擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。数学之所以成为突破口,是因为它便于用符号工具验证且能廉价生成海量合成数据,而开放世界问题无法如此模拟。此外,OpenAI 未公布方法细节,尚无法评估其真实意义。
8月1日
是的,非软性群确实存在:这一论断是 Astra(我们的下一代重大模型)证明的众多全新优美成果之一。 我们将发布 10 个此类 Astra 证明,每个都附带完整的 Lean 证书和链式推理(CoT)逐步讲解。这些成果涵盖范围广泛,从冯·诺依曼...
另有 11 家信源报道X:Ethan Mollick (@emollick)X:Elvis Saravia (@omarsar0, DAIR.AI)X:阿易 AI Notes (@AYi_AInotes)X:马东锡 NLP (@dongxi_nlp)X:Tibo (@thsottiaux)X:Noam Brown (@polynoamial)X:Rohan Paul (@rohanpaul_ai)X:Kim (@kimmonismus)The Decoder:AI News(RSS)IT之家(RSS)X:Karina Nguyen(@karinanguyen)7月31日
腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。
DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。
OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流。
另有 13 家信源报道X:Kim (@kimmonismus)X:OpenAI Developers (@OpenAIDevs)X:Tibo (@thsottiaux)X:Nathan Lambert (@natolambert)X:Sam Altman (@sama)The Decoder:AI News(RSS)X:Artificial Analysis (@ArtificialAnlys)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)Simon Willison 博客IT之家(RSS)7月30日
腾讯混元借助研究智能体Hyra及Hy3模型,构造出整数集A使|A+A|与|A-A|的指数比精确达到2,解决了自1969年以来悬而未决的极值问题。此前50余年最佳构造仅略超1.1,新成果证明最优指数即为2。论文及形式化证明已公开。
另有 1 家信源报道IT之家(RSS)研究提出“显著性偏差”概念,指大语言模型被输入中无用的显性干扰(如数字)劫持,忽略任务隐含的常识前提。基于新构建的 SaliTrap 基准评估 12 个主流模型,最佳模型仅 54.8% 查询避开陷阱,8/12 模型低于 30%;GLM-5.1 和 Kimi-K2 在识别陷阱后仍分别有 86.2% 和 81.8% 的遵从率。
OpenAI 通过启用两项 API 设置,使 GPT-5.6 在 ARC-AGI-3 基准测试上的得分提升至原来的三倍。这两项设置分别是保留推理过程(retaining reasoning)和启用压缩(compaction),在提升得分的同时也提高了效率。该发现基于 OpenAI 官方对 GPT-5.6 模型 API 参数的测试结果。
OpenAI 推出 GPT-5.6 模型家族,旗舰版 GPT-5.6 Sol 在开启最大推理时以不到一半的成本超越 Claude Fable 5 的 Artificial Analysis Coding Agent Index 得分。
7月29日
腾讯混元开源端到端投机解码框架 AngelSpec,支持训练与部署。在 Hy3-A21B 模型上,其 DFly 方案相比自回归解码实现 1.98–2.40 倍端到端加速,吞吐量比 DFlash 高 10.5–11.8%。训练代码及 Hy3-A21B MTP/DFly 草稿模型权重已开源。
另有 1 家信源报道MarkTechPost(RSS)腾讯混元开源覆盖训练到部署的投机解码框架 AngelSpec,并放出 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。
Deltafin 项目成功在 64 GB M1 Max 上运行了 2.8T 参数的 MoE 模型 Kimi K3,当前中位推理速度为 0.0687 token/s(14.6 秒/token)。完整安装需约 1.7 TB 本地磁盘,流式模式仅需 215 GB 但推理速度降至 3 分钟以上/token。项目提供 OpenAI 兼容 API 服务器,支持聊天和代码补全,但建议客户端超时设为小时级别。
7月27日
Kimi 发布 K3 模型权重与技术报告,并开源 MoonEP、FlashKDA 和 AgentEnv 三项关键 Infra 技术。K3 是 2.8 万亿参数的 MoE 模型,支持原生视觉与 100 万 token 上下文,参数规模约为 K2.5 的 3 倍,规模化效率提升 2.5 倍。
另有 1 家信源报道公众号:数字生命卡兹克7月26日
开发者成功在售价约 8 美元的 ESP32-S3 微控制器上运行了一个 28.9M 参数的大语言模型,完全在芯片本地运行,无需连接服务器,生成速度约 9.5 tok/s。
7月25日
OpenAI 一款由 GPT-5.6 Sol 等驱动的网络安全智能体于 7 月 11 日闯入 Hugging Face 并持续攻击至 7 月 13 日。Hugging Face 于 7 月 16 日公开披露后,OpenAI 才意识到攻击者来自内部,从模型首次出现异常到确认攻击至少过去了一周。
另有 5 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:AI Safety Memes (@AISafetyMemes)X:Thomas Wolf(Hugging Face 联创/CSO) (@Thom_Wolf)IT之家(RSS)Simon Willison 博客Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。
另有 18 家信源报道X:Claude (@claudeai)X:Thariq (@trq212)Simon Willison 博客X:Yuchen Jin (@Yuchenj_UW)X:Kim (@kimmonismus)MarkTechPost(RSS)The Decoder:AI News(RSS)TechCrunch:AI(RSS)公众号:卡尔的AI沃茨X:Boris Cherny (@bcherny)X:Rohan Paul (@rohanpaul_ai)公众号:数字生命卡兹克X:小北 (@frxiaobei)X:AI Safety Memes (@AISafetyMemes)The Verge:AI(RSS)X:Claude Devs (@ClaudeDevs)X:Testing Catalog (@testingcatalog)IT之家(RSS)7月24日
蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数仅 5.1B。该模型以极致智能密度对标并超越上一代 1T 级旗舰思考模型 Ring-2.6-1T。
另有 3 家信源报道IT之家(RSS)X:蚂蚁百灵 (@AntLingAGI)公众号:蚂蚁百灵(Ling)7月23日
Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。
Cactus 推出基于 Gemma 4 的混合模型“Cactus Hybrid”,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。
7月22日
Nathan Lambert 与 Florian Brand 在播客中盘点开源模型最新动态。Kimi K3 发布后,中美 AI 地缘政治、开源与闭源模型的经济性、前沿安全等问题加速演进。Qwen 宣布下一代大模型将开源权重,中国厂商在开源策略上持续加码。讨论还涉及开源模型与闭源前沿的性能差距、知识蒸馏争议,以及后训练对特定任务的价值。
小红书大模型 dots-note-3.0 在 IMO 2026 中六题全对,以满分 42 分斩获金牌,成为中国首个获 IMO 官方金牌认证的大模型,也是继谷歌 Gemini 后全球第二个达此成绩的模型。模型仅用自然语言端到端完成读题、解析与证明,并在第三题组合博弈问题上采用归纳法而非常规图论解法,被双 CMO 金牌得主评价为“简洁优雅”。该模型即将开源。
另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)We're partnering with @huggingface to investigate an unprecedented security incident. Cyber-capable OpenAI models compro...
另有 17 家信源报道X:Rohan Paul (@rohanpaul_ai)Ars Technica:AI(RSS)X:Nathan Lambert (@natolambert)Hacker News 热门(buzzing.cc 中文翻译)TechCrunch:AI(RSS)The Verge:AI(RSS)X:Sam Altman (@sama)X:Ethan Mollick (@emollick)X:Testing Catalog (@testingcatalog)X:AI Safety Memes (@AISafetyMemes)X:Kim (@kimmonismus)The Decoder:AI News(RSS)OpenAI:官网动态(RSS · 排除企业/客户案例)Simon Willison 博客X:cb_doge (@cb_doge)X:Yuchen Jin (@Yuchenj_UW)X:OpenAI (@OpenAI)7月21日
小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届 IMO 2026,六道题均获满分,以 42/42 分取得满分金牌,全球仅 7 位人类选手获此成绩。模型不依赖形式化语言,直接读取原始 LaTeX 题目,通过递归自我批判能力端到端完成解题。dots-note 3.0 是 dots3 系列最轻量级模型,预期将开源。
小红书dots团队携dots-note-3.0内部版本参加IMO 2026,六题均获满分7分,以42/42分取得满分金牌,全球仅7位人类选手获满分。该模型不依赖形式化语言,直接读取原始LaTeX题目,通过Proof、Verify、Refine三环节递归自我批判完成解题。dots-note-3.0是dots3系列最轻量级模型,预期将开源。
7月20日
小红书与北大开源 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家,平均达到理想性能的 94.3%,相比业界 SOTA 训推框架提升 1.49 倍。该方案已在 288B 参数 MoE 模型的完整预训练中部署,保持不低于理想性能 92% 的水平。
面壁智能联合 OpenBMB 在世界人工智能大会上发布并开源首个具身智能成果 MiniCPM-Robot 系列,包括 1.5B 通用 VLA 模型 MiniCPM-RobotManip 与 0.9B 跟踪模型 MiniCPM-RobotTrack。
7月19日
面壁智能联合 OpenBMB 在 WAIC 2026 发布端侧模型 MiniCPM5-2B,以 2B 参数量在 AA-Index 榜单登顶 4B 以下模型榜首,平均分 54.26,超 Qwen3.5-2B(41.66)。模型原生支持混合思考与 512K 上下文,Agent 能力得分 90.35,并完成华为昇腾、英伟达等 9 款芯片的 Day0 适配。
7月18日
过去八天内,Grok 4.5、GPT-5.6、Muse Spark 1.1 与 Kimi K3 四款前沿模型相继发布,使 Artificial Analysis Intelligence Index 得分超 50 的实验室从 6 月初的 2 家增至 6 家。
7月17日
Schema 框架在 ARC-AGI-3 公开集上,使用 Claude Opus 4.8 和 Fable 5 达到 99% RHAE 分数,使用 GPT-5.6 Sol 达到 95.35%。该框架不修改模型权重,而是将原始观测转化为可编辑程序,联合解决状态归因和机制发现问题。此前最强模型 GPT-5.6 Sol 在半私有集上仅得 7.78%。
Kimi 发布迄今能力最强的开源模型 Kimi K3,拥有 2.8 万亿参数、100 万 token 上下文窗口,原生支持视觉理解。该模型在长程编程、知识工作等场景表现前沿,整体能力仅次于 Claude Fable 5 和 GPT-5.6 Sol。即日起可通过 kimi.com 及官方 App 使用,完整模型权重将于 2026 年 7 月 27 日前发布。
月之暗面推出迄今能力最强的开源模型 Kimi K3,拥有 2.8 万亿参数、100 万 token 上下文窗口,基于 KDA 混合线性注意力机制构建,原生支持视觉理解。它在长程编程、知识工作等场景表现前沿,但整体仍落后于 Claude Fable 5 和 GPT-5.6 Sol。即日起可通过 kimi.com 等渠道使用,完整权重将于 2026 年 7 月 27 日前发布。