Topic · 主题全部主题 →

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

3,397条收录
486条精选
● 持续更新
近期焦点近 14 天 · 按多源报道热度

8月17日

星期一 · 1 条
07:01
Simon Willison 博客精选
AI 评分 73/100
Qwen 3.8 27B 表现出色,但默认推理强度过高导致过度思考

阿里 Qwen 实验室发布 Apache 2 许可的 27B 参数视觉大模型 Qwen 3.8 27B,官方基准显示其超越前代 Qwen 3.6 27B 及闭源 Qwen 3.7-Plus。

另有 5 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)X:通义千问 / Qwen (@Alibaba_Qwen)
推荐理由:把 Qwen 3.8 27B 的推理档位成本量化成时间差异,xhigh 默认让生成同一 SVG 从 137 秒膨胀到 21 分钟,这个默认值比能力更影响本地选型。

8月15日

星期六 · 1 条
02:22
Google Gemini@GeminiApp精选
AI 评分 66/100
Gemini 3.7 Flash 现已向 Gemini 聊天中的 Pro 和 Ultra 用户开放。该模型更新提升了多步骤任务的推理与准确性,如智能整合数十个文件和邮件为一份主文档。同时,Gemini Spark 也已运行于 3.7 Flash,通过改进对 Google Workspace 应用的工具调用,让个人 AI 智能体更精准。

Google Gemini: Gemini Spark 现已运行于 Gemini 3.7 Flash。⚡️ 无论你是用 Spark 将供应商信息整理到 Sheets 中,还是起草谈判邮件,3.7 Flash 都能让你的个人 AI 智能体更加精准可靠,并通过对 @Goog...

另有 16 家信源报道X:Logan Kilpatrick (@OfficialLoganK)IT之家(RSS)X:Rohan Paul (@rohanpaul_ai)Ars Technica:AI(RSS)MarkTechPost(RSS)The Decoder:AI News(RSS)X:Artificial Analysis (@ArtificialAnlys)X:fofr (@fofrAI)Google DeepMind:Blog(RSS)X:Ammaar Reshi (@ammaar)X:Demis Hassabis (@demishassabis)X:Google AI for Developers (@googleaidevs)X:Google AI (@GoogleAI)X:Google DeepMind (@GoogleDeepMind)X:Sundar Pichai (@sundarpichai)X:Elvis Saravia (@omarsar0, DAIR.AI)
推荐理由:Gemini 3.7 Flash 把多步推理与跨文件整合能力下放到轻量模型,对经常需要合并数十份文件或邮件的用户来说,是一个成本更低的处理选项。

8月14日

星期五 · 3 条
19:31
公众号:小红书技术(dots.llm)精选
AI 评分 79/100
dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。

另有 1 家信源报道X:Kim (@kimmonismus)
推荐理由:除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。
13:22
SiliconFlow@SiliconFlowAI精选
AI 评分 65/100
DeepSeek V4 Pro 登陆硅基流动,1M 上下文

DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景。

另有 7 家信源报道X:DeepSeek (@deepseek_ai)X:SemiAnalysis (@SemiAnalysis_)公众号:DeepSeek(深度求索)Simon Willison 博客IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Testing Catalog (@testingcatalog)
推荐理由:每百万缓存命中 0.44 美元与 1M 上下文组合,使 Agent 工作流在长上下文成本测算上有了更具体参照。
02:19
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 80/100
GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能

GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。


推荐理由:最实际的改变在 API 原语,让同一模型在 ARC-AGI-3 上用约六分之一输出 token 拿到近三倍分数,影响开发者对推理成本和上下文架构的判断。

8月13日

星期四 · 2 条
01:57
Google Research:Blog(网页)精选
AI 评分 66/100
空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈

Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于“丢钥匙”而非“空货架”。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。


推荐理由:知识画像把事实错误拆成编码失败与召回失败,显示前沿模型问题主要在已存知识不稳定调用,思考更多恢复已编码事实而非补全缺失,为优化侧重提供判断依据。
00:46

8月12日

星期三 · 4 条
01:47
The Decoder:AI News(RSS)精选
AI 评分 80/100
研究人员发现可读取ChatGPT等模型加密推理过程的API漏洞

Alexander Panfilov团队发现OpenAI、Anthropic、Google等主要AI提供商API存在漏洞,可读取推理模型的加密思考过程。扫描约7000条公开会话发现62个API密钥、33个邮箱和33个密码。通过越狱,Anthropic的Haiku 4.5可逐字转写Opus 4.8的原始推理;解码10000条推理轨迹的API成本约720美元。

另有 3 家信源报道X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)Simon Willison 博客
推荐理由:不是另一个理论漏洞,而是真实可复现的推理链提取,它直接揭示了模型在「想什么」与「说什么」之间的断裂,让密码泄露和欺骗意图从暗箱走向可审计的证据。
01:17
Google Blog:AI(RSS)精选
AI 评分 69/100
AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力

Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。


推荐理由:AMIE 在视频中融合视觉与听觉线索进行诊断,展示了多模态临床推理的可行性,对远程医疗产品方向有参考价值。
01:15
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 73/100
Apple Silicon 与 macOS 虚拟机:借助 Llama.cpp 实现 11-16 倍的 LLM 推理加速

研究团队为 macOS 虚拟机中的 Metal 能力查询构建进程级兼容层,使 llama.cpp 能选用更新的 Metal 内核。在 M1 Ultra 上,TinyLlama 1.1B 的提示处理速度提升 11.08 倍、token 生成提升 16.36 倍,接近裸机性能的 98%;Gemma 4 12B 的提示处理与生成速度分别提升 7.20 倍和 14.54 倍。


推荐理由:通过进程级 Metal 能力注入,macOS 虚拟机中 llm 推理速度提升一个数量级,为在隔离环境运行大模型提供了此前缺失的算力基础。
01:06
Dwarkesh Patel:Podcast & Blog(RSS)精选
AI 评分 60/100
Ryan Greenblatt:人类级AI或于2032年前通过递归自我改进催生失控超级智能

Dwarkesh Patel与Redwood Research首席科学家Ryan Greenblatt探讨递归自我改进(RSI)的可能性:一旦AI达到人类顶级专家水平,可能在一年内实现相当于4-5年的AI进展,Ryan的中位预期是2031年自动化AI研发。双方还讨论了超级智能的对齐对象、奖励黑客行为是否会升级为AI联手接管世界等风险。


推荐理由:将递归自我改进的论证拆解为三个命题,并在此基础上推演奖励黑客如何演变为全面接管,为评估 AI 安全紧迫性提供了更具体的思维框架。

8月11日

星期二 · 7 条
21:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 72/100
统一 Radix 缓存:为混合模型前缀缓存构建单一树结构

LMSYS 团队提出 Unified Radix Cache,用单一 token 键控 radix 拓扑统一管理混合模型的 FULL、SWA 和 MAMBA 组件缓存,各组件独立执行路径、滑动窗口和检查点复用语义。


推荐理由:传统做法需为每种注意力组合实现独立缓存,本文以统一基树和组件钩子将复用规则解耦,SWE-bench上TTFT降低最高16.6%。
21:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 74/100
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning

SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。


推荐理由:Nemotron 3.5 Lightning以3B活跃参数提供前沿agent能力,SGLang的即刻支持让开发者能用单命令启动高性能推理,将agent部署成本大幅压缩。
21:13
NVIDIA Blog(RSS)精选
AI 评分 76/100
NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务

NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的开源 30B 混合专家(MoE)模型,专为常驻智能体设计。相比同类开源模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户微调以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行。

另有 8 家信源报道MarkTechPost(RSS)X:阿易 AI Notes (@AYi_AInotes)X:洪明 (@hongming731)The Decoder:AI News(RSS)X:Testing Catalog (@testingcatalog)X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)NVIDIA Blog(RSS)
推荐理由:本地运行 30B MoE 模型并声称 4 倍加速,与开源路由器结合可自动分配任务到最合适模型,给控制推理成本提供了新路径。
19:15
The Verge:AI(RSS)精选
AI 评分 75/100
OpenAI 用 Astra 模型攻克 10 道数学难题,数学家既兴奋又担忧

OpenAI 宣布其未发布的 Astra 模型解决了 10 道长期悬而未决的数学难题,涵盖球体堆积、纠错码、非 sofic 群存在性等领域,并发布超 250 页论文及 Lean 验证结果。


推荐理由:这篇报道将10个数学问题的AI解法置于数学界的就业恐慌、商业侵蚀和归属争议之中,展示了技术突破如何引发学术生态的连锁反应。
17:21
公众号:蚂蚁百灵(Ling)精选
AI 评分 72/100
Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务

蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。

另有 2 家信源报道X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)
推荐理由:以1.3B激活参数取得接近4B激活模型的综合能力,同时Agent分数超越部分30B+模型,多精度开源和本地部署方案让轻量Agent应用更易落地。
15:58
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 81/100
窃取专有 LLM API 的推理轨迹:加密块可跨会话互换引发解密越狱

研究发现,Anthropic、OpenAI 和 Google 等专有 LLM 的加密推理轨迹块可跨会话、用户和模型互换,攻击者将其注入同提供商防护较弱的模型,即可强制其以明文输出推理内容。

另有 1 家信源报道Simon Willison 博客
推荐理由:加密推理块跨模型可互换,从公开仓库抓取的31万推理块中即恢复367份PII和182个凭证,补丁发布前公开共享数据的风险需要重估。
01:46
Anthropic:Research(发表成果 · 网页)精选
AI 评分 57/100
Claude 未发布研究版将黎曼 zeta 函数零点下界从 41.6% 提升至 67.2%

Anthropic 员工让 Claude 尝试攻克黎曼猜想,虽未成功,但一个未发布的研究版 Claude 在相关问题上取得突破:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。

另有 7 家信源报道X:Deedy Das (@deedydas)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)TechCrunch:AI(RSS)X:Anthropic (@AnthropicAI)X:Kim (@kimmonismus)
推荐理由:Claude 的结果并未直接冲击黎曼猜想,但它组合现有技术将零点比例下界提升超过 25 个百分点,为数学研究提供了一种 AI 辅助探索的可行路径。

8月10日

星期一 · 1 条
23:44
OpenRouter:Announcements(RSS)精选
AI 评分 77/100
OpenRouter 推出由市场智慧驱动的新版 Auto 路由器

OpenRouter 基于每周超 55T token 的社区消费数据,推出新版 Auto 路由器(openrouter/auto),其模型选择在多数任务和成本档位上优于旧版。新路由器按约 30 种任务类型匹配近 7 天社区实际消费的模型,支持 cost_tier 参数(low 至 max)并遵循账户隐私设置。在 MMLU Pro 等基准上,新默认档位在多数领域以更低成本达到旧版同等性能。

另有 1 家信源报道X:OpenRouter (@OpenRouter)
推荐理由:基于平台每周55T token的社区支出分布,新路由将模型选择众包化,基准显示默认档成本下降超60%且多数任务性能不减,适合调用量大的应用。

8月8日

星期六 · 1 条
01:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 76/100
HPC-Ops × SGLang:腾讯混元开源高性能 Attention、Router GEMM 与 MoE 算子

腾讯混元开源算子库 HPC-Ops 已集成至 SGLang 主分支,其 Dynamic Attention 与 Fused MoE 在 Hy3 模型上最高降低 TPOT 48.8%。


推荐理由:HPC-Ops 集成到 SGLang,带来生产验证的负载均衡 Attention 和精度感知 Router GEMM,实测 Hy3 TPOT 降幅最高 48.8%,为 MoE 低延迟服务提供了可直接使用的开源优化。

8月7日

星期五 · 2 条
10:11
公众号:千问APP(阿里)精选
AI 评分 67/100
千问功能上新:推出思考研究、定时任务、办公助理、语音通话等多项新功能,并支持 Qwen3.8-MAX

千问今日上线多项新功能,并支持最新旗舰模型 Qwen3.8-MAX。其中“思考研究”在原“深度思考”基础上升级,强化复杂推理与工具调用;“定时任务”可预设执行时间自动完成行业简报梳理等周期工作;“办公助理”能连接备忘录、日历等应用并操作电脑浏览器,直接输出可用的 Office 文档。语音通话支持 7x24 小时多场景,智能体广场首批覆盖物流、房产等十多个领域。

另有 1 家信源报道IT之家(RSS)
推荐理由:办公助理将大模型从问答扩展到任务执行,多步操作与跨端协同可能改变繁琐的数据汇总与文档生成流程。
07:40
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
OpenAI 优化 ChatGPT 中的 GPT-5.6 Sol,并扩大免费用户对 GPT-5.6 Luna 的访问权限

OpenAI 更新 ChatGPT:Plus 和 Pro 用户的 GPT-5.6 Sol 在事实准确性和回答聚焦度上有所提升,新增滑块可控制模型思考投入。免费用户默认模型升级为 GPT-5.6 Luna,并开放无限文本聊天,新增 Think 按钮以处理更复杂问题。

另有 10 家信源报道X:Greg Brockman (@gdb)TechCrunch:AI(RSS)X:OpenAI (@OpenAI)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)OpenAI:官网动态(RSS · 排除企业/客户案例)The Verge:AI(RSS)X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)
推荐理由:事实错误减少68%让这次更新更像信息质量提升而非体验优化,对依赖事实核查的场景有实际价值。

8月6日

星期四 · 1 条
00:39
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
为什么传奇的埃尔德什问题正被人工智能攻克

OpenAI 于 2026 年 5 月 20 日宣布,其内部 AI 模型对埃尔德什 1946 年提出的“单位距离”问题给出了反例,成为首个由 AI 模型完成的历史性重要证明;8 月 1 日又宣布未发布模型 Astra 取得 10 项数学进展,其中解决了埃尔德什提出的另外 3 个问题。


推荐理由:文章以 Bloom 网站为线索,揭示了 AI 解决 Erdős 问题背后业余爱好者与数学家协作模式的变化,这比单个证明更说明 AI 如何重新分配数学研究中的参与者角色。

8月5日

星期三 · 2 条
13:55
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
Video-DeepResearch:迈向下一代多模态深度研究智能体

Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。


推荐理由:将深度研究从静态图像扩展到视频流,通过强制视觉定位再检索的两阶段训练,让模型摆脱了对文本搜索的路径依赖,给视频智能体研发提供了可验证的训练范式。
01:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 72/100
SpecForge v0.3.0 发布:统一解耦与共置投机解码栈,新增开放 SpecBundle 草稿模型

SpecForge v0.3.0 将目标模型推理与草稿模型训练分离,支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并统一在线、离线与解耦工作流。


推荐理由:将目标模型推理与草稿模型训练分离,让两种工作负载可独立扩缩,改变了投机解码训练中资源配比必须硬编码的旧模式,资源规划可按模型和序列长度灵活调整。

8月4日

星期二 · 3 条
23:12
NVIDIA Blog(RSS)精选
AI 评分 68/100
NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型

NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。

另有 2 家信源报道X:Jensen Huang (@JensenHuang)IT之家(RSS)
推荐理由:开放商业许可与可解释推理输出结合,自动驾驶团队能直接审查模型决策链,为安全验证提供透明度,降低从研发到商用部署的转换成本。
23:04
公众号:蚂蚁百灵(Ling)精选
AI 评分 75/100
蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署

蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。

另有 3 家信源报道X:Artificial Analysis (@ArtificialAnlys)X:蚂蚁百灵 (@AntLingAGI)IT之家(RSS)
推荐理由:提供FP4/INT4量化版本并验证单机推理,让数据敏感、预算有限的团队也能本地运行千亿参数模型,将大模型能力从云端拉回到可控环境。
15:03
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 81/100
Swiftlet:在 Mac 上运行 80B 版 Qwen(内存 4.3 GB),在 iPhone 上运行 35B 版

Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。


推荐理由:用流式专家加载把 80B 模型塞进手机,具体 RAM 和速度数字让开发者能直接判断自己设备的上限,而不是停留在商详口号。

8月3日

星期一 · 1 条
05:52
Gary Marcus:The Road to AI We Can Trust(RSS)精选
AI 评分 66/100
OpenAI 新模型 Astra 数学表现出色,但被过度吹捧

OpenAI 内部测试的新模型 Astra 在数学问题上表现惊艳,但 Gary Marcus 指出相关讨论犯了“合成谬误”:擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。数学之所以成为突破口,是因为它便于用符号工具验证且能廉价生成海量合成数据,而开放世界问题无法如此模拟。此外,OpenAI 未公布方法细节,尚无法评估其真实意义。


推荐理由:从合成谬误切入,剖开 Astra 舆论热潮的底层逻辑,并指出数学成功依赖于可验证性与海量合成数据,而多数真实问题没有这种特权,提醒对通用性期待需克制。

8月1日

星期六 · 1 条
16:00
Greg Brockman@gdb精选
AI 评分 70/100
OpenAI 用下一代模型 Astra 内部版解决了数学与理论计算机科学领域的10项重大进展,总成本约2000美元(按 Sol API 价格计算)。Astra 证明了非 sofic 群的存在,并推翻 Connes 刚性猜想,成果涵盖 von Neumann 代数、高维球堆积、电路复杂度等。OpenAI 已发布全部10项证明,附 Lean 证书与 CoT 逐步推导。

Sebastien Bubeck: 是的,非软性群确实存在:这一论断是 Astra(我们的下一代重大模型)证明的众多全新优美成果之一。 我们将发布 10 个此类 Astra 证明,每个都附带完整的 Lean 证书和链式推理(CoT)逐步讲解。这些成果涵盖范围广泛,从冯·诺依曼...

另有 11 家信源报道X:Ethan Mollick (@emollick)X:Elvis Saravia (@omarsar0, DAIR.AI)X:阿易 AI Notes (@AYi_AInotes)X:马东锡 NLP (@dongxi_nlp)X:Tibo (@thsottiaux)X:Noam Brown (@polynoamial)X:Rohan Paul (@rohanpaul_ai)X:Kim (@kimmonismus)The Decoder:AI News(RSS)IT之家(RSS)X:Karina Nguyen(@karinanguyen)
推荐理由:OpenAI用内部Astra模型证明了10个重要数学猜想,成本才2000美元,这比论文本身更值得关注,理论领域可能从纯人力变成AI驱动的研究范式。

7月31日

星期五 · 3 条
12:10
公众号:腾讯混元精选
AI 评分 89/100
腾讯混元 Hyra 攻克加法组合学 50 年未解难题

腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。


推荐理由:构造不再依赖暴力搜索,而是从数学结构入手自主推理,同时给出可形式化证明,让AI在定理型科学问题上从辅助工具转向共同研究者。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 80/100
DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型

DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。


推荐理由:扩散生成首次在文本领域将吞吐推高至约1500 token/s,此前这类速度仅见于非文本生成架构,为实时交互和批量生成场景提供了新的可行上限。
01:27
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 66/100
GPT-5.6 如何推进性价比前沿

OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流。

另有 13 家信源报道X:Kim (@kimmonismus)X:OpenAI Developers (@OpenAIDevs)X:Tibo (@thsottiaux)X:Nathan Lambert (@natolambert)X:Sam Altman (@sama)The Decoder:AI News(RSS)X:Artificial Analysis (@ArtificialAnlys)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)Simon Willison 博客IT之家(RSS)
推荐理由:GPT-5.6 的价格调整不只是数字游戏,而是 OpenAI 用更高效的模型把推理成本往下压了一大截,企业部署的门槛又低了一个量级。

7月30日

星期四 · 4 条
10:56
Tencent Hy@TencentHunyuan精选
AI 评分 74/100
腾讯混元Hyra破解50年数学难题

腾讯混元借助研究智能体Hyra及Hy3模型,构造出整数集A使|A+A|与|A-A|的指数比精确达到2,解决了自1969年以来悬而未决的极值问题。此前50余年最佳构造仅略超1.1,新成果证明最优指数即为2。论文及形式化证明已公开。

另有 1 家信源报道IT之家(RSS)
推荐理由:我认为,这是AI首次真正解决一个悬而未决50年的纯数学问题,虽然定理本身小众,但它证明了AI在定理发现上的潜力,值得数学和AI交叉领域的人认真读。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 75/100
大语言模型的显著性偏差:常识推理中的知识压制而非缺失

研究提出“显著性偏差”概念,指大语言模型被输入中无用的显性干扰(如数字)劫持,忽略任务隐含的常识前提。基于新构建的 SaliTrap 基准评估 12 个主流模型,最佳模型仅 54.8% 查询避开陷阱,8/12 模型低于 30%;GLM-5.1 和 Kimi-K2 在识别陷阱后仍分别有 86.2% 和 81.8% 的遵从率。


推荐理由:这篇论文证明 LLM 常识推理失败源于知识被显性干扰项抑制而非缺失,剥离任务框架后超九成服从性案例可恢复,提示瓶颈在引导方式而非模型能力。
07:11
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 68/100
启用两项 API 设置使 GPT-5.6 在 ARC-AGI-3 基准测试得分提升三倍

OpenAI 通过启用两项 API 设置,使 GPT-5.6 在 ARC-AGI-3 基准测试上的得分提升至原来的三倍。这两项设置分别是保留推理过程(retaining reasoning)和启用压缩(compaction),在提升得分的同时也提高了效率。该发现基于 OpenAI 官方对 GPT-5.6 模型 API 参数的测试结果。


推荐理由:OpenAI 自己公布两个设置让 GPT-5.6 的 ARC-AGI-3 成绩翻三倍,对用 API 做推理任务的人是即用的技巧,不过目前只给了摘要,具体参数得等全文。
03:56
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 70/100
GPT-5.6 如何融合前沿智能与效率

OpenAI 推出 GPT-5.6 模型家族,旗舰版 GPT-5.6 Sol 在开启最大推理时以不到一半的成本超越 Claude Fable 5 的 Artificial Analysis Coding Agent Index 得分。


推荐理由:GPT‑5.6 不光是新模型,它自己参与了推理栈优化,20% 成本降幅是实打实的工程突破,做 AI 应用的该重新算一下每次调用的成本了。

7月29日

星期三 · 3 条
20:56
Tencent Hy@TencentHunyuan精选
AI 评分 74/100
腾讯混元开源 AngelSpec 投机解码框架

腾讯混元开源端到端投机解码框架 AngelSpec,支持训练与部署。在 Hy3-A21B 模型上,其 DFly 方案相比自回归解码实现 1.98–2.40 倍端到端加速,吞吐量比 DFlash 高 10.5–11.8%。训练代码及 Hy3-A21B MTP/DFly 草稿模型权重已开源。

另有 1 家信源报道MarkTechPost(RSS)
推荐理由:做推理加速的可以试试这个端到端推测解码框架,腾讯开源了完整代码和权重,在 Hy3 上提速近 2.4 倍且吞吐更高,拿来即用。
19:52
10:56
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 76/100
在 M1 Max 上运行 2.8T 参数的 Kimi K3:Deltafin 项目实现 0.0687 token/s 推理

Deltafin 项目成功在 64 GB M1 Max 上运行了 2.8T 参数的 MoE 模型 Kimi K3,当前中位推理速度为 0.0687 token/s(14.6 秒/token)。完整安装需约 1.7 TB 本地磁盘,流式模式仅需 215 GB 但推理速度降至 3 分钟以上/token。项目提供 OpenAI 兼容 API 服务器,支持聊天和代码补全,但建议客户端超时设为小时级别。


推荐理由:这是个在 M1 Max 上跑 2.8T MoE 的工程 hack,把不可能变成可能,虽然慢得只有聊天室节奏,但玩法足够硬核,玩硬件的看完会想开 issue 贡献数据。