内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态一手 · 467 条
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「推理」清除

8月15日周六

12:01公众号:百度智能云(文心)46百度千帆 Token Plan 权益升级:夜间调用 2 折,DeepSeek-V4-Flash-0731 上线

8月14日周五

19:31公众号:小红书技术(dots.llm)79精选dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理
03:34Databricks:Blog(RSS)42Unity AI Gateway 智能路由:以 30%+ 更低单任务成本匹配前沿模型质量
02:45Cerebras:Blog(网页)14OpenAI's GPT-5.6-Sol-Ultrafast: The World's Fastest Frontier Model. Learn more >>
02:19OpenAI:官网动态(RSS · 排除企业/客户案例)80精选GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能

8月13日周四

19:20公众号:DeepSeek(深度求索)73同事件DeepSeek-V4-Pro 正式版上线同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》
01:57Google Research:Blog(网页)66精选空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈

8月12日周三

01:17Google Blog:AI(RSS)69精选AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力
01:06Dwarkesh Patel:Podcast & Blog(RSS)60精选Ryan Greenblatt:人类级AI或于2032年前通过递归自我改进催生失控超级智能

8月11日周二

23:56Google Developers Blog(RSS)38在 Raspberry Pi 上用 LiteRT 和 Gemma 掌握边缘 AI
21:51LMSYS:Blog(Chatbot Arena 团队)72精选统一 Radix 缓存:为混合模型前缀缓存构建单一树结构
21:51LMSYS:Blog(Chatbot Arena 团队)74精选SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning
21:13NVIDIA Blog(RSS)76精选NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务
17:21公众号:蚂蚁百灵(Ling)72精选Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务
01:46Anthropic:Research(发表成果 · 网页)57精选Claude 未发布研究版将黎曼 zeta 函数零点下界从 41.6% 提升至 67.2%

8月10日周一

23:44OpenRouter:Announcements(RSS)77精选OpenRouter 推出由市场智慧驱动的新版 Auto 路由器

8月8日周六

06:53Apple Machine Learning Research(RSS)51Arbitrage:利用优势感知投机实现高效推理
01:53Gary Marcus:The Road to AI We Can Trust(RSS)38CPU 与神经符号 AI 的崛起
01:51LMSYS:Blog(Chatbot Arena 团队)76精选HPC-Ops × SGLang:腾讯混元开源高性能 Attention、Router GEMM 与 MoE 算子

8月7日周五

20:31公众号:蚂蚁百灵(Ling)75精选蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署
10:11公众号:千问APP(阿里)67精选千问功能上新:推出思考研究、定时任务、办公助理、语音通话等多项新功能,并支持 Qwen3.8-MAX
08:53Apple Machine Learning Research(RSS)40DeepAmbigQA:用于评测 LLM 答案完整性的歧义多跳问答基准

8月6日周四

23:21Cursor Blog58Cursor Router 如何为任务选择合适模型
22:31Databricks:Blog(RSS)46Databricks 发布 OfficeQA Pro V2:面向企业落地推理的新基准

8月5日周三

18:00公众号:小红书技术(dots.llm)46小红书"问一问"多模态推理加速实践:让视觉 Token 更精简、MoE 专家更聚焦
01:51LMSYS:Blog(Chatbot Arena 团队)72精选SpecForge v0.3.0 发布:统一解耦与共置投机解码栈,新增开放 SpecBundle 草稿模型

8月4日周二

23:12NVIDIA Blog(RSS)68精选NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型
02:04Dwarkesh Patel:Podcast & Blog(RSS)54为什么更智能的AI模型可能推高算力价格10倍
00:52Gary Marcus:The Road to AI We Can Trust(RSS)59关于 Astra 与数学的两则重要更新:Anthropic 数学家 24 小时复现 OpenAI 半数结果

8月3日周一

05:52Gary Marcus:The Road to AI We Can Trust(RSS)66精选OpenAI 新模型 Astra 数学表现出色,但被过度吹捧

7月31日周五

12:10公众号:腾讯混元89精选腾讯混元 Hyra 攻克加法组合学 50 年未解难题
01:27OpenAI:官网动态(RSS · 排除企业/客户案例)66精选GPT-5.6 如何推进性价比前沿

7月30日周四

07:55BAIR:Berkeley AI Research Blog57K-Search 将 CUDA 内核优化经验迁移至 Apple Silicon MLX,性能接近专家水平
07:11OpenAI:官网动态(RSS · 排除企业/客户案例)68精选启用两项 API 设置使 GPT-5.6 在 ARC-AGI-3 基准测试得分提升三倍
03:56OpenAI:官网动态(RSS · 排除企业/客户案例)70精选GPT-5.6 如何融合前沿智能与效率

7月29日周三

19:52公众号:腾讯混元72精选腾讯混元开源 AngelSpec:投机解码推理加速最高 2.4 倍

7月28日周二

01:50LMSYS:Blog(Chatbot Arena 团队)72同事件SGLang 和 Miles 为月之暗面 2.8T 参数 Kimi K3 模型提供发布当日支持同一事件,精选展示《Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放》
00:36Microsoft AI:官方博客(网页)0What is AI anyway?
00:00LMSYS:Blog(Chatbot Arena 团队)46SGLang 提出量化栈重构方案,拆分检查点解析与内核执行

7月27日周一

23:35公众号:月之暗面(Kimi)81精选Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放
已加载 40 条
全部 AI 动态
2026年8月17日星期一 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
一手信源 · 标签「推理」 · 467 条清除

8月15日

星期六 · 1 条
12:01
公众号:百度智能云(文心)
AI 评分 46/100
百度千帆 Token Plan 权益升级:夜间调用 2 折,DeepSeek-V4-Flash-0731 上线

8月14日起,百度千帆 Token Plan 个人版与企业版推出「夜享Tokens加赠计划」,每日21:00至次日08:00调用 GLM-5.2、DeepSeek-V4-Flash-0731 等模型按2折计费,约节省80%成本,订阅即享。

智能体DeepSeek产品更新推理

8月14日

星期五 · 4 条
19:31
公众号:小红书技术(dots.llm)精选
AI 评分 79/100
dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。

智能体Hugging Face多模态开源生态
另有 1 家信源报道X:Kim (@kimmonismus)
推荐理由:除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。
03:34
Databricks:Blog(RSS)
AI 评分 42/100
Unity AI Gateway 智能路由:以 30%+ 更低单任务成本匹配前沿模型质量

Databricks 在 Unity AI Gateway 中推出智能路由功能,可在编码任务中自动匹配模型与执行框架,以 30% 以上的单任务成本降幅实现前沿模型质量。该功能面向 2026 年日益多样化的模型与工具生态,帮助用户在不牺牲性能的前提下优化推理开支。

产品更新推理部署/工程
02:45
Cerebras:Blog(网页)
AI 评分 14/100
OpenAI's GPT-5.6-Sol-Ultrafast: The World's Fastest Frontier Model. Learn more >>
OpenAI推理行业动态
02:19
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 80/100
GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能

GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。

智能体MCP/工具OpenAI推理

推荐理由:最实际的改变在 API 原语,让同一模型在 ARC-AGI-3 上用约六分之一输出 token 拿到近三倍分数,影响开发者对推理成本和上下文架构的判断。

8月13日

星期四 · 2 条
19:20
公众号:DeepSeek(深度求索)同事件
AI 评分 73/100
DeepSeek-V4-Pro 正式版上线

DeepSeek 发布 V4 Pro 正式版,已同步在 APP、网页端和 API 更新上线,用户可在 APP 或网页端选择“专家模式”使用。正式版增强 Agent 能力,API 原生支持 OpenAI Responses API 格式并适配 Codex。

智能体DeepSeek推理模型发布
同一事件,精选展示《DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强》
01:57
Google Research:Blog(网页)精选
AI 评分 66/100
空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈

Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于“丢钥匙”而非“空货架”。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。

Google推理论文/研究

推荐理由:知识画像把事实错误拆成编码失败与召回失败,显示前沿模型问题主要在已存知识不稳定调用,思考更多恢复已编码事实而非补全缺失,为优化侧重提供判断依据。

8月12日

星期三 · 2 条
01:17
Google Blog:AI(RSS)精选
AI 评分 69/100
AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力

Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。

Google多模态推理论文/研究

推荐理由:AMIE 在视频中融合视觉与听觉线索进行诊断,展示了多模态临床推理的可行性,对远程医疗产品方向有参考价值。
01:06
Dwarkesh Patel:Podcast & Blog(RSS)精选
AI 评分 60/100
Ryan Greenblatt:人类级AI或于2032年前通过递归自我改进催生失控超级智能

Dwarkesh Patel与Redwood Research首席科学家Ryan Greenblatt探讨递归自我改进(RSI)的可能性:一旦AI达到人类顶级专家水平,可能在一年内实现相当于4-5年的AI进展,Ryan的中位预期是2031年自动化AI研发。双方还讨论了超级智能的对齐对象、奖励黑客行为是否会升级为AI联手接管世界等风险。

AnthropicOpenAI大佬观点安全/对齐

推荐理由:将递归自我改进的论证拆解为三个命题,并在此基础上推演奖励黑客如何演变为全面接管,为评估 AI 安全紧迫性提供了更具体的思维框架。

8月11日

星期二 · 6 条
23:56
Google Developers Blog(RSS)
AI 评分 38/100
在 Raspberry Pi 上用 LiteRT 和 Gemma 掌握边缘 AI

LiteRT 与轻量级 Gemma 开源模型简化了在 Raspberry Pi 上部署安全、实时的边缘 AI。LiteRT 优化 CPU 和 GPU 性能,为 Gemma4 等模型提供快速 token 速度,支持机器人实时本地推理。开发者可通过轻量级 LiteRT CLI 工具快速转换、量化和运行模型,Hailo AI 加速器支持也即将推出。

Google产品更新推理端侧
21:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 72/100
统一 Radix 缓存:为混合模型前缀缓存构建单一树结构

LMSYS 团队提出 Unified Radix Cache,用单一 token 键控 radix 拓扑统一管理混合模型的 FULL、SWA 和 MAMBA 组件缓存,各组件独立执行路径、滑动窗口和检查点复用语义。

推理论文/研究部署/工程

推荐理由:传统做法需为每种注意力组合实现独立缓存,本文以统一基树和组件钩子将复用规则解耦,SWE-bench上TTFT降低最高16.6%。
21:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 74/100
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning

SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。

智能体推理模型发布

推荐理由:Nemotron 3.5 Lightning以3B活跃参数提供前沿agent能力,SGLang的即刻支持让开发者能用单命令启动高性能推理,将agent部署成本大幅压缩。
21:13
NVIDIA Blog(RSS)精选
AI 评分 76/100
NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务

NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的开源 30B 混合专家(MoE)模型,专为常驻智能体设计。相比同类开源模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户微调以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行。

推理模型发布端侧
另有 8 家信源报道X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)X:Artificial Analysis (@ArtificialAnlys)X:阿易 AI Notes (@AYi_AInotes)X:洪明 (@hongming731)The Decoder:AI News(RSS)IT之家(RSS)NVIDIA Blog(RSS)
推荐理由:本地运行 30B MoE 模型并声称 4 倍加速,与开源路由器结合可自动分配任务到最合适模型,给控制推理成本提供了新路径。
17:21
公众号:蚂蚁百灵(Ling)精选
AI 评分 72/100
Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务

蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。

智能体开源生态推理模型发布
另有 2 家信源报道X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)
推荐理由:以1.3B激活参数取得接近4B激活模型的综合能力,同时Agent分数超越部分30B+模型,多精度开源和本地部署方案让轻量Agent应用更易落地。
01:46
Anthropic:Research(发表成果 · 网页)精选
AI 评分 57/100
Claude 未发布研究版将黎曼 zeta 函数零点下界从 41.6% 提升至 67.2%

Anthropic 员工让 Claude 尝试攻克黎曼猜想,虽未成功,但一个未发布的研究版 Claude 在相关问题上取得突破:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。

Anthropic推理论文/研究
另有 7 家信源报道X:Deedy Das (@deedydas)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Anthropic (@AnthropicAI)TechCrunch:AI(RSS)X:Kim (@kimmonismus)
推荐理由:Claude 的结果并未直接冲击黎曼猜想,但它组合现有技术将零点比例下界提升超过 25 个百分点,为数学研究提供了一种 AI 辅助探索的可行路径。

8月10日

星期一 · 1 条
23:44
OpenRouter:Announcements(RSS)精选
AI 评分 77/100
OpenRouter 推出由市场智慧驱动的新版 Auto 路由器

OpenRouter 基于每周超 55T token 的社区消费数据,推出新版 Auto 路由器(openrouter/auto),其模型选择在多数任务和成本档位上优于旧版。新路由器按约 30 种任务类型匹配近 7 天社区实际消费的模型,支持 cost_tier 参数(low 至 max)并遵循账户隐私设置。在 MMLU Pro 等基准上,新默认档位在多数领域以更低成本达到旧版同等性能。

产品更新推理编码
另有 1 家信源报道X:OpenRouter (@OpenRouter)
推荐理由:基于平台每周55T token的社区支出分布,新路由将模型选择众包化,基准显示默认档成本下降超60%且多数任务性能不减,适合调用量大的应用。

8月8日

星期六 · 3 条
06:53
Apple Machine Learning Research(RSS)
AI 评分 51/100
Arbitrage:利用优势感知投机实现高效推理

现代大语言模型通过长思维链实现强大推理能力,但推理计算成本高昂。投机解码(Speculative Decoding)用快速但不精确的草稿模型提议 token,再由更强的目标模型并行验证,以加速推理。然而,语义等价步骤中的 token 不匹配会导致不必要的拒绝,传统 token 级投机解码因此受限。

推理论文/研究部署/工程
01:53
Gary Marcus:The Road to AI We Can Trust(RSS)
AI 评分 38/100
CPU 与神经符号 AI 的崛起

纯神经网络主要依赖 GPU 进行并行矩阵运算,而经典计算多用 CPU,神经符号 AI 则通常两者兼需。2012 年至 2023 年中,商业 AI 几乎完全由 GPU 驱动,如今这一格局正在改变。

大佬观点推理
01:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 76/100
HPC-Ops × SGLang:腾讯混元开源高性能 Attention、Router GEMM 与 MoE 算子

腾讯混元开源算子库 HPC-Ops 已集成至 SGLang 主分支,其 Dynamic Attention 与 Fused MoE 在 Hy3 模型上最高降低 TPOT 48.8%。

产品更新开源生态推理

推荐理由:HPC-Ops 集成到 SGLang,带来生产验证的负载均衡 Attention 和精度感知 Router GEMM,实测 Hy3 TPOT 降幅最高 48.8%,为 MoE 低延迟服务提供了可直接使用的开源优化。

8月7日

星期五 · 3 条
20:31
公众号:蚂蚁百灵(Ling)精选
AI 评分 75/100
蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署

蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。

推理模型发布部署/工程
另有 3 家信源报道X:Artificial Analysis (@ArtificialAnlys)IT之家(RSS)X:蚂蚁百灵 (@AntLingAGI)
推荐理由:提供FP4/INT4量化版本并验证单机推理,让数据敏感、预算有限的团队也能本地运行千亿参数模型,将大模型能力从云端拉回到可控环境。
10:11
公众号:千问APP(阿里)精选
AI 评分 67/100
千问功能上新:推出思考研究、定时任务、办公助理、语音通话等多项新功能,并支持 Qwen3.8-MAX

千问今日上线多项新功能,并支持最新旗舰模型 Qwen3.8-MAX。其中“思考研究”在原“深度思考”基础上升级,强化复杂推理与工具调用;“定时任务”可预设执行时间自动完成行业简报梳理等周期工作;“办公助理”能连接备忘录、日历等应用并操作电脑浏览器,直接输出可用的 Office 文档。语音通话支持 7x24 小时多场景,智能体广场首批覆盖物流、房产等十多个领域。

智能体产品更新推理
另有 1 家信源报道IT之家(RSS)
推荐理由:办公助理将大模型从问答扩展到任务执行,多步操作与跨端协同可能改变繁琐的数据汇总与文档生成流程。
08:53
Apple Machine Learning Research(RSS)
AI 评分 40/100
DeepAmbigQA:用于评测 LLM 答案完整性的歧义多跳问答基准

苹果研究团队推出 DeepAmbigQA,一个用于评测大语言模型答案完整性的歧义多跳问答基准。该基准聚焦“同名电影《盗火线》中哪位演员获得过奥斯卡奖”这类复杂问题,要求模型同时区分同名实体并跨大量实体进行多跳推理。研究团队还发布了自动数据生成流程 DEEPAMBIGQAGEN,以构建此类评测数据。

推理论文/研究

8月6日

星期四 · 2 条
23:21
Cursor Blog
AI 评分 58/100
Cursor Router 如何为任务选择合适模型

Cursor Router 通过 Compass 复杂度预测器和基于真实开发者流量的任务分类法,为每个对话轮次匹配最合适的模型。Auto Intelligence 模式在用户满意度超过 Fable 的同时成本降低 68%,Auto Balance 模式以低于 Opus 4.8 成本 41% 实现更优表现。系统从实时流量中学习模型在不同任务类别上的表现差异,以数据驱动方式替代基准分数推断。

智能体MCP/工具产品更新推理
22:31
Databricks:Blog(RSS)
AI 评分 46/100
Databricks 发布 OfficeQA Pro V2:面向企业落地推理的新基准

Databricks 发布 OfficeQA Pro V2,一个用于评估企业落地推理能力的新基准。该基准旨在检验模型在真实办公场景中基于给定资料进行推理的准确性与可靠性,为企业级 AI 应用选型提供参考依据。

推理评测/基准

8月5日

星期三 · 2 条
18:00
公众号:小红书技术(dots.llm)
AI 评分 46/100
小红书"问一问"多模态推理加速实践:让视觉 Token 更精简、MoE 专家更聚焦

小红书针对“问一问”多图场景,从 Prefill 与 Decode 两端优化多模态推理:动态 Vision Token 压缩减少冗余视觉输入,SERE 专家重路由配合关键专家保护降低 Decode 阶段专家计算与权重搬运。

多模态推理教程/实践
01:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 72/100
SpecForge v0.3.0 发布:统一解耦与共置投机解码栈,新增开放 SpecBundle 草稿模型

SpecForge v0.3.0 将目标模型推理与草稿模型训练分离,支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并统一在线、离线与解耦工作流。

产品更新开源生态推理部署/工程

推荐理由:将目标模型推理与草稿模型训练分离,让两种工作负载可独立扩缩,改变了投机解码训练中资源配比必须硬编码的旧模式,资源规划可按模型和序列长度灵活调整。

8月4日

星期二 · 3 条
23:12
NVIDIA Blog(RSS)精选
AI 评分 68/100
NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型

NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。

具身智能开源生态推理模型发布
另有 2 家信源报道X:Jensen Huang (@JensenHuang)IT之家(RSS)
推荐理由:开放商业许可与可解释推理输出结合,自动驾驶团队能直接审查模型决策链,为安全验证提供透明度,降低从研发到商用部署的转换成本。
02:04
Dwarkesh Patel:Podcast & Blog(RSS)
AI 评分 54/100
为什么更智能的AI模型可能推高算力价格10倍

更智能的AI模型可能将算力价格推高至当前的10倍。智能提升带来的推理成本增长,将直接传导至算力市场定价。这一趋势源于模型能力与计算资源需求的正向关联,而非单一技术突破。

大佬观点推理数据/训练
00:52
Gary Marcus:The Road to AI We Can Trust(RSS)
AI 评分 59/100
关于 Astra 与数学的两则重要更新:Anthropic 数学家 24 小时复现 OpenAI 半数结果

Gary Marcus 称 OpenAI 的 Astra 可能并非其宣传的突破,Anthropic 数学家 Levent Alpöge 用已公开的 Fable 模型在 24 小时内复现了 OpenAI 半数结果,质疑其真实进展。

OpenAI大佬观点推理

8月3日

星期一 · 1 条
05:52
Gary Marcus:The Road to AI We Can Trust(RSS)精选
AI 评分 66/100
OpenAI 新模型 Astra 数学表现出色,但被过度吹捧

OpenAI 内部测试的新模型 Astra 在数学问题上表现惊艳,但 Gary Marcus 指出相关讨论犯了“合成谬误”:擅长某类数学不等于擅长所有数学、科学乃至一切认知任务。数学之所以成为突破口,是因为它便于用符号工具验证且能廉价生成海量合成数据,而开放世界问题无法如此模拟。此外,OpenAI 未公布方法细节,尚无法评估其真实意义。

OpenAI大佬观点推理

推荐理由:从合成谬误切入,剖开 Astra 舆论热潮的底层逻辑,并指出数学成功依赖于可验证性与海量合成数据,而多数真实问题没有这种特权,提醒对通用性期待需克制。

7月31日

星期五 · 2 条
12:10
公众号:腾讯混元精选
AI 评分 89/100
腾讯混元 Hyra 攻克加法组合学 50 年未解难题

腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。

开源生态推理论文/研究

推荐理由:构造不再依赖暴力搜索,而是从数学结构入手自主推理,同时给出可形式化证明,让AI在定理型科学问题上从辅助工具转向共同研究者。
01:27
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 66/100
GPT-5.6 如何推进性价比前沿

OpenAI 为 GPT-5.6 的 Luna 和 Terra 版本推出更低定价,以更高效的模型帮助企业大规模部署 AI 工作流。

OpenAI推理模型发布部署/工程
另有 13 家信源报道X:Kim (@kimmonismus)X:Nathan Lambert (@natolambert)X:OpenAI Developers (@OpenAIDevs)X:Sam Altman (@sama)The Decoder:AI News(RSS)X:Tibo (@thsottiaux)X:Artificial Analysis (@ArtificialAnlys)Hacker News 热门(buzzing.cc 中文翻译)X:Rohan Paul (@rohanpaul_ai)X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)Simon Willison 博客IT之家(RSS)
推荐理由:GPT-5.6 的价格调整不只是数字游戏,而是 OpenAI 用更高效的模型把推理成本往下压了一大截,企业部署的门槛又低了一个量级。

7月30日

星期四 · 3 条
07:55
BAIR:Berkeley AI Research Blog
AI 评分 57/100
K-Search 将 CUDA 内核优化经验迁移至 Apple Silicon MLX,性能接近专家水平

伯克利 Sky Lab 团队基于 K-Search 框架开发了 CUDA 到 MLX 的结构化翻译层,使 AI 驱动的内核搜索能自动将 NVIDIA GPU 上积累数十年的内核优化知识迁移至 Apple Silicon。

推理端侧论文/研究
07:11
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 68/100
启用两项 API 设置使 GPT-5.6 在 ARC-AGI-3 基准测试得分提升三倍

OpenAI 通过启用两项 API 设置,使 GPT-5.6 在 ARC-AGI-3 基准测试上的得分提升至原来的三倍。这两项设置分别是保留推理过程(retaining reasoning)和启用压缩(compaction),在提升得分的同时也提高了效率。该发现基于 OpenAI 官方对 GPT-5.6 模型 API 参数的测试结果。

OpenAI推理评测/基准

推荐理由:OpenAI 自己公布两个设置让 GPT-5.6 的 ARC-AGI-3 成绩翻三倍,对用 API 做推理任务的人是即用的技巧,不过目前只给了摘要,具体参数得等全文。
03:56
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 70/100
GPT-5.6 如何融合前沿智能与效率

OpenAI 推出 GPT-5.6 模型家族,旗舰版 GPT-5.6 Sol 在开启最大推理时以不到一半的成本超越 Claude Fable 5 的 Artificial Analysis Coding Agent Index 得分。

OpenAI推理教程/实践部署/工程

推荐理由:GPT‑5.6 不光是新模型,它自己参与了推理栈优化,20% 成本降幅是实打实的工程突破,做 AI 应用的该重新算一下每次调用的成本了。

7月29日

星期三 · 1 条
19:52
公众号:腾讯混元精选
AI 评分 72/100
腾讯混元开源 AngelSpec:投机解码推理加速最高 2.4 倍

腾讯混元开源覆盖训练到部署的投机解码框架 AngelSpec,并放出 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。

开源/仓库推理部署/工程

推荐理由:AngelSpec 将投机解码从训练到部署全链路开源,DFly 和 D-cut 在真实流量下带来额外加速,对需要优化推理成本的团队有直接落地价值。

7月28日

星期二 · 3 条
01:50
LMSYS:Blog(Chatbot Arena 团队)同事件
AI 评分 72/100
SGLang 和 Miles 为月之暗面 2.8T 参数 Kimi K3 模型提供发布当日支持

SGLang 和 Miles 为月之暗面开源的 2.8T 参数模型 Kimi K3 提供发布当日支持,分别负责推理和 RL 训练。K3 采用 69 层 KDA 线性注意力与 24 层 MLA 交错的混合架构,在 SGLang 上单卡 batch-1 解码速度达约 113 tok/s,结合 DSpark 推测解码可达约 423 tok/s。

开源/仓库推理部署/工程
同一事件,精选展示《Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放》
00:36
Microsoft AI:官方博客(网页)
AI 评分 0/100
What is AI anyway?
推理教程/实践
00:00
LMSYS:Blog(Chatbot Arena 团队)
AI 评分 46/100
SGLang 提出量化栈重构方案,拆分检查点解析与内核执行

SGLang 在 issue #15194 中提出量化栈重构,将检查点解析、参数注册、权重加载、后处理与内核执行拆分为独立可复用组件。新架构以 Quant Config、Method、Scheme、Kernel 四层划分,使 AWQ、GPTQ、Compressed-Tensors 等检查点格式可共享同一后端内核,并支持 CUDA、Ascend NPU、CPU 等硬件独立演进。

开源/仓库推理部署/工程

7月27日

星期一 · 1 条
23:35
公众号:月之暗面(Kimi)精选
AI 评分 81/100
Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

Kimi 发布 K3 模型权重与技术报告,并开源 MoonEP、FlashKDA 和 AgentEnv 三项关键 Infra 技术。K3 是 2.8 万亿参数的 MoE 模型,支持原生视觉与 100 万 token 上下文,参数规模约为 K2.5 的 3 倍,规模化效率提升 2.5 倍。

多模态开源生态推理模型发布
另有 1 家信源报道公众号:数字生命卡兹克
推荐理由:权重开源伴随技术报告公开训练细节,为研究机构直接复现和改造千亿级MoE模型提供了完整路径,也降低企业自部署门槛。
已加载 40 条