内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态观点 · 573 条
来源全部一手资讯X
类型观点
全部模型产品行业论文教程观点
标签「推理」清除

8月25日周二

22:18SemiAnalysis45OpenAI Jalapeño 自研芯片优于英伟达
11:27Hacker News 热门(buzzing.cc 中文翻译)49大型语言模型(LLMs)可能通过利用推理引擎来控制其宿主机器
03:27Hacker News 热门(buzzing.cc 中文翻译)55我花了266美元和四个AI模型,终于拥有了自己的平板电脑
01:59Yuchen Jin47前沿模型各有专长,难有全能者
00:18Rohan Paul45OpenRouter 周 token 量两年激增 9000 倍

8月24日周一

23:47李继刚31群聊即大模型,发言即提示词
17:48Chubby♨️39新Claude模型推理表现亮眼,或为Opus 5.1

8月23日周日

21:24IT之家(RSS)45美国专家示警:学生依赖"AI 代写"会削弱思考能力
18:29The Decoder:AI News(RSS)56AI 正成为 AI 最大客户:OpenRouter 上智能体 token 用量激增 14 倍

8月22日周六

04:54Tomer Tunguz 博客(VC 分析)56本地 AI 模型已能媲美云端前沿模型,数据中心将走向个人化
03:56TechCrunch:AI(RSS)61Nvidia 研究显示:智能体"缰绳"(harness)比 AI 模型本身更关键,Claude Opus 5 在 ARC-AGI-3 上达 100% 满分
00:29François Chollet39François Chollet 评 NVIDIA AVO:ARC-AGI-3 满分不等于基准满分

8月21日周五

16:58jietang31唐杰谈缩放定律:FLOPs是智能,参数是知识
04:48Rohan Paul31陶哲轩新论文:AI 将颠覆数学实践与价值
02:29François Chollet24猜想有误,AI生成反例证伪

8月20日周四

22:24The Verge:AI(RSS)53AI 引发的数学危机:顶尖数学家如何应对
20:48Rohan Paul42智谱唐杰:GLM-5.3 验证缩放不止参数
07:24Hacker News 热门(buzzing.cc 中文翻译)61陶哲轩:人工智能时代的数学
02:54Hacker News 热门(buzzing.cc 中文翻译)31Opus 5.0 将不连贯性推向了极致
01:46Thomas Wolf39唐杰谈缩放定律:GLM-5.3 后训练实验

8月19日周三

18:48Chubby♨️40GLM-5.3 证明缩放不止于参数规模
14:51公众号:数字生命卡兹克41智谱唐杰谈Scaling Law:GLM-5.3更像一次控制变量实验

8月18日周二

20:24Ethan Mollick39大模型心智理论局限:难分用户与开发者视角
19:54The Decoder:AI News(RSS)64JAMA 评论文章:AI 超越医生时,监管者不应强制人类介入
18:07Artificial Intelligence News(RSS)46解读智谱 GLM-5.3 成绩单:头条数字之外的信号
17:24Chubby♨️36算力成AI时代新石油,GPT Astra低价解难题
15:22AYi48Qwen3.8-27B 开源模型首次摸到前沿门槛
08:54Rohan Paul34理论物理正跨越数学曾跨越的门槛
07:24Ethan Mollick49智能模型创意变异性不足制约价值
04:04Dongxi 东锡 NLP41小模型+工具遇天花板,下一扩展轴是什么
01:53Tomer Tunguz 博客(VC 分析)48当模型持续学习:测试时训练如何改变 AI 的记忆与成本

8月17日周一

23:23凡人小北35技术革命消灭中间层,轮到智力劳动
15:12elsewhere:文章(RSS)14Kimi熹妃回宫
07:53Elon Musk34马斯克称Intelligence/Joule将持续提升
06:23Rohan Paul29AI 递归自我进化将终结人类智能巅峰时代
04:52Hacker News 热门(buzzing.cc 中文翻译)67模型正在故意变得更"笨":用世界知识换取推理能力
02:53Rohan Paul42Ramp 数据:AI 支出头部与中位数相差 625 倍

8月16日周日

23:53The Decoder:AI News(RSS)45顶尖数学家称 LLM 是强计算器但缺乏创造性思维
16:22Hacker News 热门(buzzing.cc 中文翻译)52软件工程的基础知识为何比智能体炒作更重要
03:22Hacker News 热门(buzzing.cc 中文翻译)49人工智能并非在智力上胜过数学家,而是在记忆力上胜过他们
已加载 40 条
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
观点 · 标签「推理」 · 573 条清除

8月25日

星期二 · 5 条
22:18
SemiAnalysis@SemiAnalysis_
AI 评分 45/100
OpenAI Jalapeño:优于英伟达 Blackwell OpenAI 自研 ASIC 与 Rubin 对比,Jalapeño 的 TCO、每 MW 吞吐量,以及火辣细节https://newsletter.semianalysis.com/p/openai-jalapeno-better-than-nvidia
OpenAI推理评测/基准
11:27
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 49/100
大型语言模型(LLMs)可能通过利用推理引擎来控制其宿主机器

恶意 LLM 可能通过向推理引擎(如 vLLM、SGLang)发送特定 token 序列,利用其解析漏洞在宿主机器上执行任意代码。vLLM 曾因 CVE-2025-9141 漏洞,在 Qwen3 Coder 的 XML 工具解析器中对参数执行 eval(),导致任意代码执行。此类漏洞可被持久化利用,且开源权重模型与推理引擎的普及正扩大攻击面。

安全/对齐推理部署/工程
03:27
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 55/100
我花了266美元和四个AI模型,终于拥有了自己的平板电脑

一位用户为完全掌控自己的Amazon Fire HD 10平板,花费266.15美元借助四个AI模型成功获取root权限。Kimi K3以164.25美元发现利用CVE-2022-38181的漏洞,GLM-5.2以21.90美元修复致命错误,GLM-5.3在80美元订阅首日一天内完成最终任务。整个过程中Kimi K3的会话长达621条消息,并自动重试超过500次。

智能体推理现象/趋势
01:59
Yuchen Jin@Yuchenj_UW
AI 评分 47/100
我越是使用前沿模型,就越不相信存在一个模型能统治一切。• Opus 5:最擅长用生成的 HTML 教我东西,但冗长且潦草。 • GPT-5.6 Sol:后端很强,前端较弱。 • Kimi K3 / GLM-5.2:日常编码中 90% 的场景便宜又高效,但在写内核这类 AI 研究任务上较弱。每个实验室都在为 AGI 而训练。但今天的 LLM 仍然是专才。
大佬观点推理编码
00:18
Rohan Paul@rohanpaul_ai
AI 评分 45/100
OpenRouter 从 2024 年 1 月约 100 亿 token/周,增长到 2026 年 8 月超过 90 万亿/周,增长了 9000 倍。如果这一速度持续下去,不知道未来 2.5 年会是什么情况。而智能体工作流才刚刚开始。智能体可以消耗极其庞大的 token 量。OpenRouter 表示,智能体工作负载约在 2 月超过了人类 token 使用量,而一次智能体请求消耗的 token 约为正常人类使用的 15 倍。图表来自 Menlo Ventures。
智能体推理现象/趋势

8月24日

星期一 · 2 条
23:47
李继刚@lijigang
AI 评分 31/100
把「群」视作一个「大模型」,每个人的发言都是一条Prompt。
大佬观点推理
17:48
Chubby♨️@kimmonismus
AI 评分 39/100
新Claude模型在中等推理任务上表现优异,或为Opus 5.1更新。此前Thariq和Boris已回应批评,暗示将改进Opus 5并可能推出新Haiku。泄露的"claude-melon-eap"和"claude-marshmallow-eap"输出显示3D强化学习能力突出,但两者均消耗大量思考token,多次触及max-tokens上限。

Lentils: I got y'all some outputs from "claude-melon-eap" and "claude-marshmallow-eap" 😉 They're really pushing 3D RL a lot, huh...

Anthropic多模态推理模型发布

8月23日

星期日 · 2 条
21:24
IT之家(RSS)
AI 评分 45/100
美国专家示警:学生依赖"AI 代写"会削弱思考能力

美国专家警告,学生长期依赖AI代写作业可能削弱自身思考能力。认知心理学家罗纳德·T·凯洛格指出,写作本身就是一种思考技术,机器代劳会让学生失去大脑训练。麻省理工学院研究发现,用AI写论文的人脑部活动更低,且难以回忆刚写出的内容;全美学校已开始限制学生使用AI。

推理现象/趋势
18:29
The Decoder:AI News(RSS)
AI 评分 56/100
AI 正成为 AI 最大客户:OpenRouter 上智能体 token 用量激增 14 倍

OpenRouter 分析师 Peter Walker 称,2026 年 2 月 6 日可能是人类消耗 token 量最后一次超过 AI 智能体。此后智能体 token 用量增长 14 倍,从 0.51 万亿增至 7.3 万亿,而人类用量仅增长 2.8 倍。近 70% 的智能体 token 消耗来自缓存提示词,计费费率更低,实际成本增速低于原始数字。

智能体推理现象/趋势

8月22日

星期六 · 3 条
04:54
Tomer Tunguz 博客(VC 分析)
AI 评分 56/100
本地 AI 模型已能媲美云端前沿模型,数据中心将走向个人化

斯坦福大学与 Together AI 的研究显示,本地 AI 模型在超过 100 万条真实查询中,对 89% 的日常聊天与推理问题回答质量已与云端前沿模型相当。本地模型对前沿模型的胜率/平局率从 2023 年的 23.2% 升至 2025 年的 71.3%,智能每瓦特效率同期提升 5.3 倍。相比全云端方案,本地模型加路由器的组合可削减 80% 能耗、77% 算力与 74% 成本。

大佬观点推理端侧
03:56
TechCrunch:AI(RSS)
AI 评分 61/100
Nvidia 研究显示:智能体"缰绳"(harness)比 AI 模型本身更关键,Claude Opus 5 在 ARC-AGI-3 上达 100% 满分

Nvidia 新研究指出,在长时程任务中,模型外的“缰绳”(harness)比底层模型更重要。研究人员通过定制 harness 并加入“监督者”组件,让 Claude Opus 5 在交互推理基准 ARC-AGI-3 上取得 100% 满分,而无 harness 时仅得 30%。该研究还表明,OpenAI 上月通过调整 harness 设置使模型分数提升三倍,但均未达满分。

智能体推理现象/趋势
00:29
François Chollet@fchollet
AI 评分 39/100
François Chollet 称赞 NVIDIA 的 AVO 系统在 ARC-AGI-3 上表现优异,认为其采用深度学习引导的符号世界模型实时合成路径。但他明确指出,在公开演示集上拿 100% 不等于在 ARC-AGI-3 基准上拿 100%,如同通关教程不等于通关游戏。AVO 通过记忆、工具与执行反馈实现长时程任务持续进展。

NVIDIA AI: NVIDIA AVO continuously inspects, plans, implements, and evaluates, using memory, tools, and execution feedback to build...

智能体大佬观点推理

8月21日

星期五 · 3 条
16:58
jietang@jietang
AI 评分 31/100
唐杰引用Liam Fedus对缩放定律历史的回顾:2020年Switch Transformers将每个token路由至2048个专家中的1个,激活参数不足3B但总参数达1.6T。该模型在C4困惑度和TriviaQA上超越T5并创SOTA,但在SuperGLUE等推理任务上表现不佳,表明最优token-参数比高度依赖任务。

Liam Fedus: An excellent history of scaling laws from @jietang. In 2020, we explored the limits of sparsity in Switch Transformers b...

大佬观点推理数据/训练
04:48
Rohan Paul@rohanpaul_ai
AI 评分 31/100
陶哲轩新论文:AI 将颠覆数学实践与价值

陶哲轩新论文指出,AI 可能让数学证明变得充裕,而数学界尚未适应这种充裕。他认为数学正进入类似基础危机的动荡期,但这次被压力测试的是数学的价值与实践框架,而非真理基础。他主张必须将数学中未言明的目标(如何为贡献、何为理解、谁完成了工作)变得更加明确。

大佬观点推理
02:29
François Chollet@fchollet
AI 评分 24/100
该猜想是错误的,这里有一个AI生成的反例。
推理论文/研究

8月20日

星期四 · 5 条
22:24
The Verge:AI(RSS)
AI 评分 53/100
AI 引发的数学危机:顶尖数学家如何应对

OpenAI 近期发布的一组数学难题解决方案在数学界引发巨大争议,促使多位顶尖数学家反思 AI 对数学领域的冲击。尽管 AI 在基础算术上仍表现糟糕,但在高端抽象数学上却日益擅长,这引发了关于数学家未来角色、学术资助价值以及 AI 实验室是否借数学炒作营销的深层质疑。

OpenAI推理现象/趋势
20:48
Rohan Paul@rohanpaul_ai
AI 评分 42/100
智谱唐杰:GLM-5.3 验证缩放不止参数

智谱创始人唐杰发文称,模型缩放已不止参数增长,参数量只是多个独立旋钮之一,数据、单次前向计算与后训练同样关键。他提出,将推理纳入优化目标后,最优解转向训练更久的小模型。作为验证,GLM-5.3 与 GLM-5.2 基础、架构、总参和激活参数完全相同,仅多花一个月扩展长时程环境与 RL,收益显著。

jietang: Thoughts About Scaling Law Scaling, but not only of parameters. Every model release now ends with the same question: how...

大佬观点推理数据/训练
07:24
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 61/100
陶哲轩:人工智能时代的数学

数学家陶哲轩在2026年国际数学家大会演讲中提出,数学界应如何回应具备研究级数学能力的AI工具。他主张搁置对AI能力的争论,转而审视数学研究真正的目标与价值,并以问题求解作为案例。他认为当前数学正经历类似20世纪初基础危机的动荡期,需将隐含的数学实践与价值规范显式化。

大佬观点推理
02:54
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 31/100
Opus 5.0 将不连贯性推向了极致

Opus 5.0 在 GitHub 上引发热议,其输出不连贯性问题被推向极致,获 111 个 HN 点赞。该版本在推理连贯性上出现明显退化,用户反馈其回答逻辑断裂、前后矛盾。目前尚不清楚 Anthropic 是否已针对该问题发布修复更新。

Anthropic其他推理
01:46
Thomas Wolf@Thom_Wolf
AI 评分 39/100
智谱唐杰发文回顾缩放定律演进,指出参数量需结合数据、算力与推理成本综合考量,并强调推理成本已主导模型生命周期开销。GLM-5.3 作为受控实验,与 GLM-5.2 采用相同基座、架构及参数规模,仅通过一个月长程环境强化学习(RL)后训练,即带来显著能力提升,证明缩放维度可独立调节,后训练仍有较大优化空间。

jietang: Thoughts About Scaling Law Scaling, but not only of parameters. Every model release now ends with the same question: how...

大佬观点推理数据/训练

8月19日

星期三 · 2 条
18:48
Chubby♨️@kimmonismus
AI 评分 40/100
GLM-5.3 证明缩放不止于参数规模

智谱(GLM)创始人指出,AI 缩放并未结束,只是行业过度聚焦模型参数量。GLM-5.3 与 GLM-5.2 采用相同基础模型、架构和参数量,仅通过一个月额外强化学习(RL)训练便获得显著性能提升。缩放的关键在于训练数据、推理算力与后训练等多维度潜力,而非单一参数规模。

jietang: Thoughts About Scaling Law Scaling, but not only of parameters. Every model release now ends with the same question: how...

大佬观点推理数据/训练
14:51
公众号:数字生命卡兹克
AI 评分 41/100
智谱唐杰谈Scaling Law:GLM-5.3更像一次控制变量实验

智谱创始人唐杰发帖阐述对Scaling Law的理解,称Scaling不只有参数量,还需结合数据量、算力分配与运行条件。GLM-5.3在AA指数拿到60分,较上代GLM-5.2的53分提升,基座相同,总参数753B、激活40B。唐杰认为,总参数量决定知识容量,激活参数与有效深度决定长程推理,Scaling正从追求更大数字转向寻找最优解。

大佬观点推理数据/训练

8月18日

星期二 · 9 条
20:24
Ethan Mollick@emollick
AI 评分 39/100
大语言模型具备心智理论这一事实本身就意义重大(且这一发现在当时颇具争议),但当模型需要考虑多个受众时,其局限性依然可见--例如在编程时,它们难以区分终端用户与创作者的需求/视角。
大佬观点推理编码
19:54
The Decoder:AI News(RSS)
AI 评分 64/100
JAMA 评论文章:AI 超越医生时,监管者不应强制人类介入

《JAMA》发表评论文章预测,自主 AI 在医学推理上将超越任何医生与 AI 的组合,并呼吁监管者不要将人类介入写入规则。作者援引研究称,ChatGPT o3 在 377 个复杂病例中 60% 首先给出正确诊断,而 20 名内科医生仅为 15.9%;GPT-4 单独诊断推理得分 92%,使用同一模型的医生仅 76%。文章预计到 2030 年自主 AI 可胜任部分认知类医疗工作流。

MicrosoftOpenAI推理政策/监管
18:07
Artificial Intelligence News(RSS)
AI 评分 46/100
解读智谱 GLM-5.3 成绩单:头条数字之外的信号

智谱在 GLM-5.3 发布说明中自述,其网络安全能力“增长最快的恰恰是我们最落后的地方”。这家以 Z.ai 名义运营的北京公司,是少数几家发布可与海外模型竞争的中国实验室之一。该表态揭示了其在安全短板上的追赶策略,而非仅关注基准测试的头条分数。

推理评测/基准
17:24
Chubby♨️@kimmonismus
AI 评分 36/100
"算力真的正在成为新的石油,AI时代新的稀缺资源"GPT Astra 以 2,000 美元解决了 10 个长期悬而未决的开放数学和理论计算机科学问题。所以没错,算力(几乎)就是当下所需的一切。
OpenAI大佬观点推理
15:22
AYi@AYi_AInotes
AI 评分 48/100
Qwen3.8-27B 开源模型首次摸到前沿门槛

阿里 Qwen 开源 Qwen3.8-27B,在 Artificial Analysis Intelligence Index 拿下 52 分,与 DeepSeek V4 Pro(53 分)、GPT-5.6 Luna(52 分)等闭源旗舰同级,成为首个达到前沿能力的本地模型。

Cline: Artificial Analysis Intelligence Index puts Qwen3.8-27B at DeepSeek V4-Pro and GPT 5.6 Luna performance. This is the fir...

推理端侧评测/基准
08:54
Rohan Paul@rohanpaul_ai
AI 评分 34/100
理论物理学刚刚跨越了数学曾经跨越的同一道门槛。AI 将让大量初级理论物理研究的成本大幅降低。

Gavin Crooks: Physics is going to be as cooked/cooking as math. I fed Claude an open problem in stochastic thermodynamics of the kind ...

Anthropic大佬观点推理
07:24
Ethan Mollick@emollick
AI 评分 49/100
还有变异性!AI 实验室在考虑创意任务时,需要更多地思考变异性。事实上,从智能模型中获取创意变体需要付出努力,这严重限制了它们在问题解决和创意工作中的有效价值。

roon: @trq212 because the creative aspects we care about are at the level of intelligence rather than technique

大佬观点推理
04:04
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 41/100
马东锡 NLP 引用 Jason Wei 观点,质疑"1B 认知核心+工具调用"范式:无需工具、快速自然地完成任务至关重要,参数化内化知识有信息上限,追求最高质量智能仍需更大模型。旧范式是预训练算力扩展,当前是推理时扩展,下一扩展轴成谜。

Jason Wei: When language models first started using tools well, I was sympathetic to the narrative that instead of scaling up langu...

大佬观点推理
01:53
Tomer Tunguz 博客(VC 分析)
AI 评分 48/100
当模型持续学习:测试时训练如何改变 AI 的记忆与成本

测试时训练(Test-time training)让模型在使用中持续更新权重,而非训练结束后冻结。相比标准 Transformer,其内存需求从随上下文线性增长变为恒定,斯坦福研究显示推理速度最高可提升 2.7 倍,且 In-Place TTT 无需重训即可将 4B 模型提升至 128k 上下文性能。但代价是每个用户需独立模型副本,服务成本转向算力与芯片,更适合编码助手等个性化场景。

推理现象/趋势部署/工程

8月17日

星期一 · 6 条
23:23
凡人小北@frxiaobei
AI 评分 35/100
每一次技术革命都在消灭一部分劳动价值的同时放大另一部分,而这次轮到智力劳动。科技进步的结果是消灭中间层:高智力劳动要求更高,低智力劳动要求更低,因为替代前者成本太高、替代后者收益太低。因此不要去做让中等智力劳动更高效的产品,因为那个劳动需求本身就会消失。

响马: 科技进步的结果就是消灭中间层,每一轮生产力革命,都会让高智力劳动要求更高,低智力劳动要求更低。因为替代高智力劳动成本太高,替代低智力劳动收益太低。 所以不要尝试去做让中等智力劳动更高效的产品,因为那个劳动需求本身就会消失。

推理现象/趋势
15:12
elsewhere:文章(RSS)
AI 评分 14/100
Kimi熹妃回宫
推理现象/趋势
07:53
Elon Musk@elonmusk
AI 评分 34/100
Intelligence/Joule将持续改进

Amjad Masad: 18x improvement in intelligence per joule in 16 months.

大佬观点推理
06:23
Rohan Paul@rohanpaul_ai
AI 评分 29/100
AI 递归自我进化将终结人类智能巅峰时代

前谷歌高管 Mo Gawdat 指出,AI 正从学习人类发明的数学转向发明人类可学习的数学,人类作为顶级智能的时代即将结束。AI 已能通过递归自我发展不断改进自身方法,一旦机器能自主迭代优化,技术进步速度将远超人类正常科研节奏。

大佬观点推理
04:52
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 67/100
模型正在故意变得更"笨":用世界知识换取推理能力

前沿模型正用世界知识换取推理能力:GLM-5.2 在 AIME 2026 达 99.2%,每 token 仅激活约 400 亿参数,而 Qwen3.5 9B 在 SimpleQA 上幻觉率高达 80-82%。

推理数据/训练现象/趋势
02:53
Rohan Paul@rohanpaul_ai
AI 评分 42/100
Ramp 数据:AI 支出头部与中位数相差 625 倍

Ramp 数据显示,AI 支出前 1% 的公司人均月支出达 $7,500,而中位数公司仅 $12,差距约 625 倍。头部公司单日即可消耗普通公司全年 AI 预算。即便中位数公司仅小幅向头部强度靠拢,未来 2-5 年 token 消耗量也将大幅增长。

推理现象/趋势

8月16日

星期日 · 3 条
23:53
The Decoder:AI News(RSS)
AI 评分 45/100
顶尖数学家称 LLM 是强计算器但缺乏创造性思维

数学家 Timothy Gowers 和 Peter Sarnak 认为,大语言模型擅长组合已知方法并探索多条搜索路径,但缺乏在广阔搜索空间中挑选少数有效路径的直觉,难以产生真正的新想法。

DeepMind大佬观点推理
16:22
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 52/100
软件工程的基础知识为何比智能体炒作更重要

作者认为,智能体工程的热潮掩盖了软件工程的核心:可调试、可维护、分层、可组合的代码仍依赖深思熟虑的推理,而这正是当前LLM的短板。LLM本质是预测而非推理,且无法区分好坏建议,存在提示注入等根本性缺陷。开源权重模型正让个人电脑具备相近能力,但工程的关键仍在于选择正确的抽象和管理认知负荷。

智能体推理现象/趋势编码
03:22
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 49/100
人工智能并非在智力上胜过数学家,而是在记忆力上胜过他们

AI 解决数学难题的关键可能不是更强的推理能力,而是远超人类的工作记忆容量。人类工作记忆极其有限,而模型可将整个问题、中间方程和先前结论全部放入上下文窗口。多项儿童研究表明,工作记忆对数学表现的预测力独立于 IQ,这为理解 AI 的数学能力提供了线索。

推理现象/趋势
已加载 40 条