内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态论文 · 991 条
来源全部一手资讯X
类型论文
全部模型产品行业论文教程观点
标签「推理」清除

今天8月26日 周三

06:52Cerebras:Blog(网页)19Ultrafast Frontier Inference: Cerebras Deep Dive at Hot Chips 2026
06:48Rohan Paul36Prime Agent 技术报告:记忆层级机制解析

8月25日周二

20:07HuggingFace Daily Papers(社区热门论文)45LongWoF-Bench:用 EvoMap 基因评估可验证的长流程任务
10:18Rohan Paul35DeepMind 新研究:推理时回灌深层激活可降困惑度

8月24日周一

21:18Rohan Paul36对抗式审查:结构化分歧提升智能体代码审查
12:18Ethan Mollick19Claude 证明 S6 复结构引热议
10:24IT之家(RSS)40摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,破解长上下文推理成本瓶颈
08:48SemiAnalysis64AgentX 推理基准:CUDA 护城河能否守住智能体推理
08:18Rohan Paul48Claude 助数学家破解 1948 年难题
07:18Rohan Paul36主动推理让AI智能体按需获取上下文

8月23日周日

23:48elvis36Google DeepMind 推免训练递归架构新论文
07:44Dongxi 东锡 NLP37TRACES 基准:评估 AI 调查过程而非只看答案
00:44Dongxi 东锡 NLP35TRACES 基准:评估 AI 可审计的探索性研究过程

8月22日周六

17:28The Decoder:AI News(RSS)51新研究:忽略人类信念的世界模型会预测错误行为
01:56LMSYS:Blog(Chatbot Arena 团队)63精选Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%

8月21日周五

22:44DAIR.AI41DeepMind 将模型路由形式化为潘多拉之盒
13:06HuggingFace Daily Papers(社区热门论文)56FlashPrefill V2:面向长上下文 LLM 服务的块稀疏预填充注意力
11:06HuggingFace Daily Papers(社区热门论文)57MemTrapBench:为 LLM 记忆使用中的认知陷阱设立基准
00:24Hacker News 热门(buzzing.cc 中文翻译)49不要再将中间令牌拟人化为推理/思考的痕迹

8月20日周四

13:06HuggingFace Daily Papers(社区热门论文)51Co-RL:多智能体强化学习中的多样化群体催生无监督推理能力
11:06HuggingFace Daily Papers(社区热门论文)50SPADE:自适应合成可执行环境中的自我对弈
04:48Rohan Paul41TRACES:首个衡量探索式AI的基准
02:44Dongxi 东锡 NLP36TRACES 基准发布:衡量 AI 发现式智能
01:56LMSYS:Blog(Chatbot Arena 团队)73精选突破 DeepSeek-V4-Pro 服务极限:H20 上的多场景优化方法

8月19日周三

17:28Tencent Hy53腾讯混元Hyra四项数学新突破
12:48凡人小北52同事件Anthropic 用 Claude 设计蛋白结合剂,14/15 靶点命中同一事件,精选展示《Claude 如何加速蛋白质设计与分析化学研究》
12:05HuggingFace Daily Papers(社区热门论文)41TAMP-Nav:面向高效具身导航的点选、思考、记忆与对齐框架
08:00HuggingFace Daily Papers(社区热门论文)41超越模仿:R2-OPD 按推理进展过滤在线策略蒸馏
08:00HuggingFace Daily Papers(社区热门论文)52SparsePR:免训练稀疏注意力如何加速视频生成与世界模型
06:27Anthropic:Research(发表成果 · 网页)73精选Claude 如何加速蛋白质设计与分析化学研究

8月18日周二

22:57Apple Machine Learning Research(RSS)50GRPO 超越英语:多语言与非英语环境下的大规模研究
21:09HuggingFace Daily Papers(社区热门论文)67低资源语言中的思维:SFT 构建了什么,RL 修复了什么,准确率看不到什么
15:05HuggingFace Daily Papers(社区热门论文)50SA-MRPO:面向多奖励策略优化的饱和感知优势重加权方法
13:05HuggingFace Daily Papers(社区热门论文)55先前审计-修复上下文使 LLM 验证器阈值偏向宽松
11:05HuggingFace Daily Papers(社区热门论文)49R^3-Bench:LLM 在共享预算下的资源理性推理仍显吃力
08:00HuggingFace Daily Papers(社区热门论文)53TileMix:面向 LLM 推理加速的以 Tile 为中心的混合精度注意力机制
08:00HuggingFace Daily Papers(社区热门论文)53Chain-of-Experience:让大语言模型在测试时通过迭代经验持续改进
03:24Rohan Paul27混合线性注意力LLM中的巨量激活:注意力层前尖峰与层间平台

8月17日周一

19:24HuggingFace Daily Papers(社区热门论文)52ParaTempo:基于时间置信度的并行推理加速框架
08:00HuggingFace Daily Papers(社区热门论文)49同策略蒸馏中的泛化双面性:一项关于大语言模型 OPD 的受控研究
已加载 40 条
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
论文 · 标签「推理」 · 991 条清除

8月26日

星期三 · 2 条
06:52
Cerebras:Blog(网页)
AI 评分 19/100
Ultrafast Frontier Inference: Cerebras Deep Dive at Hot Chips 2026
推理论文/研究
06:48
Rohan Paul@rohanpaul_ai
AI 评分 36/100
Prime Agent 技术报告:记忆层级机制解析

Prime Agent 发布技术报告,该 harness 曾助 Opus 5 在 ARC-AGI-3 达 95.5%。其核心机制为记忆层级:模型权重与活动上下文之下,设持久 IPython 会话及磁盘存储的历史、技能与提示词库,模型通过代码在各层级间移动状态。长输入作为 REPL 变量留存,供智能体搜索与转换,将长上下文工作转为信息管理问题。

智能体推理论文/研究

8月25日

星期二 · 2 条
20:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 45/100
LongWoF-Bench:用 EvoMap 基因评估可验证的长流程任务

研究团队提出 LongWoF-Bench,含 778 个可机器验证任务,覆盖代码生成、智能体环境合成、数学推理与规则遵循。在 252 个经验证的 Opus 轨迹上,进化得到的 EvoMap 基因在全部 7 个模型中比 Skill 平均高出 8.7-15.5 个百分点,且优势扩展至消费级模型;对 Claude Opus,基因复用还多完成 39 个任务,并减少 9.9% 的推理 token 消耗。

智能体arXiv推理论文/研究
10:18
Rohan Paul@rohanpaul_ai
AI 评分 35/100
DeepMind 新研究:推理时回灌深层激活可降困惑度

Google DeepMind 新论文提出“Recirculation”方法:推理时将深层激活的一小部分混入浅层,权重不变,即可恢复模型在长上下文中丢失的部分状态。在 Gemma3 上,10 个语言建模数据集中 9 个困惑度下降,12B 模型最高降 35%,但多项选择收益有限;该方法无需重训,但代价是预填充无法并行,且收益不跨模型家族迁移。

DeepMind推理论文/研究

8月24日

星期一 · 6 条
21:18
Rohan Paul@rohanpaul_ai
AI 评分 36/100
对抗式审查:结构化分歧提升智能体代码审查

一篇论文提出用“对抗式审查”规则提升AI智能体代码审查:审查者与批评者需用代码证据回应分歧,而非简单互相认同。在LiveCodeBench上,3个智能体达87%准确率,优于5智能体版本的82%;在真实PR审查中,该规则将F1分数从0.457提升至0.533,跃居首位。

智能体arXiv推理论文/研究
12:18
Ethan Mollick@emollick
AI 评分 19/100
是时候假装我精通数学了,这样我才能对这东西有多厉害发表点看法。

levent: Please welcome to the world a beautiful new geometric object, to do with a problem i’ve always loved. claude really cont...

Anthropic推理论文/研究
10:24
IT之家(RSS)
AI 评分 40/100
摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,破解长上下文推理成本瓶颈

摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,基于旗舰级AI训推一体智算卡MTT S5000构建“Prefill As a Service”新范式,面向AI Agent、代码生成、超长文档分析等长上下文推理场景。

推理论文/研究部署/工程
08:48
SemiAnalysis@SemiAnalysis_
AI 评分 64/100
AgentX - InferenceXv3:CUDA 护城河在智能体推理中能否守住?开源 300 万美元数据集,100 万+上下文长度,多轮对话,子智能体 95%+ KVCache 命中率,GB300 NVL72,MI355,B200https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat
开源生态推理评测/基准部署/工程
08:18
Rohan Paul@rohanpaul_ai
AI 评分 48/100
又是一周,又一个开放数学难题被 AI 攻克。Anthropic 的一位数学家与 Claude 合作,声称解决了一个自 1948 年以来悬而未决的著名数学问题。

levent: Please welcome to the world a beautiful new geometric object, to do with a problem i’ve always loved. claude really cont...

Anthropic推理论文/研究
07:18
Rohan Paul@rohanpaul_ai
AI 评分 36/100
主动推理让AI智能体按需获取上下文

一篇论文提出用主动推理让AI智能体显式决策每次澄清、检索或工具调用是否值得其token与延迟成本。受控测试中,定向澄清将验证器合规率从0.0417提升至0.375,平均token使用从约112增至219。建议为智能体增加显式上下文获取层,而非将其视为自动行为。

智能体推理论文/研究

8月23日

星期日 · 3 条
23:48
elvis@omarsar0
AI 评分 36/100
Google DeepMind 推免训练递归架构新论文

Google DeepMind 提出一种免训练方法,通过让模型自身指导架构修改来进化模型架构,或可启发更稳健的递归自我改进。该方法在推理时引入“再循环”机制,将激活反馈回模型自身,无需重新训练即可追踪信念状态,生成成本保持平稳。在 Gemma3 系列上,自适应变体将困惑度降低 23%,GSM8k 准确率提升 21%,且原始权重冻结。

DeepMind推理论文/研究
07:44
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 37/100
TRACES 基准:评估 AI 调查过程而非只看答案

Apodex Discovery 推出 TRACES 基准,评估 AI 系统能否通过证据充分、可审计、可修复的调查得到正确结果。它同时检查最终答案与外部可见轨迹,用 HDS6 盲评六种过程能力(工具、修复、备选解释、连贯性、证据、适用边界)。在 434 条缺陷轨迹上,加入修复说明使环境结果得分平均提高 0.155,但实验缺少匹配对照组。

智能体arXiv推理论文/研究
00:44
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 35/100
TRACES 基准:评估 AI 可审计的探索性研究过程

TRACES 是 Apodex Discovery 框架下的现实基准,评估 AI 系统能否通过有证据支撑、可审计且可修复的调查研究得出正确结果。在临床试验复现案例中,修复后的过程评分从 0.83 升至 0.95,而数字未变。该基准区别于仅测最终答案的传统基准,将评估对象从答案扩展至完整调查链:目标→规划→行动→观察→验证→修复。

智能体arXiv推理论文/研究

8月22日

星期六 · 2 条
17:28
The Decoder:AI News(RSS)
AI 评分 51/100
新研究:忽略人类信念的世界模型会预测错误行为

一项新研究指出,Sora、Genie 3 等现有世界模型仅建模物理层,忽略人类信念、意图等心理状态,导致预测错误。研究者提出“Mental World Modeling”(MWM)框架及免训练实现 MENTIS,并构建含 448 个场景的 Menti-Bench 评测集。在八款模型测试中,完整 MWM 流程将 F1 分数从直接回答的 63.3 提升至 87.9,人类基准为 98.5。

智能体多模态推理论文/研究
01:56
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 63/100
Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%

蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。

推理论文/研究部署/工程

推荐理由:对做单请求低延迟推理的团队,可迁移的是先把主机从 GPU 进度上解绑再优化 GPU 关键路径,否则主机的同步等待会变成每步的 GPU 气泡,这与具体模型无关。

8月21日

星期五 · 4 条
22:44
DAIR.AI@dair_ai
AI 评分 41/100
DeepMind 将模型路由形式化为潘多拉之盒

Google DeepMind 新论文将模型路由形式化为潘多拉之盒问题,即检查成本高昂时的最优搜索问题。在高斯信号模型下策略有闭式解,可判断每个专家和输入是否值得细化估计。在多 LLM 基准、检索增强专家和可变推理时长的 LLM 上,Pandora's Router 以远低于昂贵估计器的调用频率达到穷举估计质量。

DeepMind推理论文/研究部署/工程
13:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 56/100
FlashPrefill V2:面向长上下文 LLM 服务的块稀疏预填充注意力

FlashPrefill V2 将稀疏注意力从算法原型推进到实用化长上下文服务,通过均值校正项抑制近似误差,并采用 PackGQA 内存访问、warp 特化和 pingpong 流水线,对齐 FlashAttention-3/4 并支持 FP8 推理。

推理论文/研究部署/工程
11:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 57/100
MemTrapBench:为 LLM 记忆使用中的认知陷阱设立基准

现有记忆基准多只评估信息提取与检索,却忽视了检索到的记忆如何重塑模型推理并影响当前任务表现。为此研究者推出 MemTrapBench,覆盖推理固着与信念扭曲两类认知陷阱。实验显示,所有被测记忆策略均不如无记忆设置,最强方法性能下降也超过 10%;新提出的 AdaptiveMem 推理期方法可缓解这些陷阱,同时保持或提升标准记忆基准上的表现。

推理论文/研究
00:24
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 49/100
不要再将中间令牌拟人化为推理/思考的痕迹

亚利桑那州立大学团队发表立场论文,反对将大语言模型在输出答案前生成的中间令牌(ITG)称为“推理痕迹”或“思考痕迹”,认为这种拟人化并非无害隐喻,而是会混淆模型本质、误导有效使用并催生可疑研究。论文汇集多项质疑该解读的实证工作,呼吁社区避免此类拟人化表述。

arXiv推理论文/研究

8月20日

星期四 · 5 条
13:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 51/100
Co-RL:多智能体强化学习中的多样化群体催生无监督推理能力

Co-RL 提出一种无需人工标注的多智能体强化学习框架,多个不共享参数的模型通过彼此提供的奖励信号进行协同优化。实验表明,增加群体多样性(异构模型族、规模及改写样本)可减少自强化反馈循环中的相关错误,在七个纯文本基准上平均提升 3.0-8.6%,在四个多模态基准上提升 2.3-7.2%,性能匹配或超越有监督方法。代码已开源。

智能体推理数据/训练论文/研究
11:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 50/100
SPADE:自适应合成可执行环境中的自我对弈

SPADE 提出自我对弈强化学习框架,让单个 LLM 同时扮演环境设计者和推理智能体,前者用 Gym 风格接口编写可执行长程训练环境。通过优化推理智能体的遗憾信号,环境设计者能生成处于能力边界且可行的环境。在 30B 参数规模下,SPADE 在八个基准上平均超过最强固定环境基线 +5.3,工具使用场景提升 +5.7 和 +13.9。

智能体推理数据/训练论文/研究
04:48
Rohan Paul@rohanpaul_ai
AI 评分 41/100
TRACES:首个衡量探索式AI的基准

Apodex 推出 TRACES,号称全球首个衡量“探索式AI”的基准,将AI评测从“已知答案的检索”转向“无答案问题的完整调查过程”。该基准由创始人陈天桥提出,定义了六项能力,并发布“探索式智能”定义、评估标准及求解者招募。

Apodex: Most AI benchmarks test retrieval — can a model find the known answer? However, the hardest problems in science require ...

推理评测/基准
02:44
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 36/100
Apodex_AI 发布全球首个衡量"发现式智能"的基准 TRACES,由创始人陈天桥提出并定义六项能力,测试 AI 在无答案密钥的问题上通过证据、假设检验得出可验证结论的能力。主推文强调,发现过程可分解为"雄心→构想→行动→观察→验证→修复",这一分解比任何单一基准分数更重要。同日还发布了"发现式智能"定义、区分可靠调查与侥幸猜测的评分标准,并公开征集解题者与问题。

Apodex: Most AI benchmarks test retrieval — can a model find the known answer? However, the hardest problems in science require ...

推理数据/训练评测/基准
01:56
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 73/100
突破 DeepSeek-V4-Pro 服务极限:H20 上的多场景优化方法

LMSYS 团队针对 1.6 万亿参数的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上通过场景化服务配置逼近 B300 性能。单节点 H20-141GB 参考实现达 271 output tokens/s,与 B300 的 383.7 tokens/s 性能差距缩小至 1.42×。

DeepSeek推理论文/研究部署/工程

推荐理由:文章提出按上下文长度与并发需求分场景选择 prefill/decode 配置,并用 Humming 压缩和 Online C128 释放 HBM,使 H20 也能服务 1M 上下文,为受限硬件上的大规模推理提供了可复用的工程思路。

8月19日

星期三 · 6 条
17:28
Tencent Hy@TencentHunyuan
AI 评分 53/100
腾讯混元Hyra四项数学新突破

腾讯混元Hyra在数学推理上取得四项新进展:将常宽体下界从0.380799w³提升至0.411040w³(达Meissner最优猜想值的97.9%);Beurling–Ahlfors系数从1.575改进至1.523958;部分Hadamard矩阵渐近计数扩展至近二次尺度;算子交换子逼近成本从Tao的O(log⁵(1/ε))降至O(log³)。相关结果已开源。

推理论文/研究
12:48
凡人小北@frxiaobei同事件
AI 评分 52/100
Anthropic 用 Claude 设计蛋白结合剂,14/15 靶点命中

Anthropic 用 Claude Mythos Preview 和 Opus 4.8 为 15 个蛋白靶点设计全新蛋白结合剂,14 个靶点成功。Claude 自主选择结合位点并调用多个专业模型优化,经湿实验验证,单设计命中率达 22%~35%,高于行业典型的 10%~15%。Anthropic 承认这只是药物研发极早期步骤。

Anthropic: Many drugs work by binding to a specific target in the body and blocking or changing what it does. An important first st...

Anthropic推理论文/研究
同一事件,精选展示《Claude 如何加速蛋白质设计与分析化学研究》
12:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 41/100
TAMP-Nav:面向高效具身导航的点选、思考、记忆与对齐框架

TAMP-Nav 提出统一框架,将具身导航重构为 2D 视觉提示任务,让 VLM 仅需选择 2D 像素即可由 SLAM 控制器执行,并引入选择性推理与锚点轨迹记忆机制,通过 GRPO 双层对齐实现高效导航。该方法在 R2R-CE 基准上取得 66.2% SR 的 SOTA 成绩,且仅需 90k 训练轨迹,兼具高运行效率与样本效率。

具身智能推理论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 41/100
超越模仿:R2-OPD 按推理进展过滤在线策略蒸馏

在线策略蒸馏(OPD)假设教师奖励能恰当反映推理进展,但实际中二者常冲突,推理进步明显的步骤可能因偏离教师输出而获较低奖励。为此研究者提出 R2-OPD,构建教师奖励与独立估计进展奖励的轨迹内双排序,在排序不一致时抑制蒸馏奖励,减少与推理进展冲突的监督。该方法在推理性能上较标准 OPD 持续提升。

推理数据/训练论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
SparsePR:免训练稀疏注意力如何加速视频生成与世界模型

SparsePR 提出免训练块稀疏注意力方法,结合响应耦合分区与探针拟合残差重建,在四个视频生成与世界模型上持续降低注意力重建误差。该方法在 22.0%-26.0% 实际执行对密度下保持生成质量,实现 1.48x-2.61x 端到端加速。消融实验显示探针拟合贡献主要误差降低,响应耦合分区在有限探针预算下改善重建效果。

推理视频论文/研究
06:27
Anthropic:Research(发表成果 · 网页)精选
AI 评分 73/100
Claude 如何加速蛋白质设计与分析化学研究

Anthropic 公布两项实验:Claude(Mythos Preview 和 Opus 4.8)针对 15 个靶点设计蛋白质结合剂,成功 14 个,命中率达 22.6%-35.1%。

Anthropic推理论文/研究
另有 2 家信源报道X:Rohan Paul (@rohanpaul_ai)X:Anthropic (@AnthropicAI)
推荐理由:把湿实验命中率与行业常规 10-15% 对比,Claude 从零设计蛋白结合体的效率已接近或超过专家,可压缩药物发现早期的计算与人工周期。

8月18日

星期二 · 8 条
22:57
Apple Machine Learning Research(RSS)
AI 评分 50/100
GRPO 超越英语:多语言与非英语环境下的大规模研究

一项大规模实证研究考察了 GRPO 在多语言和非英语环境下的表现,覆盖多种基础模型、训练语言及推理语言奖励设置。研究发现,以母语进行推理训练与英语推理训练之间的性能差距很小,表明 RLVR 在非英语场景下同样有效。该研究为多语言推理模型的强化学习训练提供了重要参考。

推理数据/训练论文/研究
21:09
HuggingFace Daily Papers(社区热门论文)
AI 评分 67/100
低资源语言中的思维:SFT 构建了什么,RL 修复了什么,准确率看不到什么

一项研究用三个前沿混合专家模型(Alibaba、OpenAI、NVIDIA,各 3.6-4.0B 激活参数)微调其用低资源语言推理,发现准确率基准几乎无变化且本身是噪声——仅改变随机种子就能让分数波动 7.7 分,超过所有数据与配方效应。

推理数据/训练论文/研究
15:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 50/100
SA-MRPO:面向多奖励策略优化的饱和感知优势重加权方法

针对多奖励强化学习中固定加权求和导致已饱和目标持续占用梯度预算的问题,研究者提出SA-MRPO,对每个奖励目标独立标准化,并按批次级饱和估计自适应折扣其贡献。在数学推理的15项基准对比中,SA-MRPO在12项上优于GDPO,AIME24最高提升5%;自适应推理五项基准平均提升3.8%,AMC23最高提升9.2%;代码基准通过率最高提升2.3%,同时保持已满足目标性能。

推理数据/训练论文/研究
13:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 55/100
先前审计-修复上下文使 LLM 验证器阈值偏向宽松

一项针对 ProcessBench 轨迹的研究发现,模型上下文中已有的“审计→修复”完整流程会降低验证器的误报率:在 15 种模型与措辞组合中全部生效,误报率相对长度匹配的对照组下降 2.8 至 11.5 个百分点(降幅 9%–25%)。信号检测分析显示变化源于判断阈值而非判别能力,且人工复核 50 例误报中 82% 确属错误,因此该偏移在该工作点未必有害。

推理论文/研究
11:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
R^3-Bench:LLM 在共享预算下的资源理性推理仍显吃力

新基准 R^3-Bench 在数学、竞赛编程和抽象推理中,以共享预算评估六题套件,覆盖无工具与智能体两种场景。对六款模型的 72 个主表单元,离线经验 oracle 均值在所有单元达到或超过竞赛均值,其中 71 个单元严格更高;中等无工具压力下,四款模型的均等分配回放也超过竞赛表现。轨迹诊断显示策略更新有限且失败模式随压力变化,揭示模型在共享预算下实现能力与表现之间存在持续差距。

智能体推理论文/研究评测/基准
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
TileMix:面向 LLM 推理加速的以 Tile 为中心的混合精度注意力机制

TileMix 提出一种以 tile 为中心的精度路由内核,将注意力矩阵划分为硬件对齐的 score tile,通过紧凑位掩码将每个 tile 组分配给 FP16 或 INT8 计算,同时共享在线 softmax 状态。

推理论文/研究部署/工程
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
Chain-of-Experience:让大语言模型在测试时通过迭代经验持续改进

一项研究提出 Chain-of-Experience(CoE)方法,让大语言模型在测试时通过与自身或环境反馈的迭代交互积累经验,形成超越零样本推理的持续改进循环。

推理论文/研究
03:24
Rohan Paul@rohanpaul_ai
AI 评分 27/100
混合线性注意力LLM中的巨量激活:注意力层前尖峰与层间平台

混合Transformer架构LLM用廉价循环层替代多数注意力层,但保留的少数全注意力层对模型影响远超其数量占比。在Qwen3.5、Kimi Linear、Nemotron-H和Zamba2中,模型在昂贵回溯层前反复产生异常巨大的内部数值,移动或增加该层会相应改变这些极端值的分布。

推理论文/研究

8月17日

星期一 · 2 条
19:24
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
ParaTempo:基于时间置信度的并行推理加速框架

ParaTempo 提出一种免训练的非同步并行推理框架,通过分支级时间置信度动态剪枝、提前退出和计算重分配,在数学与科学推理基准上将平均延迟降低 21.8-32.2%,总 token 用量减少 18.1-30.3%,同时保持有竞争力的准确率。相比 token 级和瞬时信号,时间置信度对未来分支收敛具有更强的时序稳定性和预测能力。

推理论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
同策略蒸馏中的泛化双面性:一项关于大语言模型 OPD 的受控研究

一项受控研究发现,同策略蒸馏(OPD)迁移的是教师的推理行为而非具体答案,训练难度几乎无关紧要,甚至教师未解出的问题也有价值。迁移效果强烈依赖师生模型的同源关系:同源配对在跨语言、推理深度乃至其他领域均能逼近教师,而异源配对主要拟合训练分布。这种广泛覆盖是一把双刃剑,多教师组合会引发能力间的混合依赖跷跷板效应。

推理数据/训练论文/研究
已加载 40 条