Prime Agent 发布技术报告,该 harness 曾助 Opus 5 在 ARC-AGI-3 达 95.5%。其核心机制为记忆层级:模型权重与活动上下文之下,设持久 IPython 会话及磁盘存储的历史、技能与提示词库,模型通过代码在各层级间移动状态。长输入作为 REPL 变量留存,供智能体搜索与转换,将长上下文工作转为信息管理问题。
研究团队提出 LongWoF-Bench,含 778 个可机器验证任务,覆盖代码生成、智能体环境合成、数学推理与规则遵循。在 252 个经验证的 Opus 轨迹上,进化得到的 EvoMap 基因在全部 7 个模型中比 Skill 平均高出 8.7-15.5 个百分点,且优势扩展至消费级模型;对 Claude Opus,基因复用还多完成 39 个任务,并减少 9.9% 的推理 token 消耗。
Google DeepMind 新论文提出“Recirculation”方法:推理时将深层激活的一小部分混入浅层,权重不变,即可恢复模型在长上下文中丢失的部分状态。在 Gemma3 上,10 个语言建模数据集中 9 个困惑度下降,12B 模型最高降 35%,但多项选择收益有限;该方法无需重训,但代价是预填充无法并行,且收益不跨模型家族迁移。
一篇论文提出用“对抗式审查”规则提升AI智能体代码审查:审查者与批评者需用代码证据回应分歧,而非简单互相认同。在LiveCodeBench上,3个智能体达87%准确率,优于5智能体版本的82%;在真实PR审查中,该规则将F1分数从0.457提升至0.533,跃居首位。
Please welcome to the world a beautiful new geometric object, to do with a problem i’ve always loved. claude really cont...
摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,基于旗舰级AI训推一体智算卡MTT S5000构建“Prefill As a Service”新范式,面向AI Agent、代码生成、超长文档分析等长上下文推理场景。
Please welcome to the world a beautiful new geometric object, to do with a problem i’ve always loved. claude really cont...
一篇论文提出用主动推理让AI智能体显式决策每次澄清、检索或工具调用是否值得其token与延迟成本。受控测试中,定向澄清将验证器合规率从0.0417提升至0.375,平均token使用从约112增至219。建议为智能体增加显式上下文获取层,而非将其视为自动行为。
Google DeepMind 提出一种免训练方法,通过让模型自身指导架构修改来进化模型架构,或可启发更稳健的递归自我改进。该方法在推理时引入“再循环”机制,将激活反馈回模型自身,无需重新训练即可追踪信念状态,生成成本保持平稳。在 Gemma3 系列上,自适应变体将困惑度降低 23%,GSM8k 准确率提升 21%,且原始权重冻结。
Apodex Discovery 推出 TRACES 基准,评估 AI 系统能否通过证据充分、可审计、可修复的调查得到正确结果。它同时检查最终答案与外部可见轨迹,用 HDS6 盲评六种过程能力(工具、修复、备选解释、连贯性、证据、适用边界)。在 434 条缺陷轨迹上,加入修复说明使环境结果得分平均提高 0.155,但实验缺少匹配对照组。
TRACES 是 Apodex Discovery 框架下的现实基准,评估 AI 系统能否通过有证据支撑、可审计且可修复的调查研究得出正确结果。在临床试验复现案例中,修复后的过程评分从 0.83 升至 0.95,而数字未变。该基准区别于仅测最终答案的传统基准,将评估对象从答案扩展至完整调查链:目标→规划→行动→观察→验证→修复。
一项新研究指出,Sora、Genie 3 等现有世界模型仅建模物理层,忽略人类信念、意图等心理状态,导致预测错误。研究者提出“Mental World Modeling”(MWM)框架及免训练实现 MENTIS,并构建含 448 个场景的 Menti-Bench 评测集。在八款模型测试中,完整 MWM 流程将 F1 分数从直接回答的 63.3 提升至 87.9,人类基准为 98.5。
蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。
Google DeepMind 新论文将模型路由形式化为潘多拉之盒问题,即检查成本高昂时的最优搜索问题。在高斯信号模型下策略有闭式解,可判断每个专家和输入是否值得细化估计。在多 LLM 基准、检索增强专家和可变推理时长的 LLM 上,Pandora's Router 以远低于昂贵估计器的调用频率达到穷举估计质量。
FlashPrefill V2 将稀疏注意力从算法原型推进到实用化长上下文服务,通过均值校正项抑制近似误差,并采用 PackGQA 内存访问、warp 特化和 pingpong 流水线,对齐 FlashAttention-3/4 并支持 FP8 推理。
现有记忆基准多只评估信息提取与检索,却忽视了检索到的记忆如何重塑模型推理并影响当前任务表现。为此研究者推出 MemTrapBench,覆盖推理固着与信念扭曲两类认知陷阱。实验显示,所有被测记忆策略均不如无记忆设置,最强方法性能下降也超过 10%;新提出的 AdaptiveMem 推理期方法可缓解这些陷阱,同时保持或提升标准记忆基准上的表现。
亚利桑那州立大学团队发表立场论文,反对将大语言模型在输出答案前生成的中间令牌(ITG)称为“推理痕迹”或“思考痕迹”,认为这种拟人化并非无害隐喻,而是会混淆模型本质、误导有效使用并催生可疑研究。论文汇集多项质疑该解读的实证工作,呼吁社区避免此类拟人化表述。
Co-RL 提出一种无需人工标注的多智能体强化学习框架,多个不共享参数的模型通过彼此提供的奖励信号进行协同优化。实验表明,增加群体多样性(异构模型族、规模及改写样本)可减少自强化反馈循环中的相关错误,在七个纯文本基准上平均提升 3.0-8.6%,在四个多模态基准上提升 2.3-7.2%,性能匹配或超越有监督方法。代码已开源。
SPADE 提出自我对弈强化学习框架,让单个 LLM 同时扮演环境设计者和推理智能体,前者用 Gym 风格接口编写可执行长程训练环境。通过优化推理智能体的遗憾信号,环境设计者能生成处于能力边界且可行的环境。在 30B 参数规模下,SPADE 在八个基准上平均超过最强固定环境基线 +5.3,工具使用场景提升 +5.7 和 +13.9。
Apodex 推出 TRACES,号称全球首个衡量“探索式AI”的基准,将AI评测从“已知答案的检索”转向“无答案问题的完整调查过程”。该基准由创始人陈天桥提出,定义了六项能力,并发布“探索式智能”定义、评估标准及求解者招募。
Most AI benchmarks test retrieval — can a model find the known answer? However, the hardest problems in science require ...
Most AI benchmarks test retrieval — can a model find the known answer? However, the hardest problems in science require ...
LMSYS 团队针对 1.6 万亿参数的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上通过场景化服务配置逼近 B300 性能。单节点 H20-141GB 参考实现达 271 output tokens/s,与 B300 的 383.7 tokens/s 性能差距缩小至 1.42×。
腾讯混元Hyra在数学推理上取得四项新进展:将常宽体下界从0.380799w³提升至0.411040w³(达Meissner最优猜想值的97.9%);Beurling–Ahlfors系数从1.575改进至1.523958;部分Hadamard矩阵渐近计数扩展至近二次尺度;算子交换子逼近成本从Tao的O(log⁵(1/ε))降至O(log³)。相关结果已开源。
Anthropic 用 Claude Mythos Preview 和 Opus 4.8 为 15 个蛋白靶点设计全新蛋白结合剂,14 个靶点成功。Claude 自主选择结合位点并调用多个专业模型优化,经湿实验验证,单设计命中率达 22%~35%,高于行业典型的 10%~15%。Anthropic 承认这只是药物研发极早期步骤。
Many drugs work by binding to a specific target in the body and blocking or changing what it does. An important first st...
同一事件,精选展示《Claude 如何加速蛋白质设计与分析化学研究》TAMP-Nav 提出统一框架,将具身导航重构为 2D 视觉提示任务,让 VLM 仅需选择 2D 像素即可由 SLAM 控制器执行,并引入选择性推理与锚点轨迹记忆机制,通过 GRPO 双层对齐实现高效导航。该方法在 R2R-CE 基准上取得 66.2% SR 的 SOTA 成绩,且仅需 90k 训练轨迹,兼具高运行效率与样本效率。
在线策略蒸馏(OPD)假设教师奖励能恰当反映推理进展,但实际中二者常冲突,推理进步明显的步骤可能因偏离教师输出而获较低奖励。为此研究者提出 R2-OPD,构建教师奖励与独立估计进展奖励的轨迹内双排序,在排序不一致时抑制蒸馏奖励,减少与推理进展冲突的监督。该方法在推理性能上较标准 OPD 持续提升。
SparsePR 提出免训练块稀疏注意力方法,结合响应耦合分区与探针拟合残差重建,在四个视频生成与世界模型上持续降低注意力重建误差。该方法在 22.0%-26.0% 实际执行对密度下保持生成质量,实现 1.48x-2.61x 端到端加速。消融实验显示探针拟合贡献主要误差降低,响应耦合分区在有限探针预算下改善重建效果。
Anthropic 公布两项实验:Claude(Mythos Preview 和 Opus 4.8)针对 15 个靶点设计蛋白质结合剂,成功 14 个,命中率达 22.6%-35.1%。
另有 2 家信源报道X:Rohan Paul (@rohanpaul_ai)X:Anthropic (@AnthropicAI)一项大规模实证研究考察了 GRPO 在多语言和非英语环境下的表现,覆盖多种基础模型、训练语言及推理语言奖励设置。研究发现,以母语进行推理训练与英语推理训练之间的性能差距很小,表明 RLVR 在非英语场景下同样有效。该研究为多语言推理模型的强化学习训练提供了重要参考。
一项研究用三个前沿混合专家模型(Alibaba、OpenAI、NVIDIA,各 3.6-4.0B 激活参数)微调其用低资源语言推理,发现准确率基准几乎无变化且本身是噪声——仅改变随机种子就能让分数波动 7.7 分,超过所有数据与配方效应。
针对多奖励强化学习中固定加权求和导致已饱和目标持续占用梯度预算的问题,研究者提出SA-MRPO,对每个奖励目标独立标准化,并按批次级饱和估计自适应折扣其贡献。在数学推理的15项基准对比中,SA-MRPO在12项上优于GDPO,AIME24最高提升5%;自适应推理五项基准平均提升3.8%,AMC23最高提升9.2%;代码基准通过率最高提升2.3%,同时保持已满足目标性能。
一项针对 ProcessBench 轨迹的研究发现,模型上下文中已有的“审计→修复”完整流程会降低验证器的误报率:在 15 种模型与措辞组合中全部生效,误报率相对长度匹配的对照组下降 2.8 至 11.5 个百分点(降幅 9%–25%)。信号检测分析显示变化源于判断阈值而非判别能力,且人工复核 50 例误报中 82% 确属错误,因此该偏移在该工作点未必有害。
新基准 R^3-Bench 在数学、竞赛编程和抽象推理中,以共享预算评估六题套件,覆盖无工具与智能体两种场景。对六款模型的 72 个主表单元,离线经验 oracle 均值在所有单元达到或超过竞赛均值,其中 71 个单元严格更高;中等无工具压力下,四款模型的均等分配回放也超过竞赛表现。轨迹诊断显示策略更新有限且失败模式随压力变化,揭示模型在共享预算下实现能力与表现之间存在持续差距。
TileMix 提出一种以 tile 为中心的精度路由内核,将注意力矩阵划分为硬件对齐的 score tile,通过紧凑位掩码将每个 tile 组分配给 FP16 或 INT8 计算,同时共享在线 softmax 状态。
一项研究提出 Chain-of-Experience(CoE)方法,让大语言模型在测试时通过与自身或环境反馈的迭代交互积累经验,形成超越零样本推理的持续改进循环。
混合Transformer架构LLM用廉价循环层替代多数注意力层,但保留的少数全注意力层对模型影响远超其数量占比。在Qwen3.5、Kimi Linear、Nemotron-H和Zamba2中,模型在昂贵回溯层前反复产生异常巨大的内部数值,移动或增加该层会相应改变这些极端值的分布。
ParaTempo 提出一种免训练的非同步并行推理框架,通过分支级时间置信度动态剪枝、提前退出和计算重分配,在数学与科学推理基准上将平均延迟降低 21.8-32.2%,总 token 用量减少 18.1-30.3%,同时保持有竞争力的准确率。相比 token 级和瞬时信号,时间置信度对未来分支收敛具有更强的时序稳定性和预测能力。
一项受控研究发现,同策略蒸馏(OPD)迁移的是教师的推理行为而非具体答案,训练难度几乎无关紧要,甚至教师未解出的问题也有价值。迁移效果强烈依赖师生模型的同源关系:同源配对在跨语言、推理深度乃至其他领域均能逼近教师,而异源配对主要拟合训练分布。这种广泛覆盖是一把双刃剑,多教师组合会引发能力间的混合依赖跷跷板效应。