阿里提出将智能体上下文管理视为编程任务的新方法:以追加式事件日志和沙盒持久 Python 内核为基座,工具输出与检索历史绑定为类型化变量,由模型编写代码检索和转换状态。配合逐出索引实现精确回溯,Qwen3.8-Max 在 LongMemEval_S 达 94.8%,BEAM_10M 达 73.1%(超最佳系统 5.1 分),LOCA_256K 达 86.7%。
阿里提出将智能体上下文管理视为编程任务的新方法:以追加式事件日志和沙盒持久 Python 内核为基座,工具输出与检索历史绑定为类型化变量,由模型编写代码检索和转换状态。配合逐出索引实现精确回溯,Qwen3.8-Max 在 LongMemEval_S 达 94.8%,BEAM_10M 达 73.1%(超最佳系统 5.1 分),LOCA_256K 达 86.7%。
微软等机构提出 AutoSaddler,将智能体框架视为代码,通过失败轨迹离线自动生成补丁,优化提示词、工具配置和控制逻辑。在 GAIA2、SWE-Bench Pro、Terminal-Bench 2.0 上分别提升 9.0、9.6、10.0 分。研究显示深度调试优于浅层反思,定向编辑优于无约束编辑。
Task-CoEvolve 提出一种高效的大语言模型 harness 优化方法,通过让验证任务与 harness 共同演化,解决固定验证集评估成本高的问题。该方法利用方差加权采样聚焦能力边界附近的任务,并基于采样概率估计全量集分数。在在线文本分类和 Terminal-Bench 2.1 上,Task-CoEvolve 匹配全量集搜索的最终性能,同时将优化过程中的评估次数减少 80%。
摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,基于旗舰级AI训推一体智算卡MTT S5000构建“Prefill As a Service”新范式,面向AI Agent、代码生成、超长文档分析等长上下文推理场景。
SK 海力士在 Hot Chips 2026 大会上披露下一代 HBM 封装路线图,计划借助英特尔 EMIB 等先进封装技术,未来进入 3D 封装阶段。其 HBM4 带宽超 2TB/s,功耗效率较 HBM3E 提升 40% 以上,容量最高 48GB,并正研发混合键合与 I-HBM 局部热点缓解技术以应对散热挑战。
Netflix 每周运行数十万次节目级推荐解释的 LLM 评判器,服务数百万移动端会员,并将其视为包含诞生、训练、部署、监控四阶段的完整生命周期。训练阶段采用推理对齐的规则调优,以元评判器输出为学习信号;部署时同一评判器承担质量门控与反思生成双重角色。五周 A/B 测试显示,相比无解释对照组,浏览到播放的转化率提升,且未出现质量相关问题。
清华与康奈尔新研究指出,智能体记忆可能将可恢复错误固化为持续错误。论文借鉴数据库事务思想提出 ACID-Agent,将探索-执行-验证循环视为事务,仅提交验证通过的结果,失败尝试不进入记忆与工作区。验证失败时智能体重试且不携带失败状态,长期运行可靠性更取决于控制提交与重试而非单纯提升推理能力。
Google DeepMind 提出 Pandora's Router,将模型路由决策建模为潘多拉魔盒问题:先给每个专家模型一个廉价粗略评分,仅当额外信息的预期价值高于成本时,才付费运行更强评估器。在 MATH、RAG 和 EmbedLLM 基准上,其综合路由遗憾与检查成本最低或并列最低;EmbedLLM 上平均检查成本从 1.986 降至 0.075,路由遗憾从 0.370 降至 0.311。
Netflix 自研的基于语言模型的推荐系统 GenRec 在离线测试和约 10% 流量的四周 A/B 实验中均优于现有生产系统,排名质量离线提升约 1.6%,第二阶段训练所需标注数据减少约 40 倍。
本文通过时序实验逆向工程 RTX 4090 上全局加载指令的硬件路径,揭示 L1/L2 缓存的切片函数与组索引均为地址位奇偶校验函数,并包含非线性 (a >> 15) mod 9 项。L2 为 16 路组相联,按物理地址索引和标记;L1 则使用虚拟地址。作者还给出了 36 切片(4090)与 48 切片(L40S)的切片预测函数代码。
阿里与字节新论文指出,AI智能体性能瓶颈已从模型推理转向工具、内存、环境与模型的协同。基于10个智能体应用的AgentSysBench测试显示,任务感知调度降低延迟29–40%,通信感知放置提速4.5倍,状态卸载节省内存4.6倍,缓存消除35.2%冗余搜索调用。单纯优化token/秒已不够,需将模型、工具、内存与通信统一调度。
蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。
Google DeepMind 新论文将模型路由形式化为潘多拉之盒问题,即检查成本高昂时的最优搜索问题。在高斯信号模型下策略有闭式解,可判断每个专家和输入是否值得细化估计。在多 LLM 基准、检索增强专家和可变推理时长的 LLM 上,Pandora's Router 以远低于昂贵估计器的调用频率达到穷举估计质量。
FlashPrefill V2 将稀疏注意力从算法原型推进到实用化长上下文服务,通过均值校正项抑制近似误差,并采用 PackGQA 内存访问、warp 特化和 pingpong 流水线,对齐 FlashAttention-3/4 并支持 FP8 推理。
研究团队提出量化感知修复(QAH)替代量化感知训练(QAT),以恢复压缩并量化至 4 位的 LLM。在 GPT-OSS 120B 压缩至 60B 并量化为 MXFP4 的流程中,QAH 学生模型在 9 项基准的 7 项上匹敌或超越其 bfloat16 来源,权重内存减少约 4 倍,并以 Hypernova-60B 开源发布。
Llama-Mobile 提出一种面向视觉语言模型(VLM)的量化框架,无需访问训练设置,利用模型自身生成训练数据,并采用新颖的 2.7 位/参数格式,支持在 Arm CPU 上高效推理。该框架将 Llama 3.2 11B Vision Instruct 模型压缩至 3.7 GB(8 位激活),在标准视觉问答任务上保持强劲性能。
Daedalus-150M 是一款专为 CPU 推理设计的小语言模型,18 层中仅 6 层使用全注意力,其余 12 层采用短卷积以固定内存占用。该模型在 59.9B tokens 上从头训练,五任务基准得分 47.31,超越 GPT-2 124M、Pythia-160M 等更大模型,4-bit 文件小 6.3%,2048 tokens 上下文解码快 1.76 倍。
LMSYS 团队针对 1.6 万亿参数的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上通过场景化服务配置逼近 B300 性能。单节点 H20-141GB 参考实现达 271 output tokens/s,与 B300 的 383.7 tokens/s 性能差距缩小至 1.42×。
DAIR.AI 推荐一篇关于生产级智能体成本分析的重要论文。研究发现,在十个被观测的智能体应用中,非 LLM 组件在五个应用中主导了延迟。论文提出任务感知服务可将延迟降低 29-40%,状态卸载可减少 4.6 倍内存,工具结果缓存可消除 35.2% 的冗余搜索调用。
PTXBench 基准在 H100 和 B200 GPU 上评测 LLM 使用架构特定 PTX 优化 GPU 内核的能力,覆盖 GEMM 与注意力负载的功能正确性、目标指令执行及相对前沿库的加速比。评测显示各模型在复杂注意力反向负载上成功率大幅下降,且无一能持续匹配前沿库性能。研究团队用监督微调适配 Qwen3.6-27B,修复条件训练改善部分任务但泛化仍不均衡。
智能体记忆并非可随意开启的功能,而是需按模型能力校准的剂量。强模型适合注入完整指南集,DeepSeek-V3.2(671B MoE)任务完成率提升+9.5个百分点;较弱模型采用精选检索效果最佳,gpt-oss-120b(117B MoE)提升+16.1pp且仅增加+5% token。该方法无需更新权重或人工标注,通过从智能体过往轨迹中蒸馏指南并在推理时注入实现。
哈佛与芝加哥团队分析 9,174 个模型、6.12B 次请求的一年生产数据,发现高效 LLM 服务更依赖理解流量变化与重复模式,而非单一调度器。99% 的缓存复用来自 15 分钟内的重复请求,均匀负载均衡会削弱该优势。研究建议路由、缓存与容量规划应基于真实流量历史,而非短时或合成基准。
Ventor-QTest 提出一种无需目标 API 概率信息的复合黑盒审计方法,通过重复请求与长序列组件分别报告平均保真度损失(AFL)和极端保真度损失(EFL)。在七组路由快照中,EFL 随任务暴露增加与 Terminal-Bench 通过率下降同步出现,提示审计长程智能体任务时应联合报告 AFL 与 EFL。实现已开源。
TileMix 提出一种以 tile 为中心的精度路由内核,将注意力矩阵划分为硬件对齐的 score tile,通过紧凑位掩码将每个 tile 组分配给 FP16 或 INT8 计算,同时共享在线 softmax 状态。
一个由 AI 生成的修复方案在 Snowflake 公共仓库中引入了工作流注入漏洞,并在数天内被 Wiz Red Agent 发现。该漏洞导致 Snowflake 的 Jira 系统遭到入侵。Wiz Red Agent 已发布完整研究分析。
TinyCast 是一个无注意力机制的零样本预测器,仅用 146,505 个参数即可输出预测分布,其核心思路是在该规模下,上下文的周期结构值得计算而非学习。它比 GIFT-Eval 榜单上所有参数可查的零样本模型都小,在概率准确度上定义了规模-准确度前沿。
MIT 新论文提出一种数学框架,用于表示、操作和编译深度学习架构,为模型提供统一的描述语言,精确涵盖张量操作的连接与行为。该表示可一键转换为图表、机器可读图或可运行的 PyTorch 代码,旨在最终让软件自动分析和优化模型架构,减少人工操作。论文见 arxiv.org/abs/2604.07242。
Nanbeige4.2-3B 是 3B 参数智能体模型,采用 Looped Transformer 架构复用单层堆栈进行第二次前向传播以增加有效深度。研究者在 Apple Silicon(MPS)上发现五个独立 bug 阻碍其开箱运行,并引入 chunked-prefill 策略将可用上下文宽度扩展 2.7 倍。
Zero-Mem 提出一种无需 LLM 参与的记忆管理方法,其记忆操作使用零 LLM token,相比最快基线延迟降低 57.6%。该方法保留原始交互历史,构建实体上下文图和时间层级两种非生成视图,查询时通过确定性路由检索证据并校准结果,使最终问答外的所有记忆操作均不消耗 LLM 调用或 token。
研究为LLM智能体控制路径提出“ready-cohort”边界以量化GPU执行机会。在851会话轨迹回放中,固定分区份额F=30.19%,精确离线份额P*=43.00%,精确打包可恢复固定窗口边界损失的81.83%。将GPU决策保留在设备端,在全部36种配置中均更快,行中位数比率介于1.19x至2.39x。
百度智能云网络团队与中国科学院计算机网络信息中心合作的论文被计算机网络顶会NSDI'27录用,该届投稿355篇、录用60篇。论文提出BvS虚拟交换机的新一代数据面Sonata,采用软件为中心路线,以标准化接口卸载稳定流量、软件处理复杂流量。生产环境中Sonata将软件CPS提升2.13至2.51倍,开启硬件卸载后提升4.3至11.5倍,热升级抖动控制在数百微秒,已部署于数十万台服务器。
Google 新论文提出 PROMPTS,用智能体将 LLM 基础设施优化从穷举搜索转为先理解瓶颈再定向搜索。其 Analyzer Agent 将瓶颈分为计算、内存或通信三类,Proposal Agent 生成三种 TPU 并行映射方案。在 8 个生产负载中,人工验证配置每次都出现在首批方案里,7/8 情况下是首个被测试的配置。
研究团队为 macOS 虚拟机中的 Metal 能力查询构建进程级兼容层,使 llama.cpp 能选用更新的 Metal 内核。在 M1 Ultra 上,TinyLlama 1.1B 的提示处理速度提升 11.08 倍、token 生成提升 16.36 倍,接近裸机性能的 98%;Gemma 4 12B 的提示处理与生成速度分别提升 7.20 倍和 14.54 倍。
LMSYS 团队提出 Unified Radix Cache,用单一 token 键控 radix 拓扑统一管理混合模型的 FULL、SWA 和 MAMBA 组件缓存,各组件独立执行路径、滑动窗口和检查点复用语义。
UniProbe 提出一种轻量级、统一的可学习检测器,通过单次前向传播对冻结 LVLM 的异构计算轨迹建模,利用 GNN、ViT 和 GRU 交替处理空间、关系与序列证据,实现 token 级幻觉定位。在多种 LVLM 主干上达到 SOTA 检测性能,解码时可将物体幻觉降低最多 55%,延迟仅为标准生成的 1.06 倍。
论文主张智能体安全不应依赖训练阶段对齐,而应由系统运行时强制执行的契约保障,涵盖预防与证据两个层面。作者基于52起安全事故、31个虚假完成案例、12个系统轨迹审计及28,560篇论文分析,指出训练与部署研究存在8–12倍失衡,并提出Agent Trajectory Schema与Evidence Chain作为研究方向。
Meta 新论文发现,强量化会让推理模型在已得出正确答案后反复自我怀疑,过度思考失败率最高升至 52%。研究在数学、编程和科学任务上测试了 5 个推理模型(1.5B 至 32B),对 50 个犹豫词施加小幅惩罚即可将推理长度缩短 12% 至 23%,且常能保持或提升准确率。
微软对 13.5M 次 GitHub Copilot 会话的生产轨迹分析显示,87% 的 LLM 调用来自智能体自身而非用户。KV 缓存命中率在单轮内从首次调用的约 45% 升至第三次起的 92–94%,模型切换时骤降至 8%。论文提出基于轮次和会话级特征的轻量预测器,可捕获 86–90% 的总空闲时间,表明编码智能体基础设施应按轮次调度工作流状态,而非请求级策略。