LAION 团队发布 LAION-BVD,一个包含 1.3B 条平台视频 URL、下载 80M 段视频、总时长 1000 万小时的大规模开放视频数据集,面向视频、音频和图像多模态预训练。基于该数据训练的模型在视频-文本和音频-文本基准上表现具竞争力,且性能随训练或模型规模提升而持续增长。数据集已向研究社区开放。
LAION 团队发布 LAION-BVD,一个包含 1.3B 条平台视频 URL、下载 80M 段视频、总时长 1000 万小时的大规模开放视频数据集,面向视频、音频和图像多模态预训练。基于该数据训练的模型在视频-文本和音频-文本基准上表现具竞争力,且性能随训练或模型规模提升而持续增长。数据集已向研究社区开放。
Meta^n 提出一种固定元操作 Ω 并对其输入递归的自我改进方法,将元深度从约两层扩展至由收敛决定的动态深度。在两种骨干模型上,Meta^n 在全部八个基准家族上超越此前自我改进智能体,其中在 ARC-AGI-2 上唯一取得非零分数。消融实验显示,递归收益主要来自各层传递给下一层的条件,且深度增加时会涌现出不同层角色。
Recuris 提出递归经验-工作记忆架构,让工作记忆跟踪任务进度并引导技能选择,将执行转化为结构化证据,由固定元智能体对技能记忆进行局部验证更新,形成有界递归演化循环。
随着大语言模型从语言生成器进化为可执行复杂长程任务的自主智能体,个体智能面临组织能力上限。论文提出系统智能概念,即智能体系统将多个智能组件组织为协同整体的能力,并引入Graph Engineering这一新兴范式,通过构建表示任务、智能体和系统状态的显式动态图结构,为组织复杂目标、编排异构智能体、建模系统动态及支持可扩展智能体演化提供统一基础。
SemaPLC是一个项目级、验证门控的智能体框架,仅在外部检查确认规范、编译及实时运行行为均通过后才宣告任务完成。在117个独立POU任务上,其于全部七款模型中取得最高严格验证通过率(均值72.6%);在65个需在真实项目中编译运行的任务上,其动态行为得分52.2,远超基线模型的22.4至31.4。该框架已开源。
FlowEvo 提出一种免训练框架,让工作流与技能在推理时协同进化:将成功工作流编译为可调用技能存入持久库,并抑制引发负迁移的技能。
Anthropic 发布两项实验,让 Claude 模型(Mythos Preview 和 Opus 4.8)参与早期药物发现。针对 16 个靶蛋白,Claude 在 15 个中成功 14 个,1,320 个设计中 354 个实际结合靶点,命中率 26.8%,高于行业通常的 10%-15%。
宾州州立大学研究显示,AI 系统压缩上下文时平均仅 17% 的会话约束指令能幸存,压缩后规则遵从率大幅下降,多数压缩方案甚至不如不压缩。研究推出 COMPINT 评测套件,并发现基于 Qwen3.5-9B 的附加模块无需训练即可将指令保留率提升至 90% 以上,该模块与评测套件已开源至 GitHub。
HiFi-BRep 提出一种新型框架,通过拓扑感知编码器消除填充噪声与特征污染,并以单阶段解码器并行预测几何与拓扑,将流形约束嵌入可微学习目标。实验表明,该方法在结构有效性与几何保真度上显著优于现有最先进方法,代码与模型已公开。
How many agent skills are actually out there? There are ~3.8M SKILL.md files across 282,200 public GitHub repositories, ...
Anthropic 将 SKILL.md 格式发布为开放规范九个月后,GitHub 上已有约 380 万份 SKILL.md 文件,分布于 28.22 万个公共仓库。研究将其全部挖掘为数据集 GitSkills,按内容去重后得到 187.8 万条不同技能,并以单个 SQLite 文件发布,包含 front matter、文件夹内容和提交历史。
Nanbeige4.2-3B 是 3B 参数智能体模型,采用 Looped Transformer 架构复用单层堆栈进行第二次前向传播以增加有效深度。研究者在 Apple Silicon(MPS)上发现五个独立 bug 阻碍其开箱运行,并引入 chunked-prefill 策略将可用上下文宽度扩展 2.7 倍。
PRM-as-a-Judge 1.5 发布,将 rollout 视频转化为密集进度曲线并派生多项细粒度指标,在 1.0 基础上新增三个指标,分别刻画失败侧进展、回撤后恢复与成功侧执行质量。基于基准测试的 rollout 视频,该工具包对具身模型进行了综合评估,并推出 RoboPulse++ 以检验过程奖励模型(PRM)的可靠性,同时开源了包含基准、指标实现与可视化工具的评估套件。
一项研究对比了十款 LLM 与 26 款嵌入模型在 37 项任务上的表现,两者综合性能几乎持平(最佳 LLM 77.6 分 vs. 最佳嵌入模型 77.2 分)。但 LLM 成本高昂,单次基准测试最高贵 1,431 倍,且推理 token 占其推理成本的 28% 至 81%。研究建议:相似度、分类和聚类用嵌入模型,推理密集型检索用 LLM。
SKILLER 提出一种自然语言驱动的强化学习框架,自动为小模型生成执行器专属技能,以降低 Codex、OpenClaw 等智能体框架部署真实任务时的高推理成本。
研究团队提出提示式注视目标估计(PGE)任务,并发布配套数据集 Gaze-Co 与首个专为该任务设计的模型 GazeAnywhere。GazeAnywhere 通过文本或视觉提示(如“穿红衣服的男孩”)指定分析对象,将主体定位与注视估计整合为端到端流程,在多个 PGE 基准上达到最优性能,并已在 GitHub 开源。
TSDS-Toolbox 发布,这是一个用于度量时间序列数据集相似度的统一框架,旨在解决现有实现碎片化、难以扩展的问题。该工具箱支持系统化、可复现的相似度方法比较,并允许用户灵活添加自定义数据集、相似度方法和下游时间序列任务。其有效性已在多种实验设置下得到验证,工具箱现已公开可用。
Ego-OSCAR 是一款开源硬件、低成本的头戴式立体惯性采集设备,单台物料成本低于 200 美元,仅使用商用组件和 3D 打印部件。设备搭配硬件同步全局快门立体相机、6 轴 IMU 和嵌入式 Linux SBC,并开源完整软件栈及约 550 小时带同步 IMU 的日常室内环境第一视角立体视频。数据集提供开放词汇动作标注和逐帧 3D 手部重建,旨在降低大规模众包第一视角数据采集门槛。
Zero Train–Inference Mismatch — now for linear attention, and under async RL 🎯 We got bitwise-exact trainer/generator p...
小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。
LLMRouter将LLM路由统一表述为包含上下文编码器、模型编码器、评分函数、决策规则和学习信号的序列决策过程,并构建自动化监督构建与评估管线。其推出的xRouteBench基准覆盖通用、记忆增强、视觉、时间序列及个性化路由任务,开源基础设施集成16种以上代表性路由器。实验显示,学习型路由器相对最强固定模型基线提升14.6%。
Anthropic 与 METR 联合推出 MirrorCode 基准,要求 AI 在无源码、无联网条件下端到端重写完整程序。Claude Opus 4.7 用 14 小时、$251 重写了约 16,000 行 Go 代码的生物信息学工具 gotree,而人类工程师预计需 2–17 周。该基准单次运行最高花费 $2,600,AI 连续工作 19 天,目前 22/25 个目标程序已开源。
Omega-S 是一种仅基于权重矩阵的即插即用惩罚项,无需先前任务数据、Fisher 矩阵或旧权重副本,在现有训练循环中仅需三行代码,且每步开销增加不到 4%。
TriGlue将分子胶设计建模为三元复合物生成问题,提出受生物学启发的生成框架,分两阶段完成:SE(3)-等变界面估计模块预测几何约束的蛋白-蛋白界面,界面条件三元流匹配网络联合生成分子胶并预测组装三元复合物的刚体变换。实验表明TriGlue能生成化学有效分子和合理三元复合物,代码已开源。
Very interesting paper on recursive self-improvement. The whole stack is released. Machine learning engineering gives re...
腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。
ReToken通过一个可学习的嵌入token作为检索目标,从预填充的视觉KV缓存中筛选与查询相关的稀疏视觉token。在Visual Haystacks基准上,ReToken使Qwen3VL-8B提升13.4分、InternVL3.5提升12.4分;在LVBench上零样本迁移至长视频任务,为Qwen3VL-8B带来8.0分提升。
研究团队推出 OpenMLE 开源全栈系统,并基于其训练出 35B 参数的元进化智能体 Frontis-MA1。
Echoverse 将环境、任务与验证器绑定为“世界”,通过共演化循环让每次分级运行同时用于修复环境和训练模型。在十二个环境中训练的 9B 模型在十四个评估分项上提升显著,与指导它的更大前沿模型差距在十四分以内。同一世界可直接用作强化学习环境,结合接地验证器与密集逐步评判器的奖励将留出集评分从提升至;研究还发布了四个环境作为基准,含应用、种子数据与评分器。
DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。
东京大学等机构提出一种无需干净 RGB 监督的 3D 感知神经隐式融合模型,可在暗光下将极噪 RGB 观测与近红外(NIR)线索在 3D 空间中隐式融合,恢复干净 RGB 图像。该方法引入 NIR 调制的位置编码和 Color Code MLP,解决噪声过拟合与 NIR-RGB 映射不适定问题,在合成与真实多视图数据集上优于现有方法,并能泛化至不同噪声水平。代码与数据将公开。
一项新研究通过“影子评估”测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。
Kernel Forge 是一个开源智能体框架,能直接改写未修改 PyTorch 模型的 CUDA 内核,覆盖视觉、扩散和 LLM 任务。它用蒙特卡洛树搜索(MCTS)替代线性生成-修复流程,在 NVIDIA DGX Spark(GB10 GPU)上以每内核 50 次迭代优化了 4 个模型的 14 个内核,使其超越 PyTorch 基线。性能提升主要来自框架结构和原位集成,而非更强的模型。
研究者提出 Modus,一种纯解码器架构的任意模态映射模型,无需特定模态的头部、损失函数或任务管线即可对称处理所有模态的输入与输出。Modus 支持通过中间模态进行链式生成,以及利用另一生成模态对自身输出进行交叉模态自验证。该模型在多项基准测试中与专用模型和多任务基线表现相当,所有材料已开源。
Wonder 是一个通用视频世界模型,支持用户通过移动摄像头实时、交互式地探索由图像或条件视频构建的可玩世界。该模型通过系统级协同设计控制方法、记忆机制和训练策略,引入密集坐标场的摄像头条件化方法,以及基于稀疏注意力的高效记忆机制,实现了对未观测区域的发现和已观测区域的回访。Wonder 能以 16 FPS 合成多样化的分钟级视频,并在长序列生成中保持连贯的几何、外观与动态。
HiFi-UMI提出一套软硬件协同设计的便携式数据采集系统,在无外部追踪基础设施下达到毫米级末端执行器精度。基于该系统采集的数据,策略在零机器人后训练下直接部署于真实机器人,在三个骨干网络上与域内遥操作成功率差异不超过3个百分点,最强策略在精密插入任务上达到100%成功率。研究团队开源了HiFi-UMI-2K数据集,包含微秒同步、超宽视场演示数据。
投机解码通过轻量草稿模型并行提议并由目标模型验证,以加速大语言模型推理。新研究对有损验证方法引发的分布改写进行原理性分析,将其归为截断式与协作式两类,并构建诊断评估框架。结果显示截断式方法因分布失真可能显著劣于真实截断采样基线,协作式验证则需控制草稿概率超调以防止低质量输出。
Metis 提出“记忆基础模型”概念,将持久且动态演化的记忆状态直接内置于模型骨干,通过前向计算自主完成信息的存储与利用,无需外部模块。其在线记忆维护无需梯度,仅需一次前向传播即可更新,推理时所有权重保持冻结。实验显示 Metis 具备原生记忆能力,项目与模型权重已开源。
月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。月之暗面已开源 KDA 内核、vLLM 实现及模型权重。