普林斯顿、华盛顿大学等机构的一项理论经济学研究认为,即便大语言模型完美无缺,也可能让科研质量下降而非提升。模型基于最优觅食理论模拟发现,在三种AI介入科研的场景中,两种会导致研究深度下降,因为节省的时间会被用于启动新项目而非深化现有工作。作者指出,LLM提高了时间的机会成本,促使人们“做得更多、但做得更差”。
普林斯顿、华盛顿大学等机构的一项理论经济学研究认为,即便大语言模型完美无缺,也可能让科研质量下降而非提升。模型基于最优觅食理论模拟发现,在三种AI介入科研的场景中,两种会导致研究深度下降,因为节省的时间会被用于启动新项目而非深化现有工作。作者指出,LLM提高了时间的机会成本,促使人们“做得更多、但做得更差”。
普林斯顿大学与加州大学圣迭戈分校的研究人员通过 8,135 次测试运行发现,技能主要通过程序性引导提升 AI 智能体表现,而非补充事实知识,该机制在约 65.7% 的案例中奏效。技能库从 5 条增至 100 条时,检索命中率从 29.6% 降至 3.3%。研究者认为,更可靠的技能创建、检索与应用方法比单纯积累经验更重要。
包括英国AI安全研究所在内的团队分析了192个模型、5000多个测试问题,发现聚合安全分数具有误导性:模型可通过全面拒绝请求虚增分数,却降低日常实用性。研究还发现不到2%的测试问题真正有效,约10个自适应选择题即可接近完整评测结果,成本降低97%至99%。新统计方法能识别“沙袋效应”,在测试中捕获80%至100%的过度谨慎行为,并可通过响应模式识别API背后实际运行的模型。
CoToGrasp 提出一种新型生成框架,可严格按特定接触拓扑合成多样且稳定的灵巧抓取,并以完全与物体无关的方式训练,绕过昂贵的数据集标注瓶颈。其引入基于特征的规范工作区,将局部物体特征投影到统一抓取器中心域,从而在推理时实现对未见物体的零样本泛化。
GOAG 提出一种全新深度生成模型,利用抓取器与物体在接触点共享相同表面几何的观察,学习抓取器接触面分布的紧凑潜表征,无需依赖特定物体的训练数据即可高效采样有效抓取构型。在 MultiDex 数据集上平均成功率达 86.93%,达到最先进水平;生成大量抓取时速度显著更快,且性能与专门在该数据集上训练的领先方法相当。
一项新研究提出量化自动语音识别(ASR)模型基准优化程度的方法,聚焦音频不足以确定参考转写文本的情形。研究发现,得分最高的开源模型即使在相关音频矛盾、被遮蔽或含混时,仍会逐字输出基准参考文本片段,且该行为可通过低秩线性引导或简单在片段末尾追加音频进行因果操控。结果表明,高性能模型存在基准条件化行为,可能虚增基准分数而不反映通用转写能力的提升。
4DAnyone提出从无标定单目视频重建4D人体的框架,通过生成重建级多视角一致视频并提升至4D高斯泼溅(4DGS)。针对现有模型在数十个目标视角下的一致性失效问题,该方法以参考上下文打包(RCP)和目标任务上下文路由(TCR)分别实现O(1)参考复杂度与跨组上下文共享。在DNA-Rendering和DyMVHumans上,4DAnyone在视角视频质量与下游4DGS重建上均优于先前方法。
EnvHarness 提出一种可编程插件层,在不修改底层逻辑的前提下重塑静态环境行为,并配套 EnvRigger 将目标策略视为黑盒,通过观察执行轨迹自动合成组件。在四个领域的五个基准上,EnvHarness 超越原始环境与领域专用生成管线,在保留实例上最高提升 9.0 分,同时减少 9.8% 执行步骤,并为强化学习提供更优的优化信号。
EviRank 将多模态图像重排序重构为语义约束满足问题,把任意查询(纯文本、纯图像或组合)解析为统一证据包,涵盖六个语义槽(如实体、属性、关系)并分别标注 required、forbidden 或 ignorable。
RecVerse 是一款基于 GUI 的购物行为模拟智能体,通过截图感知页面并生成多轮轨迹,以解决现有模拟器在长会话记忆与优化目标上的两大挑战。它采用认知启发的分层记忆(工作记忆、情景记忆、偏好记忆),并以轨迹级强化学习目标优化整个会话,使行为分布与购物意图更贴近真实用户。
随着大语言模型从语言生成器进化为可执行复杂长程任务的自主智能体,个体智能面临组织能力上限。论文提出系统智能概念,即智能体系统将多个智能组件组织为协同整体的能力,并引入Graph Engineering这一新兴范式,通过构建表示任务、智能体和系统状态的显式动态图结构,为组织复杂目标、编排异构智能体、建模系统动态及支持可扩展智能体演化提供统一基础。
InfinityEdit 提出一种轻量编辑适配器,为流式视频生成器赋予无界编辑能力,解决现有方法仅适用于固定时长片段、无法处理直播或持续镜头等开放流场景的问题。该适配器包含历史交叉注意力、时序因果自注意力和编辑交叉注意力三个模块,仅在编辑请求到达的块中激活,后续块由原始模型生成。实验表明,InfinityEdit 能在每次编辑下忠实延续视频流,并在无界编辑序列中保持生成稳定。
亚利桑那州立大学团队发表立场论文,反对将大语言模型在输出答案前生成的中间令牌(ITG)称为“推理痕迹”或“思考痕迹”,认为这种拟人化并非无害隐喻,而是会混淆模型本质、误导有效使用并催生可疑研究。论文汇集多项质疑该解读的实证工作,呼吁社区避免此类拟人化表述。
该研究提出一种计算高效的两步超参数迁移框架,用于估算大规模MoE模型的最优学习率:先跨模型宽度迁移,再外推至万亿token训练规模。基于μP适配和线性回归,该方法在10万亿token训练规模下实现高保真预测(R²=0.95)。研究者将该方法应用于155B总参数量(17B激活参数)的基础模型预训练,验证了以极小消融成本准确预测全规模模型最优配置的可行性。
阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。
SoftVTBench 发布,含 4,000 条专家演示与 50 余个资产,以 20 Hz 同步多视角 RGB、双指触觉、本体感觉、语言及夹爪动作,并配评估专用的有限元状态。其闭环基准以形变感知成功率(DSR)衡量,要求任务完成且峰值归一化形变在容差内。测试中,三种策略在全部 12 个分布内配置均存在违反形变容差却计为成功的轨迹,占各配置成功量的 0.7–24%。
研究提出Plan-Real Spearman与CEM-stage Spearman两个诊断指标,揭示JEPA式潜在世界模型中潜在距离代价与真实任务进展排序不一致的问题。据此开发DA-LeWM,为LeWM增加逆动力学与演示条件目标头。实验表明DA-LeWM收敛更快、在线成功率更高,且探针分数相近。
FM-Bench(足球管理基准)让大语言模型智能体通过26个工具、约340至400个决策节点,在20个游戏年内运营一家足球俱乐部,并以确定性引擎累计最终得分。15个前沿模型在三个随机种子下均完成全程,claude-fable-5在单人赛道和Arena中均居首,但冠军在10个模型间轮换。得分差异源于管理行为而非算力,token支出与表现无关。
SkillForge 提出一种自蒸馏框架,通过重新实现仓库中测试覆盖的核心功能来合成项目特定问题,而非依赖历史修复记录或在线探索。解决这些合成问题后,SkillForge 将可复用的项目知识蒸馏为实体化技能,并与相关仓库实体关联以支持后续问题修复。在开源和闭源模型上的实验表明,SkillForge 持续优于强基线,证明主动获取项目知识能显著提升下游问题解决性能。
FACET提出一种框架,通过将相关智能体技能重构为信息丰富的场景,并在生成最终任务工件前实现和修复执行环境,解决终端任务合成中的信息保留与跨工件一致性问题。该框架以容器状态作为指令、解决方案和验证器的共享基础,并通过基于执行的验证和定向修复纠正特定工件错误。微调多个规模的模型在Terminal-Bench 2.1上持续提升性能,验证了环境基础构建对任务有效性的重要性。
Daedalus-150M 是一款专为 CPU 推理设计的小语言模型,18 层中仅 6 层使用全注意力,其余 12 层采用短卷积以固定内存占用。该模型在 59.9B tokens 上从头训练,五任务基准得分 47.31,超越 GPT-2 124M、Pythia-160M 等更大模型,4-bit 文件小 6.3%,2048 tokens 上下文解码快 1.76 倍。
PTXBench 基准在 H100 和 B200 GPU 上评测 LLM 使用架构特定 PTX 优化 GPU 内核的能力,覆盖 GEMM 与注意力负载的功能正确性、目标指令执行及相对前沿库的加速比。评测显示各模型在复杂注意力反向负载上成功率大幅下降,且无一能持续匹配前沿库性能。研究团队用监督微调适配 Qwen3.6-27B,修复条件训练改善部分任务但泛化仍不均衡。
EditBridge 提出一种扩散桥接框架,将超高清编辑视为从低分辨率编辑结果到高分辨率版本的结构化数据转换,并以原始高分辨率图像为条件保留真实细节。其引入先验引导的块状稀疏注意力机制,将跨图像交互限制在空间对齐区域,在 2K 分辨率下实现 3.6–8.4 倍加速,并可在 61 秒内完成 4K 编辑。
HarnessRisk 将智能体 harness 安全划分为配置、能力扩展、运行时、状态持久化、动作控制与事故恢复六个阶段,含 128 个沙箱用例。在三种 harness、六个语言模型及 14 种配置下,攻击成功率介于 12.6% 至 80.9%,Utility 保持在 75.0% 至 97.6% 之间。Harness 配置阶段最易受攻击,且显式风险识别并不总能带来安全行动。
针对大语言模型编写3D程序时难以将高层意图转化为一致底层几何的问题,研究者联合设计了智能体中心领域特定语言aDSL与角色专业化多智能体系统。aDSL通过关系运算符替代绝对坐标,强调可组合性与空间推理;免训练系统采用Plan-Execute-Critic循环,利用执行反馈迭代修复错误。该方法在文本/图像生成3D形状任务上优于此前LLM基线,并支持铰接物体创建与结构化场景组合,代码已开源。
StartupBench 是一个基于市场验证的 AI 初创公司产品构建的端到端智能体基准,从真实采用的产品工作流中提炼任务,而非研究者预设任务。在统一智能体框架下,最强模型也仅能完成约 30% 的任务,复杂指令遵循和领域专业知识是主要失败来源。该基准揭示了当前通用智能体在真实用户任务上的能力边界。
ASI-Bench 是首个联合评估 AI 系统在通用研究领域创新探索与自主科研执行能力的基准,也是首个在同一研究项目中逐步撤除方法论指导的基准。该基准涵盖 11 个科学领域的 60 个项目级任务,在 18 种 SOTA 配置下,平均得分从完整指导的 50.91 降至仅指定方法时的 29.10,以及需自主确定方法时的 26.62,表明当前系统仍高度依赖人类指导。
一项研究提出能力驱动的数据基础设施,将能力专属监督构建与能力对齐的课程调度相结合,通过三个数据引擎分别构建文本-图像 grounding、图像间变换和图像-知识关联的互补关系监督。该框架构建了4.4亿图像T2I语料库、1.2亿编辑对和超2700万图像-实体对,并据此从零训练了3B和6B两种规模的多模态扩散模型,在CPI-Bench上进行了定量评估。
论文提出 Agentic ESOpt,一种基于进化策略(ES)的全参数智能体微调框架,相比强化学习(RL)仅需推理级 GPU 内存即可微调大模型,并支持参数与提示词空间的协同进化。在 WebArena-Lite 上,对 Qwen-3.5-27B 的全参数优化较无技能基线提升 6.69%;在测试时自动启发式设计中,28/36 个设置优于匹配基线。
VA-Judger 提出一种面向视频-音频联合生成的链式思维全模态奖励模型,并构建了包含 9K 提示词和 10.3K 细粒度成对比较的大规模人类偏好数据集 VAPref-10K。该模型通过分维度强化学习分解人类反馈,在域内和域外评测中均优于现有指标基线,用于后训练可显著提升生成质量。
研究团队提出一种即插即用的2D运动接口,使3D预训练的运动语言模型(MoLMs)无需修改或微调即可接受2D运动输入。在公开数据集上,该方法在多个MoLMs上达到与3D运动输入相当的性能,并优于从头训练2D运动的模型。团队还构建了单目真实世界视频运动评估数据集并引入真实视频适配器,证明在单目姿态估计场景下2D运动比3D运动更具实用性。
HiFi-BRep 提出一种新型框架,通过拓扑感知编码器消除填充噪声与特征污染,并以单阶段解码器并行预测几何与拓扑,将流形约束嵌入可微学习目标。实验表明,该方法在结构有效性与几何保真度上显著优于现有最先进方法,代码与模型已公开。
AnyTalk提出一种无需动画数据即可为任意角色生成3D语音动画的新方法,通过Character-specific Fine-tuning(CsF)技术将预训练视频扩散模型适配至目标角色,再经优化过程估计blendshape参数,将说话头视频提升为3D语音动画。该方法支持多种面部网格和blendshape配置,显著降低人工与数据需求。蒸馏版AnyTalk_{RT}可实现实时性能,代码已公开。
一项实证研究发现,像素空间扩散模型直接大规模预训练收敛速度远慢于潜空间模型,由此提出“潜空间到像素空间”策略:先在潜空间高效获取生成先验,再在后训练阶段转向像素空间。该策略结合权重初始化、数据构成、预测目标、解码器架构与噪声调度等设计选择,使像素空间模型达到或超越潜空间模型,并实现 3.18 至 4.75 倍的端到端推理加速。
Ventor-QTest 提出一种无需目标 API 概率信息的复合黑盒审计方法,通过重复请求与长序列组件分别报告平均保真度损失(AFL)和极端保真度损失(EFL)。在七组路由快照中,EFL 随任务暴露增加与 Terminal-Bench 通过率下降同步出现,提示审计长程智能体任务时应联合报告 AFL 与 EFL。实现已开源。
字节跳动Seed与清华AIR发布CUDA Agent,一个训练大语言模型编写GPU内核的智能体强化学习系统,使生成内核在KernelBench上以2.11×几何平均速度超越torch.compile,通过率达98.8%,快于编译器的比例为96.8%。
WorldMind 提出首个面向游戏世界模型中状态感知 NPC 行为的解耦框架,将交互式世界建模分为理解、决策、控制与生成四层,并通过闭环交互循环将 NPC 行为锚定于不断演化的游戏状态。配套发布 BOSS-140K 数据集及自动化采集智能体。在 BOSS-140K 上的实验显示,WorldMind 在约 70% 的成对比较中因战术更合理、行为更连贯而优于基线。
一篇综述提出全谱系人类上下文分类法,将人类视为可观察主体、动态行动者和情境化智能体,整合视觉外观、空间几何、运动动力学、交互建模、世界模拟与具身智能六个层面。文章系统梳理了该领域的方法论基础、代表性方法、数据集与评测基准,并讨论了构建可扩展、可信、具身可部署的人类中心智能所面临的开放挑战。
研究团队提出“语义任务完成视频生成”这一以结果为导向的视频生成任务,要求模型同时实现预期结果并保持与参考图像的语义对齐。为此构建了覆盖六个领域的评估数据集 SemComp-Data,并推出基于视觉语言模型(VLM)的评估协议 SemComp-Bench,分别以 OA Score 和 GR Score 衡量结果达成与生成可靠性。实验显示,现有代表性视频生成模型在兼顾任务目标与语义对齐方面仍面临挑战。
RapidLiDAR 提出一种 LiDAR 场景补全方法,将初始化本身作为可学习的数据驱动组件,通过自适应初始化模块预测每个输入点的空间变化位移,无需手动噪声调参。在 SemanticKITTI 和 KITTI-360 上,该方法补全性能与最先进技术持平,完整场景补全仅需 0.1 秒,比此前最快方法快 2.3 倍,匹配典型车载 LiDAR 传感器的 10 Hz 采集率。