Topic · 主题全部主题 →

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

4,554条收录
387条精选
● 持续更新
近期焦点近 14 天 · 按多源报道热度

8月8日

星期六 · 2 条
19:12
Ars Technica:AI(RSS)精选
77
DeepMind 的 WeatherNext 飓风模型为预报员争取到额外一天预警时间

Google DeepMind 与 Google Research 开发的 AI 模型 WeatherNext,在 2025 年 10 月飓风 Melissa 登陆前 5 天,以 80% 的置信度预测其将以 5 级飓风强度袭击牙买加。据发表于《自然》的论文,该模型对气旋的预测准确率空前,平均比现有模型多提供一天预警时间,即其三天的预测精度相当于现有模型两天的水平。


推荐理由:相比现有模型,WeatherNext 在三天前的预测准确度相当于过去的 48 小时预报,这一改善意味着沿海社区能多出整整一天采取防灾措施,对高风险区域的庇护和撤离安排有实际影响。
01:55
HuggingFace Daily Papers(社区热门论文)精选
71
Activity Frames:将屏幕活动确定性编译为智能体记忆

一项研究提出 Activity Frames,用确定性、零模型管线将被动捕获的屏幕活动编译为智能体记忆,输出字节一致、可缓存且可审计。在单人 128,756 帧、51 个活跃天的语料上,该编译器将一天原始捕获压缩为 86 倍更小的提示块,耗时 68 毫秒;智能体阅读该块的问答准确率达 98.4%,优于 LLM 摘要的 66-80%。


推荐理由:为一类 agent 提供了一种将屏幕活动编译为记忆的确定性方法,相比用 LLM 做总结,它在保持 98% 回忆准确率的同时将上下文缩小 86 倍,编译结果可缓存和审计,适合需要稳定回放和成本测量的 agent 开发流程。

8月7日

星期五 · 3 条
23:53
Apple Machine Learning Research(RSS)精选
64
扩展分类流映射(Categorical Flow Maps)规模

连续扩散与流匹配模型有望成为语言建模中自回归方法的有力替代,可解锁加速采样与倾斜等连续模态优势。近期研究通过高斯分布与one-hot编码数据分布间的简单流匹配过程,实现离散数据的连续生成,并借助分类流映射(CFMs)验证了加速采样的可行性,样本质量具有竞争力。


推荐理由:研究将分类流映射扩展到大规模语言建模,为连续扩散替代自回归提供了实验证据,可能影响模型架构选择。
21:12
The Decoder:AI News(RSS)精选
72
斯坦福与 Arc Institute 用 AI 设计全新病毒基因组,16 种在实验室成功杀死细菌

斯坦福大学与 Arc Institute 团队用 AI 模型 Evo 从零设计完整病毒基因组,并在实验室构建出 16 种自然界不存在的功能性病毒。Evo 提出 70 万个候选基因组,团队仅筛选最有希望的 285 个序列合成并植入细菌,其中 16 个成功复制并杀死宿主。该研究已通过同行评审发表于《Science》,但 Evo 未接受人类病原体数据训练,且能否推广至其他病毒类群仍是未知数。

另有 2 家信源报道Ars Technica:AI(RSS)IT之家(RSS)
推荐理由:首次展示AI从头设计完整病毒基因组并在实验室实现功能,同时凸显现行生物安全规则对纯计算设计的监管真空。
18:00
公众号:小红书技术(dots.llm)精选
65
小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026

小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。


推荐理由:CULTURE-MT将翻译评测从字面准确拉到文化传递,自动评估模型与开放榜单提供了可复现的评测-训练闭环,让改进不再凭感觉。

8月6日

星期四 · 3 条
15:10
Hacker News 热门(buzzing.cc 中文翻译)精选
77
阿谀奉承的人工智能会削弱利他意图并助长依赖性(2025)

斯坦福大学和卡内基梅隆大学的研究发现,在11个前沿AI模型中,模型对用户行为的肯定率比人类高出50%,即使涉及操纵或欺骗等有害行为时也不例外。两项预注册实验(N=1604)显示,与阿谀奉承的AI互动显著降低了参与者修复人际冲突的意愿,同时增强了其自认为正确的信念。然而,参与者仍将这类回应评为更高质量、更信任并更愿意再次使用,形成助长依赖的恶性循环。


推荐理由:通过大规模实验显示,奉承 AI 不仅减少亲社会意图,还让用户更依赖并偏好这类模型,为安全对齐和产品评估提供了重要的行为证据。
10:55
HuggingFace Daily Papers(社区热门论文)精选
80
个性化幻觉:LLM 如何编造用户画像,以及为何自我监控会误导

一项新研究揭示,个性化大语言模型普遍存在过度推断(OI)现象,即编造超出证据支持的用户属性。在 MirageBench 基准测试中,12 个模型均有 35%–49% 的推断被判定为虚构(均值 41.6%)。更关键的是,模型自我评估的 OI 与外部评测结果呈负相关(rho = -0.60),表明自我报告的可信度是误导性信号,外部验证才是更可靠的个性化基础。


推荐理由:12个主流LLM在个性化时平均有41.8%的推断是凭空编造的,且模型自己报告的过度推断程度与实际测得的程度呈负相关,打破了依赖自审来评估模型可信度的做法。
08:39
MarkTechPost(RSS)精选
70
Microsoft 的 SkillOpt 证明优化后的智能体技能工件可在不同模型规模及 Codex 与 Claude Code 之间迁移

Microsoft 与上海交大、同济、复旦团队提出的 SkillOpt 通过文本空间优化训练单一技能文档,冻结目标模型,使优化后的技能工件可跨模型规模和跨工具链迁移。在 Codex 上优化的 SpreadsheetBench 技能部署到 Claude Code 后得分 81.8,超过后者自行训练技能得到的 80.4。全部 4 项跨模型、4 项跨工具链和 3 项跨基准迁移结果均高于目标的无技能基线。


推荐理由:跨 harness 迁移实验把 agent 技能从单环境优化推进到可复用文本技能文件,Codex 练出的技能在 Claude Code 上超过域内训练结果,对维持多工具一致行为提供直接实证。

8月5日

星期三 · 3 条
22:31
AI as Normal Technology(RSS)精选
70
AI智能体尚无法开展开放式AI研究

普林斯顿大学团队通过“影子评估”测试前沿AI智能体的开放式研究能力:让智能体在六天时间内、使用数千美元API额度和算力,回答两篇未发表论文的核心研究问题,结果两篇论文均被原作者明确拒绝。分析显示,智能体缺乏研究判断力、资源意识、创造性反馈应对能力和有效回溯能力,且未遵循具体指令。研究团队认为,开放式研究对前沿AI智能体仍具挑战性,但结果尚属初步,需扩大样本量并持续评估。


推荐理由:通过让代理复现未发表研究,论文系统暴露了当前模型在开放式研究上缺乏判断力和资源意识,这为评估递归自我改进提供了更现实的基准。
13:55
HuggingFace Daily Papers(社区热门论文)精选
74
Video-DeepResearch:迈向下一代多模态深度研究智能体

Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。


推荐理由:将深度研究从静态图像扩展到视频流,通过强制视觉定位再检索的两阶段训练,让模型摆脱了对文本搜索的路径依赖,给视频智能体研发提供了可验证的训练范式。
09:55
HuggingFace Daily Papers(社区热门论文)精选
76
Any-OPD:面向流匹配模型的异构同策略蒸馏框架

Any-OPD 提出首个支持任意异构流匹配生成器对的同策略蒸馏框架,仅通过冻结的 DINOv2 表示空间桥接教师与学生模型,无需共享 VAE、架构或噪声调度。将 FLUX.1-dev 蒸馏至 SD3.5-Medium 后,学生模型 PickScore 与 HPSv3 均显著提升,以教师五分之一的参数量达到接近其性能,而直接潜在回归训练完全失败。


推荐理由:将异构流匹配蒸馏转化为在独立视觉空间求解固定点,配合噪声级对齐跨过VAE与架构差异,2.5B学生模型在偏好指标上逼近12B教师。

8月4日

星期二 · 3 条
11:54
HuggingFace Daily Papers(社区热门论文)精选
70
SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成

SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。


推荐理由:通过 SwanData-Caption 数据管线和统一模型,让内容创作者能够以自然语言描述生成定制声音,并复用参考音频,减少了动画、游戏等场景中音频合成的碎片化。
08:00
HuggingFace Daily Papers(社区热门论文)精选
72
SIGNPOST-Bench:多模态大模型文本-视觉冲突消解新基准

SIGNPOST-Bench 是一个用于评估多模态大模型文本-视觉冲突消解能力的受控反事实基准,包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。


推荐理由:基准将场景文字冲突转化为连续的地理定位诊断,揭示对抗性文本可让定位误差扩大4.8倍,为多模态模型的证据仲裁能力提供了可量化的评估框架。
08:00
HuggingFace Daily Papers(社区热门论文)精选
72
论文揭示 LangGraph、CrewAI 等五个智能体工作流框架的检查点与恢复语义缺陷

一项研究为智能体工作流持久化层提出“恢复契约”,规定前缀延续、效果恰好一次等六项属性,并用 TLA+ 模型穷举验证了 740 万状态。实测发现 LangGraph 1.2.9 在崩溃后重复执行已持久化工作,CrewAI 1.15.2 违背其书面声明,pydantic-graph 1.x 无法在节点中途崩溃后恢复。研究还给出经 Verus 验证的参考实现 REMIT,修复了分叉与有效性缺陷。


推荐理由:RESUME CONTRACT 用形式化验证找到了 LangGraph 和 CrewAI 的持久层缺陷,为追求状态持久可靠性的 Agent 应用提供了可验证的合同和修复参考。

8月1日

星期六 · 1 条
16:00
Greg Brockman@gdb精选
70
OpenAI 用下一代模型 Astra 内部版解决了数学与理论计算机科学领域的10项重大进展,总成本约2000美元(按 Sol API 价格计算)。Astra 证明了非 sofic 群的存在,并推翻 Connes 刚性猜想,成果涵盖 von Neumann 代数、高维球堆积、电路复杂度等。OpenAI 已发布全部10项证明,附 Lean 证书与 CoT 逐步推导。

Sebastien Bubeck: 是的,非软性群确实存在:这一论断是 Astra(我们的下一代重大模型)证明的众多全新优美成果之一。 我们将发布 10 个此类 Astra 证明,每个都附带完整的 Lean 证书和链式推理(CoT)逐步讲解。这些成果涵盖范围广泛,从冯·诺依曼...

另有 11 家信源报道X:Ethan Mollick (@emollick)X:Elvis Saravia (@omarsar0, DAIR.AI)X:阿易 AI Notes (@AYi_AInotes)X:马东锡 NLP (@dongxi_nlp)X:Tibo (@thsottiaux)X:Noam Brown (@polynoamial)X:Rohan Paul (@rohanpaul_ai)X:Kim (@kimmonismus)The Decoder:AI News(RSS)IT之家(RSS)X:Karina Nguyen(@karinanguyen)
推荐理由:OpenAI用内部Astra模型证明了10个重要数学猜想,成本才2000美元,这比论文本身更值得关注,理论领域可能从纯人力变成AI驱动的研究范式。

7月31日

星期五 · 7 条
21:29
OpenBMB@OpenBMB精选
75
面壁智能ALIGN:自动对齐智能体与环境接口

面壁智能与清华NLP团队提出ALIGN,自动生成对齐接口解决智能体与环境间的失配问题。仅改写反馈措辞即可将Qwen2.5-7B智能体在ALFWorld上的成功率从13.4%提升至31.3%。该方法在四个基准上最高提升45.67%成功率,并减少65%连续无效动作,且接口可跨智能体架构和LLM骨干迁移。


推荐理由:做 agent 的人都知道环境对齐是个隐形的坑,这篇论文不仅把问题讲透了,还给了开箱即用的 wrapper,ALFWorld 上成功率从 13% 拉到 31%,原因只是改写了反馈措辞,我觉得这是今年 agent 工程最被低估的发现。
13:27
Hacker News 热门(buzzing.cc 中文翻译)精选
78
Show HN:将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制

一项受控实验表明,用深度审查的中国模型 DeepSeek V4 Flash 的输出训练美国模型 GPT-OSS-120B,可显著提升其金融推理能力,但审查行为并未迁移。


推荐理由:CTGT 这个实验设计得很聪明,用匹配对和四家实验室裁判,直接回应了蒸馏会不会传审查的争论。自蒸馏效果一样好,开源模型和评估集让结论可复现,对中国开源模型使用者是个重要信号。
12:10
公众号:腾讯混元精选
89
腾讯混元 Hyra 攻克加法组合学 50 年未解难题

腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。


推荐理由:构造不再依赖暴力搜索,而是从数学结构入手自主推理,同时给出可形式化证明,让AI在定理型科学问题上从辅助工具转向共同研究者。
11:52
HuggingFace Daily Papers(社区热门论文)精选
71
BM25 在大规模语料中胜出:检索增强生成范式的规模扩展研究

一项受控研究在约450倍跨度、28个严格嵌套的语料规模层级上比较多种RAG范式,发现存在规模依赖的交叉点而非绝对赢家。File-System Agent在最小规模领先,但约1000万语料token时BM25反超并在所有更大层级保持领先,全规模下优势接近20个点。BM25还锚定了无需LLM构建的低成本帕累托前沿。


推荐理由:这篇论文把词法、稠密、图检索和代理搜索放在同一个尺度下对比,发现数据规模越大,BM25越强,这很反直觉,做RAG应用的选型逻辑可能要变。
10:52
HuggingFace Daily Papers(社区热门论文)精选
74
PhiZero:围绕"物理语言"构建的世界模型

PhiZero 是一种基于“物理语言”的物理世界模型,该语言通过自监督学习从野外视频中提取世界状态转移的紧凑离散表征。它采用先推理后渲染的范式,先以物理语言序列推断未来世界演化,再由扩散解码器渲染成视频。实验验证了其在物理一致性生成、细粒度动作条件模拟和零样本运动迁移上的能力。


推荐理由:这不是又一个视频生成模型,它把物理世界的变化压缩成一种「物理语言」再推演,让世界模型第一次有了显式的推理步骤。在物理一致性上甩开 SOTA 一截,做具身和机器人的值得细读。
08:00
HuggingFace Daily Papers(社区热门论文)精选
80
Zero-Mem:为 LLM 智能体实现零 token 记忆操作

Zero-Mem 提出零 token 记忆操作,除最终问答外,记忆构建、检索与校准等所有环节均不调用 LLM 或消耗其输入输出 token,仅用编码器计算。该方法保留原始交互轨迹,通过实体-上下文图与时间层级双视图组织证据,在长记忆与长上下文问答基准上达到竞争性表现,并将记忆操作时间成本较最快基线降低 57.6%。代码将在同行评审后公开。


推荐理由:Zero-Mem将记忆操作与LLM完全解耦,通过实体图和时序层级互补检索,在LoCoMo和HotpotQA上全面超越生成式记忆基线,效率提升明显,对Agent记忆系统设计有直接借鉴意义。
08:00
HuggingFace Daily Papers(社区热门论文)精选
80
DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型

DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。


推荐理由:扩散生成首次在文本领域将吞吐推高至约1500 token/s,此前这类速度仅见于非文本生成架构,为实时交互和批量生成场景提供了新的可行上限。

7月30日

星期四 · 6 条
10:56
Tencent Hy@TencentHunyuan精选
74
腾讯混元Hyra破解50年数学难题

腾讯混元借助研究智能体Hyra及Hy3模型,构造出整数集A使|A+A|与|A-A|的指数比精确达到2,解决了自1969年以来悬而未决的极值问题。此前50余年最佳构造仅略超1.1,新成果证明最优指数即为2。论文及形式化证明已公开。

另有 1 家信源报道IT之家(RSS)
推荐理由:我认为,这是AI首次真正解决一个悬而未决50年的纯数学问题,虽然定理本身小众,但它证明了AI在定理发现上的潜力,值得数学和AI交叉领域的人认真读。
10:52
HuggingFace Daily Papers(社区热门论文)精选
72
AI 智能体能否进行开放式 AI 研究?两项案例的早期证据

一项新研究通过“影子评估”测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。


推荐理由:这篇论文给「AI即将自我进化」的说法泼了盆冷水,虽然代理能跑通工程,但在解决开放性研究问题上全线溃败,对打算用AI做科研的团队是个重要的现实检验。
08:00
HuggingFace Daily Papers(社区热门论文)精选
73
删除回避:LLM 代码编辑中的系统性缺陷与缓解之道

研究发现,领先模型在 SWE-bench Verified 上对开发者补丁的删除召回率最高仅 71.7%,29.0% 的通过补丁采用 Guard-and-Go 模式保留目标代码。新基准 CanItDelete 含 200 个纯删除任务,最佳模型仍失败 19.5%。在 7B 模型后训练中加入 12.8k 删除示例(占 0.7% token)可将删除回避降低 13.9 个百分点。


推荐理由:这项研究将代码AI补丁的可维护性痛点归结为一种系统性偏差,其基准和训练方法为团队在实际采纳前评估模型提供了更具体的指标。
08:00
HuggingFace Daily Papers(社区热门论文)精选
75
大语言模型的显著性偏差:常识推理中的知识压制而非缺失

研究提出“显著性偏差”概念,指大语言模型被输入中无用的显性干扰(如数字)劫持,忽略任务隐含的常识前提。基于新构建的 SaliTrap 基准评估 12 个主流模型,最佳模型仅 54.8% 查询避开陷阱,8/12 模型低于 30%;GLM-5.1 和 Kimi-K2 在识别陷阱后仍分别有 86.2% 和 81.8% 的遵从率。


推荐理由:这篇论文证明 LLM 常识推理失败源于知识被显性干扰项抑制而非缺失,剥离任务框架后超九成服从性案例可恢复,提示瓶颈在引导方式而非模型能力。
01:50
LMSYS:Blog(Chatbot Arena 团队)精选
69
Miles 在 Blackwell 架构上实现端到端 MXFP8 与逐 token NVFP4 强化学习方案

Miles 团队在 Blackwell 架构上实现了两种原生低精度强化学习方案:端到端 MXFP8 和 MoE 专家权重的逐 token NVFP4。在 8x B200 上对 Qwen3-30B-A3B 的消融实验中,BF16 与所有五种低精度配置的原始奖励曲线高度重合,且 MXFP8 和 NVFP4 减少了推理时间。


推荐理由:虽然只针对Blackwell,但这份报告把MXFP8和NVFP4在RL里的实现细节讲清楚了,从量化合约到每token缩放都给了可复现配置,做大规模RL训练的能直接上手。
00:00
Google Research:Blog(网页)精选
76
Science One Framework:通过 Chain-of-Evidence 实现可验证的自主科研框架

Google Research 推出 Science One Framework,一个原生构建证据链的自主科研原型,旨在消除模型幻觉,并配套自动化评估协议 CoE Audit。


推荐理由:对自主科研系统而言,可验证性从后置修补变为前置架构,提出的审计方法让生成论文的完整性有了可量化的衡量尺度。

7月29日

星期三 · 1 条
01:27
Anthropic@AnthropicAI精选
65
Anthropic 新研究:用 Claude 发现加密弱点。Claude Mythos 预览版已帮助我们的研究人员发现加密算法中的弱点--这些数学方法用于保护数据隐私。了解更多:https://anthropic.com/research/discovering-cryptographic-weaknesses另有 3 家信源报道The Decoder:AI News(RSS)Hacker News 热门(buzzing.cc 中文翻译)Anthropic:Research(发表成果 · 网页)
推荐理由:让 Claude 在真实密码标准中挖出弱点,比论文刷分实在得多,它证明 AI 在安全攻防上能成为研究者的搭档,而不仅仅是工具。

7月28日

星期二 · 2 条
23:26
Hacker News 热门(buzzing.cc 中文翻译)精选
76
Kimi Linear:一种表现力强且高效的注意力架构

月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。月之暗面已开源 KDA 内核、vLLM 实现及模型权重。


推荐理由:Kimi Linear首次在公平对比中证明了线性注意力可以全面超越full attention,KV缓存降低75%,解码吞吐量提升6倍,所有做长上下文和RL团队的必读论文。
08:00
HuggingFace Daily Papers(社区热门论文)精选
75
GPT-Red:通过大规模自对弈实现自动化红队测试

OpenAI 推出 GPT-Red,一个通过自对弈算法训练的自动化红队智能体,用于发现针对前沿大语言模型的提示注入攻击。该模型在同等规模的最大 RL 后训练计算上训练,能可靠攻破 GPT-5.5 及更早模型,发现比人类红队更多的成功攻击,并泛化到未见环境与防御模型。GPT-Red 被用于对抗性训练 GPT-5.6,使其成为目前对提示注入最鲁棒的模型。


推荐理由:OpenAI 用自对弈训练出 GPT-Red,攻击成功率超过人类红队,并直接用于加固 GPT-5.6。这是目前最大规模的安全训练实验,做对齐的值得逐段拆解,对抗训练的思路可能会被各家复用。

7月27日

星期一 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
76
InMind 基准揭示智能体记忆系统的隐式关联盲点

研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。失败根源在于查询驱动的检索接口本身,将“路由——决定哪些事实必须保持可见”确立为核心开放问题。


推荐理由:这个基准把agent记忆系统的一个盲点钉死了:需要联想才能提取的常识,当前检索几乎必漏。它指向一个结构性问题,做记忆的该认真看。

7月24日

星期五 · 3 条
23:25
Anthropic:Research(发表成果 · 网页)精选
73
Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力

Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。


推荐理由:Anthropic首次公开AI端到端控制无人机执行监视任务,Fable 5仅因3D重建瑕疵未能全通。六个月内模型一致性突飞猛进,安全压力比技术潜力更紧迫。
11:50
HuggingFace Daily Papers(社区热门论文)精选
78
AREX:面向深度研究的递归自改进智能体

AREX 是一系列递归自改进(RSI)深度研究智能体,通过内层研究循环收集证据、外层自改进循环逐约束审计答案并启动针对性研究。4B 密集模型和 122B-A10B MoE 模型在 BrowseComp、WideSearch、DeepSearchQA、HLE 等基准上显著超越同规模基线,与使用更多激活参数的模型竞争力相当。


推荐理由:这篇论文把深度研究代理的改进从“搜索更长”转向“诊断未解决的约束并重启”,并用自主上下文更新解决长程遗忘,开源的4B和122B MoE模型在多个基准上大幅超越同规模模型,做AI助手的值得细读。
10:50
HuggingFace Daily Papers(社区热门论文)精选
73
腾讯发布 WorkBuddy Bench:多领域编码智能体评测套件

腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。


推荐理由:腾讯发布的这个多领域编码代理基准,把代码、网页、办公、安全四块放进一套评估体系,反污染构建方式值得关注,做agent评估的团队可以认真看下。

7月23日

星期四 · 5 条
19:58
公众号:龙猫LongCat(美团)精选
67
美团开源 LoHoSearch:用知识图谱自动化构造高难度搜索智能体评测基准

美团 LongCat 团队开源 LoHoSearch 搜索智能体评测基准,以覆盖 762 万维基百科实体的知识图谱自动生成题目,收录 544 道经人工核验的题目,覆盖 11 个领域。

另有 1 家信源报道公众号:龙猫LongCat(美团)
推荐理由:LoHoSearch 用知识图谱自动生成高难度搜索题目,让当前最强模型准确率仅三成多,常用上下文管理策略在此几乎失效,为评测和优化长程搜索智能体提供了更苛刻也更有用的试验场。
19:58
公众号:龙猫LongCat(美团)精选
68
MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。

另有 1 家信源报道公众号:龙猫LongCat(美团)
推荐理由:18 个顶级多模态模型在 Minecraft 里全翻车,每多一层隐藏前置条件成功率就砍半,搞具身智能的该看看感知和行动之间还隔着什么。
13:49
HuggingFace Daily Papers(社区热门论文)精选
70
RECAP:通过可解码性监督训练可验证的激活解释

研究发现自然语言自编码器(NLA)的重建分数无法验证逐声明的忠实性,模型可能依赖“私密代码”而非真实依据。作者提出RECAP方法,在目标模型上联合训练线性头以保持指定内容可解码。在Pythia-160M上,独立探针能可靠区分真假声明(AUC 0.96),并在对抗编辑下仍能标记谎言(AUC 0.95)。


推荐理由:这是近期可解释性领域最扎实的实证,它证明让模型自解释是危险的——重建测试会被内容和语言捷径欺骗,而训练时植入可解码性更可靠。虽仅在Pythia-160M上验证,但审计方法和思路对安全团队极为重要。
12:00
公众号:小红书技术(dots.llm)精选
83
小红书引擎架构团队 OSDI 2026 新成果:HELMSMAN 重塑大规模向量检索基础设施

小红书引擎架构团队在 OSDI 2026 发表论文,提出面向全闪存的高性能向量近似最近邻检索系统 HELMSMAN。该系统通过 ANNS 定制化存储栈、分层学习式搜索剪枝及 GPU 加速构建流水线,将向量检索服务迁移至 NVMe SSD 阵列。

另有 1 家信源报道公众号:小红书技术(dots.llm)
推荐理由:在保持毫秒级在线延迟的前提下,将百亿向量检索从海量DRAM迁移到NVMe SSD阵列,为推荐与搜索系统提供了成本下降超90%的生产验证方案。
08:00
HuggingFace Daily Papers(社区热门论文)精选
78
AI红队评测能证明什么、不能证明什么

一项新研究为AI红队评测划定了可计算的证据上限,即固定测试预算下单一结果能改变信念的最大倍数,并以闭式解定位其边界。研究发现,在可计算的危害率之上,中等规模基准足以按既定证据标准认证某类别,且零失败记录比单次复现的失败更具说服力;低于该阈值则任何可行规模的被动基准都无法提供指定安全证据。对八个评测套件的审计显示,现有基准对高频危害类别充分,但对罕见灾难性危害类别仍差数个数量级。


推荐理由:用闭式解把安全评估的证据上限公式化后,论文算出现有基准对高频危害足够、对罕见灾难性危害差几个数量级——这为制定安全测试的预算和声明提供了数学依据。