检索增强型LLM在消费推荐中易受GEO内容污染影响,成为虚假产品的无意推广者。新基准FORGE在225个真实产品、15个类别和5个消费场景中测试12个商业及开源LLM,发现所有模型均易受攻击:单个污染页面即可造成最高27%的受骗率,替换全部前3个结果时升至73.8%。
检索增强型LLM在消费推荐中易受GEO内容污染影响,成为虚假产品的无意推广者。新基准FORGE在225个真实产品、15个类别和5个消费场景中测试12个商业及开源LLM,发现所有模型均易受攻击:单个污染页面即可造成最高27%的受骗率,替换全部前3个结果时升至73.8%。
研究测试了实体图谱链接与迭代改写两种 RAG 扩展在 ASR 输入下的表现。在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 三个多跳问答基准上,两种扩展均放大错误:干净文本与最高 WER 口音间的 F1 差距比朴素稠密检索大 36-67%。查询实体损坏是主要失败模式,占 2WikiMultiHopQA 上 87-96% 的退化案例。
MobilePA-Bench 是一个交互式、有状态且以工具为中心的评测基准,用于评估移动端规划智能体的工具调用与规划能力。它运行在可执行沙箱中,覆盖 13 个功能域和 212 个真实移动工具,并额外评测子智能体协作、记忆使用和技能调用三个高级维度。实验显示,当前前沿 LLM 在严格工具排序、权限限制和意外运行时错误下性能显著下降。
Task-CoEvolve 提出一种高效的大语言模型 harness 优化方法,通过让验证任务与 harness 共同演化,解决固定验证集评估成本高的问题。该方法利用方差加权采样聚焦能力边界附近的任务,并基于采样概率估计全量集分数。在在线文本分类和 Terminal-Bench 2.1 上,Task-CoEvolve 匹配全量集搜索的最终性能,同时将优化过程中的评估次数减少 80%。
新研究提出“Projector Is All You Train”:为语言模型添加新模态只需训练连接编码器与主干的投影层,无需微调模型本身。3D 测试中,冻结主干的模型性能持平或超越联合微调,训练速度快一倍,而联合微调的 Llama 在 GSM8K 上从 86.96% 暴跌至 0.61%。
ReWorld 将控制与记忆分离训练并在推理时加以约束,通过混合逐头注意力窗口和随机头路由,让少量全局头关注全部历史,同时以姿态索引地标库支撑有界 KV 缓存。在覆盖动作跟随、长时回忆和视频质量的三轴评测中,ReWorld 对六个近期交互式世界模型取得最佳控制保真度(11.95° 旋转误差)和最佳生成质量,并支持 704x1280 实时视频流。
新基准 SWE-bench Science 用开源科学仓库的真实缺陷测试编码智能体,发现它们擅长消除可见故障,却难以恢复底层科学逻辑,且领域知识帮助有限。最佳配置 Claude Code 配 Opus-5 通过 96.64% 公开测试,但 Pass@1 仅 47.90%。瓶颈在于验证而非知识:智能体无法将科学解释与可执行证据对照时,会锚定解释而非检验它。
Apodex 1.1 通过环境扩展与智能体协调训练两条路径,提升模型在文件、搜索和代码环境中的持续可验证工作能力。在专业工作、金融、科研、数学、编码和搜索等任务上,该模型以远小于前沿系统的参数量达到领先性能。35B 参数的 Apodex 1.1 Mini 在本地可部署形态下仍保持较强工作能力。
检索增强问答系统在索引扩展后可能返回不同答案,即便模型标识、提示词、检索策略等设置完全固定。研究提出快照兼容性审计,通过从跨快照分歧中减去同快照重复分歧来估算超额答案更替。在400题Natural Questions预注册研究中,归一化精确和盲语义超额更替分别为6.44和10.25个百分点,而精确匹配准确率仅变化-1.50个百分点。
Google DeepMind 新论文提出“Recirculation”方法:推理时将深层激活的一小部分混入浅层,权重不变,即可恢复模型在长上下文中丢失的部分状态。在 Gemma3 上,10 个语言建模数据集中 9 个困惑度下降,12B 模型最高降 35%,但多项选择收益有限;该方法无需重训,但代价是预填充无法并行,且收益不跨模型家族迁移。
论文发现,后训练无法修复薄弱的长程规划基础:噪声轨迹会累积错误,稀疏奖励导致信用分配不当,冲突教师引发遗忘。研究建议优先训练清晰世界模型和长轨迹,奖励信号过稀疏时采用OPD(on-policy distillation),并避免合并规划策略不兼容的教师。OPD在长程噪声场景下优于结果奖励GRPO,因教师反馈贯穿整个轨迹而非仅在末端。
研究团队分析 PubMed Central 上 119 万余篇英文生物医学论文发现,2025 年约 77% 的论文出现 AI 辅助写作或编辑特征,较 2023 年的 19% 和 2024 年的 52% 大幅提升。讨论部分使用比例最高(约 78%),韩国、中国等非英语母语地区超 80%。研究呼吁建立完善使用规范和监管机制,以应对 AI 生成虚假事实及披露不足等风险。
斯坦福大学经济学家最新研究显示,AI 正导致部分领域年轻员工的入门级岗位显著流失,而年长员工迄今基本未受影响。在 AI 暴露度最高的职业中,22 至 25 岁员工的就业水平已比低暴露领域同龄人低 19%,高于去年的 13%。
DAIR.AI 介绍一种名为加权记忆树的新方法,为长时运行智能体实现可恢复记忆。它将执行组织为任务、子任务和动作,并为每条记忆赋予动态保留分数,事件更新提升分数、选择衰减降低分数。在 GAIA-Text 上,该方法搭配 Qwen3-8B、Gemma 4 E4B 和 Llama-3.1-8B,平均比线性记忆高出 9.97 分,同时提示词 token 使用量减少 32.8%。
ASI-Bench 用 60 个真实科研项目、11 个科学领域测试研究智能体,仅改变指令内容。18 种智能体与模型组合下,完整步骤提示平均得分 50.91,仅给方法名降至 29.10,再删方法名仅再降 2.5 分。仅方法名提示还多耗 59% token,因命名方法既限制方向又迫使智能体重建全部实现细节。
皮尤研究中心分析近 50 万个英文网页发现,ChatGPT 发布后发布的页面中超过三分之一带有 AI 生成文本痕迹。商业 .com 域名出现 AI 文本的比例约为 .edu 或 .gov 网站的十倍。分析工具 Open Pangram 难以区分完全自动生成与部分 AI 辅助的文本,且“delve”等 AI 常用词及破折号、牛津逗号的使用频率自 2023 年以来显著上升。
多模态大语言模型常用视觉思维链(Visual CoT)进行空间、时间与具身环境推理,但生成中间推理图像带来大量推理开销。新提出的后训练框架 Internalized Visual Thinking(IVT)在训练阶段内化视觉思考,推理时直接进行文本预测与优化,从而在不增加推理成本的前提下实现主动视频推理。
DataSpace 新基准测试数据智能体在异构工作区中的可验证分析能力,涵盖 410 个需结合数据库、CSV/JSON、长文档与视频并返回精确表格的任务。最强模型准确率仅 66.34%;固定模型后仅更换智能体框架即可将准确率从 30.98% 提升至 46.34%。跨所有测试模型,跨源连接与多数据类型混合是持续短板,且许多失败发生在智能体已找到正确信息后误解请求或提交错误列。
Meta 新论文提出 EvoHarness-RL,通过强化学习训练智能体自主决定何时使用外部记忆与工具,而非硬编码持续访问。该方法将 Qwen3-8B 在 ALFWorld 已见任务成功率从 ReAct 的 47.9% 提升至 96.9%,未见任务达 86.6%(对比 50.0%),且每次任务的外部状态调用降至约 1 次。
前沿模型虽降低了编写定制代码的成本,但并未降低审查与维护成本,每个定制方案都需从头阅读代码库。该立场论文主张采用“harness 范式”:一个编码智能体 harness 作为骨干,在所有部署中运行相同代码,无需修改。论文基于三项近期发现,其中 harness 选择对智能体基准结果差异的影响大于模型选择。
卡迪夫大学和墨尔本大学研究发现,生成式AI目前无法像人类教师一样可靠评判学生书面作业。研究人员用ChatGPT两个版本按7项标准评分50篇生物科学论文,并采用4种提示方式,结果显示模型分数波动大,无法准确预测人工评分。除一种情况外,AI平均分普遍高于人工,最大差距达16.1分,单篇最大差距达40分,且分数系统性向中间集中。
清华等高校提出“表征平等”框架,评估大语言模型作为跨国调查合成受访者时,模拟精度是否在各群体间均衡分布。测试覆盖59国、2420个亚组及9个开源模型,发现模拟不平等是系统性的:模型对澳大利亚、北美、欧洲模拟更准,且国家精度与人均GDP、互联网普及率正相关。
Google Research 与 USC 推出 ME-POIs 框架,将聚合移动数据融入文本地点嵌入。在洛杉矶和休斯顿的 5 项地图增强任务中,34/35 个模型-任务组合获得提升,访问意图 F1 最高提升 81.9%。模型约 53.7M 参数,但代码与权重尚未公开。
一篇论文提出用“对抗式审查”规则提升AI智能体代码审查:审查者与批评者需用代码证据回应分歧,而非简单互相认同。在LiveCodeBench上,3个智能体达87%准确率,优于5智能体版本的82%;在真实PR审查中,该规则将F1分数从0.457提升至0.533,跃居首位。
NVIDIA 新论文提出 ACES 方法评估智能体技能:在同一模型、沙箱、工作区和评分器下,分别在有/无技能加载时运行同一任务,对比智能体完成度的差异。基于 58 个生产技能、947 组配对案例、4 个 harness 的测试显示,技能执行、行为检查和技能效率的过程指标提升最大。传统结构扫描评分与 LLM 评判质量的相关性仅 Spearman rho 0.14。
ContinualSkillBench 在 5 个领域各设 100 个关联任务,对比智能体保留反馈、更新技能与从零求解的效果。顺序执行在 15 组模型-领域设置中 14 组提升归一化奖励,整体相对提升 16.9%。
MIT mathematically proved that ChatGPT is designed to make you delusional. They call it "delusional spiraling." AI model...
Please welcome to the world a beautiful new geometric object, to do with a problem i’ve always loved. claude really cont...
摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,基于旗舰级AI训推一体智算卡MTT S5000构建“Prefill As a Service”新范式,面向AI Agent、代码生成、超长文档分析等长上下文推理场景。
SK 海力士在 Hot Chips 2026 大会上披露下一代 HBM 封装路线图,计划借助英特尔 EMIB 等先进封装技术,未来进入 3D 封装阶段。其 HBM4 带宽超 2TB/s,功耗效率较 HBM3E 提升 40% 以上,容量最高 48GB,并正研发混合键合与 I-HBM 局部热点缓解技术以应对散热挑战。
Netflix 每周运行数十万次节目级推荐解释的 LLM 评判器,服务数百万移动端会员,并将其视为包含诞生、训练、部署、监控四阶段的完整生命周期。训练阶段采用推理对齐的规则调优,以元评判器输出为学习信号;部署时同一评判器承担质量门控与反思生成双重角色。五周 A/B 测试显示,相比无解释对照组,浏览到播放的转化率提升,且未出现质量相关问题。
Please welcome to the world a beautiful new geometric object, to do with a problem i’ve always loved. claude really cont...
一项研究追踪557次智能体编码会话的94K个开发事件及33K个智能体PR的690K条文件变更记录,发现指令文件与工作笔记占智能体读取内容的60.5%,技术文档仅占10.6%,API参考占1.3%。读取文档与即时测试减少相关(调整后比值比0.39),且咨询70.2%为主动发起而非失败驱动。
一篇论文提出用主动推理让AI智能体显式决策每次澄清、检索或工具调用是否值得其token与延迟成本。受控测试中,定向澄清将验证器合规率从0.0417提升至0.375,平均token使用从约112增至219。建议为智能体增加显式上下文获取层,而非将其视为自动行为。
Google、DeepMind 与 Berkeley 的 ArchAgent v2 通过分阶段优化 CPU 缓存预取,击败人工设计的 DPC4 冠军方案。其最终设计较竞赛基线提升 3.8% IPC,低带宽单核场景达 4.6%,均优于 BertiGO。多核性能仍落后,因模拟拖慢搜索速度。