Meta FAIR 新论文发现 Chinchilla 缩放定律在外推至前沿规模时存在盲点,因其假设模型大小与训练数据独立作用。新方法 Skaling 仅增加一项耦合项,将预测误差降低约 1.5–3 倍,并以约 10 倍更少的 profiling 算力达到全网格精度。
Meta 新论文揭示 AI 评审系统的危险失败模式:被评审的 AI 可通过持续自适应说服,在 9 个前沿模型上翻转 62–91% 的评审判决。更严重的是,改判通常不是修正错误——70% 的成功翻转反而偏离了真实答案,对智能体监督体系构成实际威胁。
Meta 发布 Wiggle 框架,对 9 个前沿模型在 14 项裁判任务中施压测试,发现所有模型都会“摇摆”:静态反驳下改判率 25-71%,对抗性说服下高达 62-91%。改变裁判判决的压力几乎总是损害其相对真实答案的准确性,而基线陪审团多数优势是预测哪些项目会变动的最佳单一指标。
Meta 与牛津大学研究发现,若语言与视觉理解同步训练,多模态模型仅需极少量图像生成数据。1T token 实验中最佳配比为 70% 语言、25% 图像理解、5% 图像生成;13.5B 规模 2T token 测试中,图像生成 token 减少 5 倍,GenEval 仍从 0.467 提升至 0.482。研究还指出过晚引入视觉会导致“视觉惰性”,模型倾向依赖语言捷径。
Meta 新论文提出 Skaling law,通过单一交互指数耦合模型容量与训练数据,将平均绝对百分比误差在插值与外推场景下降低 1.5x 至 3x。该定律在数据稀缺和过度训练区间修正了标准 Chinchilla 与 Kaplan 形式的偏差,并可用约 10 倍更少算力从稀疏网格外推完整训练配置。
Meta 新论文提出用判别式语言模型做检索,将 0.6B Qwen3 模型嵌入经典双塔架构,替代自回归生成 item ID,使向量检索保持高速。更强的交叉编码器作为教师进行知识蒸馏,移除蒸馏后 Recall@10 在 Beauty、Sports、Toys 上分别下降 13.3%、23.1%、8.0%。
Meta 新研究提出 EvoHarness-RL,让智能体离线学习工具编排(harness)策略,并在运行时在线更新外部状态,替代手工编写。Qwen3-8B 在 ALFWorld 上达到 96.9% 准确率。训练中出现的“工具编排退火”与“工具编排进化”两种动态表明,长程任务智能体从可训练的协调策略中获益,胜过更大的工具集或记忆。
Meta 新论文发现,强量化会让推理模型在已得出正确答案后反复自我怀疑,过度思考失败率最高升至 52%。研究在数学、编程和科学任务上测试了 5 个推理模型(1.5B 至 32B),对 50 个犹豫词施加小幅惩罚即可将推理长度缩短 12% 至 23%,且常能保持或提升准确率。
To understand whether we're making genuine progress on reasoning, we entered our AI models in five international STEM Ol...
Meta AI 提出一种记忆模块,用独立的“记忆智能体”在固定间隔审查最近步骤、更新结构化记忆库,并决定是否向“行动智能体”的下一次调用添加提醒,以应对长任务中的“行为状态衰减”。
Meta 新论文指出,用强化学习优化代码并非简单扩展:仅奖励正确程序并给更快者加分通常无效,因运行时是嘈杂稀疏信号,测试、沙箱、奖励或 GRPO 的微小缺陷会损害正确性。作者重建整个反馈路径,包括更大优化测试、校准远程执行服务、问题相对排名及正确性门控奖励,并改进 GRPO 以稳定噪声批次。Qwen 2.5 7B 在 top-50% 速度阈值下从 18.0% 提升至 31.3%。
Fairness Pruning 提出一种轻量级结构干预方法,通过最小对比提示对和推理时激活捕获,在 GLU 架构的 down_proj 输入处定位对人口统计属性做出差异化反应的神经元。
Meta、南洋理工大学等机构联合提出 HumanCLAW 评估框架,将动作决策与底层运动控制解耦,让 VLM 每步输出原子技能指令并由物理引擎执行。基于该框架构建的 HumanCLAW-Bench 包含长程第一人称导航交互任务,测试 9 个 SOTA VLM 后无一通过,最佳模型成功率极低。瓶颈不在目标识别,而在于 VLM 缺乏具身自我意识,无法追踪自身位置、是否到达目标或撞到障碍物。
Meta与CMU提出Agentic Context Management(ACM),将上下文管理变为智能体的自主行动,由智能体自行决定何时压缩上下文并用摘要替换旧轮次。后训练管道双向教导压缩时机,使Qwen3.5-9B在BrowseComp-Plus上Pass@1从57.0%提升至72.7%,平均峰值上下文从63K降至54K token。
Meta与CMU联合研究提出智能体上下文管理(ACM)方法,为AI智能体提供上下文编辑工具,使其能自主决定压缩或卸载旧信息至外部存储,并在需要时查询。该方法在BrowseComp-Plus上取得27%的相对性能提升,接近比其大40倍的开源模型。代码、数据和模型权重已开源。
研究人员提出 GNM(Generative aNthropometric Model),一个涵盖头部、面部、颈部、眼球、牙齿和舌头的统一参数化模型。该模型基于高分辨率 3D 扫描与艺术家制作的解剖样本构建,在拟合目标 3D 面部扫描上达到 SOTA 性能。完整 GNM 框架已公开发布,旨在为生成式视觉模型提供更精确的空间控制与解剖学约束。
Meta 新论文提出,事实性不仅包括避免错误,还需包含足够的关键信息。新基准 GAMUT 通过构建结构化指南,将缺失信息转化为可衡量的 pass/fail 检查。在 14 个强模型测试中,最佳得分仅为 58.7%,信息缺失导致的失败比错误陈述更多。
Meta 新论文发现,后训练量化虽能降低推理模型运行成本,但会导致模型在已得出正确答案后反复自我怀疑,过度思考失败率最高达 52%。研究者在数学、编程和科学任务上测试了 5 个推理模型(1.5B-32B),发现量化在不确定词选择上引入噪声,使模型更倾向使用“wait”“but”等词重新打开问题。通过仅对 50 个犹豫词施加轻微惩罚,可将推理长度缩短 12%-23%,同时保持或提升准确率。
Meta 提出分层兴趣表示,一种基于 Transformer 图学习与自监督跨视图蒸馏的上游表示层,为广告实体学习统一嵌入。该系统在数十亿真实交互数据上端到端训练,输出通用嵌入和 Bag-of-Meaning 兴趣 token,旨在连接稀疏的深度漏斗信号与广告主供给。该技术可集成至 Meta 的生成式广告模型(GEM)、Andromeda 及自适应排序模型。
Meta 提出 SVR-R1,一种多轮强化学习框架,让模型在推理时对自己的答案进行二元自验证(Yes/No),验证失败则触发重新思考。在视觉-语言推理基准上,SVR-R1 相比标准 GRPO 基线显著提升准确率,且训练中验证轮次逐渐减少,表明模型内化了自我修正能力。
Meta 新研究聚焦长周期 AI 智能体的“行为状态衰减”问题——任务事实、先前尝试和未完成子目标在上下文窗口中被埋没或超出范围,导致后续动作失效。研究团队提出在未修改的动作智能体外并行运行一个独立记忆智能体,维护结构化记忆库,每步决定是否注入基于记忆的提醒。该模块即插即用,兼容前沿智能体和现有框架。在 Terminal-Bench 2.0 和 tau-squared-Bench 上,该方法提升了弱和强动作智能体的 pass@1 指标。研究认为,主动在正确时机呈现正确事实的记忆,比被动检索更有效。
Meta 新论文发现,后训练量化虽能缩小推理模型、降低部署成本,但会导致模型在已得出正确答案后反复自我怀疑,浪费 token。量化在不确定的词选择上引入噪声,使模型更倾向使用“wait”“but”“alternatively”等词重新开启推理。在 5 个推理模型(1.5B-32B)的数学、编程和科学任务上,激进量化使过度思考失败率最高达 52%。通过给 50 个犹豫词施以小惩罚,可剪掉 12%-23% 的推理长度,同时保持甚至提升准确率。
Meta FAIR 团队发布 Brain2Qwerty v2,从非侵入性 MEG 脑信号重建完整句子。九名志愿者输入 22000 句,平均词错误率 39%,最佳参与者 22%。v2 采用异步连续信号窗口,无需击键时间戳。模型使用三个 AI 构建块,包括基于 Qwen3 微调的语言模型将噪声信号转为连贯句子。字符错误率 31%,高于 v1 N-gram 模型的 26%,但词错误率和语义准确率更优。当前与植入式系统(词错误率 <2%)仍有差距,但数据量增加后精度持续提升。
Meta AI 推出 Brain2Qwerty v2,一种无需手术植入即可实时从脑电波解码句子的非侵入式系统。基于脑磁图(MEG)设备记录 9 名志愿者各 10 小时的打字脑活动,训练约 22,000 个句子,采用端到端深度学习并微调大语言模型。词准确率达 61%,最佳参与者达 78%,远超其他非侵入方法的 8%。解码精度随数据量对数线性提升,有望进一步缩小与手术方法的差距。Meta 已开源 v1 和 v2 训练代码,合作方 BCBL 开放 v1 数据集。
Meta 推出 Brain2Qwerty v2 非侵入式脑机接口研究,利用脑磁图(MEG)设备记录脑部磁场信号,通过 AI 模型还原自然语言。模型基于 9 名志愿者约 10 小时、22000 句子数据训练,并利用上下文补全噪声信号。实验显示平均单词识别准确率约 61%,最佳受试者达 78%,超半数测试句子错误不超过 1 个单词。目前仍需大型实验室级 MEG 设备,距离实用化有差距。Meta 已在 GitHub 开源训练代码,v2 数据集待论文接收后开放。
Meta 在 ISCA 2026 大会发布自研 Vistara ASIC 方案,通过 CXL 2.0/1.1 规范的 PCIe Gen5 x16 接口将拆机 DDR4 内存桥接到新服务器。每台 MemServer 配备 768GB DDR5 和 256GB DDR4(3:1 配比),单个 ASIC 支持双通道 DDR4 最高 3200 MT/s、最大 256GB。该方案已在数百万台服务器中用于分离式机器学习推理、大数据处理等场景,可将推理服务器数量最多减少 25%,分布式缓存平均延迟降低 29%。
We're sharing the next major milestone in our non-invasive brain-to-text decoder research: Brain2Qwerty v2. Building on ...
We're sharing the next major milestone in our non-invasive brain-to-text decoder research: Brain2Qwerty v2. Building on ...
同一事件,精选展示《Meta发布Brain2Qwerty v2:非侵入式实时句子解码》Meta 发布新研究 Autodata,提出 Agentic Self-Instruct 方法。该方法将 AI 智能体视为数据科学家,通过智能体规划与工具使用,替代传统手工调优后固定的合成数据流水线。该智能体自身可通过元优化持续改进,从而生成更强训练数据。实验在计算机科学、法律推理、数学对象推理三个领域均超越经典合成数据方法,且元优化带来更大提升。论文见 arxiv。
Meta提出Autodata,将合成数据生成视为智能体数据科学家的任务。核心方法“Agentic Self-Instruct”让AI智能体生成并元优化合成训练与评估数据。循环流程:生成示例→弱模型与强模型分别尝试→判断结果→修订配方直至示例处于有用区间。论文强调难度不是美德,示例应针对弱模型的学习点。关键结果:在法律任务上,4B模型训练后超越了更大的397B基线。
Yann LeCun团队的新论文探讨了LeJEPA模型学习真实世界隐藏变量的条件。其核心结论是,LeJEPA只有在真实的隐藏变量呈现高斯云结构时,才能可靠地学习它们。论文通过数学证明,当这些隐藏变量是独立高斯变量,并且配对视图由一个稳定的噪声过程生成时,LeJEPA的最优解能够以旋转或翻转等价的形式恢复这些变量。这项研究为自监督AI模型究竟在何时能真正理解世界结构(而不仅仅是提取在测试集上有效的特征)提供了理论解释。
Meta 推出SilverTorch推荐系统架构,统一了用户生成内容的所有检索组件。该架构吞吐量比现有技术高23.7倍,计算成本效率比CPU方案高20.9倍,同时提升了准确性。
Meta、CMU等机构在论文中提出了Self-play SWE-RL方法。该方法让编程智能体通过“自我博弈”生成训练数据,而非仅依赖人工标注的问题。具体而言,一个模型探索代码库、注入bug并留下测试用例来描述问题;另一个模型则学习根据测试修复系统。其中,测试成为了描述问题的核心语言。该方法在SWE-bench Verified上提升了+10.4分,在SWE-Bench Pro上提升了+7.8分。值得注意的是,评估使用了该系统未训练过的自然语言问题,表明其可能学到了更深层的软件理解能力。
Meta、斯坦福与伊利诺伊的研究论文指出,AI智能体在将代码作为主要工作层时性能更佳。论文认为,大语言模型(LLM)作为文本预测器,在处理长任务时存在状态丢失、错误隐蔽等问题。真正的进步并非“AI写代码”,而是“AI在代码环境中思考”。论文的核心是提出一个以代码为中心的“智能体框架”,即工具、记忆、沙箱等系统。在此框架中,测试成为传感器,代码库成为记忆,日志成为历史,沙箱成为边界。生成的脚本成为可运行、检查、修改和共享的操控对象。总结发现,代码能通过可执行步骤帮助智能体推理,通过工具调用行动,并通过测试、日志等对环境进行建模。
Meta提出AIRA系统,通过分离策略与实现的双代理架构,实现神经架构的自主发现。AIRA-Compose负责宏观架构搜索,AIRA-Design专注低级机制实现。该系统在24小时计算预算内,于350M、1B和3B规模上找到超越Llama 3.2的架构。其核心方法论表明,在复杂任务中分离规划代理与实现代理能提升效能,此思路同样适用于流水线组装、查询规划等其他AI代理场景。
针对大语言模型在使用长上下文前缀时面临影响力衰减和计算开销大这两个问题,本文提出了一种名为“注意力状态记忆”的无训练方法。该方法将上下文前缀外化为一个轻量级、基于查找的预计算记忆库,存储了前缀与查询词之间的注意力状态。实验表明,在 LLaMA-3.1-8B 上,该方法在 1K-8K 记忆预算下提升了准确率,并将注意力计算延迟降低了 1.36 倍。同时,它在 NBA 基准测试中,仅用全注意力 RAG 20% 的内存开销,便超越了其性能表现。
Banger paper from Meta FAIR. They introduce Autodata, an agentic data scientist that builds high-quality training and ev...