小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。
小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。
普林斯顿大学团队通过“影子评估”测试前沿AI智能体的开放式研究能力:让智能体在六天时间内、使用数千美元API额度和算力,回答两篇未发表论文的核心研究问题,结果两篇论文均被原作者明确拒绝。分析显示,智能体缺乏研究判断力、资源意识、创造性反馈应对能力和有效回溯能力,且未遵循具体指令。研究团队认为,开放式研究对前沿AI智能体仍具挑战性,但结果尚属初步,需扩大样本量并持续评估。
腾讯混元团队、清华AIR与东南大学推出E-Bench,以王者荣耀、QQ音乐、腾讯会议为原型构建全合成环境,用确定性数据库状态diff评测智能体多步骤工具使用能力。11个前沿模型平均成功率仅54.56%,最强模型Pass³也只有58.82%;腾讯混元Hy3在E-Bench-Code下以约$0.029的单任务成本取得64.40%的Avg@3,兼具成本优势。
小红书 dots 团队提出 Vision-OPD,一个无需外部教师或推理工具的区域到全局在线自蒸馏框架。仅用约 6.2K 条合成数据,便让基于 Qwen3.5 的 9B 模型在六个细粒度基准上平均准确率达 79.7%,超越 Gemini-3.5-Flash、GPT-5.4 等闭源模型及 Qwen3.5-397B,且不损失通用能力。
小红书 dots 团队提出 Vision-OPD,一种区域到全局在线自蒸馏框架,让模型无需外部教师或推理工具即可从全图中识别细粒度证据。仅用约 6.2K 条全自动合成数据,Vision-OPD-9B 即在多个细粒度基准上以 79.68 平均分总体第一,超越 Gemini-3.5-Flash、GPT-5.4 等闭源模型,同时保持通用视觉任务表现。
BAIR提出ABBEL框架,将长程交互中的摘要生成隔离为自然语言信念状态,并通过信念评分进行监督。在CollabBench协作编程测试中,基于重建的信念评分将全上下文模型的性能差距缩小约50%,训练步数减少50%。该方法解决了递归摘要(如Cursor Composer 2.5采用的压缩技术)在有限训练数据下性能下降的问题。
小红书、上海交通大学、华中科技大学和北京理工大学联合提出 UniNote,将多模态表示学习与排序能力融合于单一模型。通过两阶段训练(对比 SFT 强化表示 + 强化学习排序优化),UniNote 在单次嵌入传递中实现与两阶段检索-排序范式相当的性能,并大幅降低延迟。
小红书联合上海交大、华中科大、北理工提出 UniNote,将多模态表示学习与排序优化融合于单一嵌入模型,替代传统“Embedder + Reranker”两阶段管道,在单次嵌入传递内实现相当性能并大幅降低延迟。
美团 LongCat 团队开源 LoHoSearch,一个基于知识图谱自动生成题目的搜索智能体评测基准。该基准以 762 万维基百科实体构建知识图谱,生成 544 道经人工核验的题目,覆盖 11 个领域。当前最强模型 GPT-5.5 准确率仅 34.74%,远低于其在 BrowseComp 上的表现,表明 LoHoSearch 对长程搜索构成实质挑战。
同一事件,精选展示《美团开源 LoHoSearch:用知识图谱自动化构造高难度搜索智能体评测基准》美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。
美团 LongCat 团队构建 MineExplorer,这是首个在开放世界中做到分钟级长程任务的评测基准,含 813 个人工验证实例(1-hop 到 4-hop)及规则化里程碑自动评测框架。
同一事件,精选展示《MineExplorer:首个《我的世界》分钟级长程任务评测基准发布》小红书技术团队开源 BigMac,一种针对多模态大模型训练的依赖安全嵌套流水线新范式。它以 LLM 流水线为主干,在不打乱执行顺序的前提下嵌入编码器和生成器计算,相比基线实现 1.08x-1.9x 加速,同时保持激活显存有界。BigMac 已作为 dots 多模态模型训练的核心组件投入生产。
另有 1 家信源报道公众号:小红书技术(dots.llm)小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;推理 prefill 吞吐相比 SGLang 提升 1.56 倍。
通义实验室发布 Wan-Streamer v0.2,端到端响应延迟 550ms(200ms 模型延迟 + 350ms 网络延迟),输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS。
HYPIC 在混合注意力大模型上实现了位置无关缓存,将首 token 延迟平均降低 3.25 倍。在 4 个生产级模型上,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。
小红书联合北大、上交提出 HYPIC,这是首个在混合注意力大模型上实现位置无关缓存的服务系统。在 4 个生产级混合注意力模型、5 个工作负载上,HYPIC 将首 token 延迟(TTFT)平均降低 3.25 倍,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。该系统通过缓存段累积转移算子实现线性层常数时间状态组合,并用缝合窗口修复全注意力层跨段对齐。
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。
字节跳动Seed团队发布EdgeBench,包含134个真实世界任务,覆盖科学发现、软件工程等6个领域,每任务支持至少12小时连续智能体运行。基于约38,000小时交互数据,发现总体性能与环境交互时间呈精确对数S形缩放定律(R²=0.998),且智能体学习速度约每三个月翻倍。已公开51个任务及完整评估框架。
另有 1 家信源报道字节 Seed:Research Feed(网页内嵌数据)RedKnot 将 KV Cache 沿注意力头维度拆解,通过头分类稀疏(局部头占 83.4%–96.8%)、稀疏 FFN 和 SegPagedAttention 三个机制统一算法与存储粒度。在 8 卡 H800 上,TTFT 最高加速 1.6–3.54×,单卡并发提升 4.7–7.8×,预填充 FLOPs 削减 67%–79.5%。DeepSeek-V4-Flash 上 128K 上下文 TTFT 加速达 5.16×,KV 传输最多省 6.3×。精度通常不低于稠密 F1 的 95%。
美团 LongCat 团队开源 VitaBench 2.0,这是首个真实生活场景下面向长期动态用户建模的智能体评测基准,包含56名真实特征用户、819个复杂任务、超2000个动态偏好及66个可执行工具,平均每位用户交互事件达2093个、时间跨度1580天。
Ling Team 在 arxiv 发表论文,重新思考 FP4 预训练中的格式选择。研究发现,主流 E2M1 格式存在先天 Shrinkage Bias,导致数值量化时左右 rounding bin 不对称,该 bias 在训练中累积拖慢收敛。相比之下,E1M2/INT4 这类 uniform 格式在配合 Random Hadamard Transform(RHT)后,更高的 bucket 利用率能转化为实际量化质量收益,收敛表现优于 E2M1。团队提出 UFP4 方案:在 E1M2/INT4 下为三种 GEMM 操作数启用 RHT,并将 SR 用于 dy 量化。研究认为,细粒度量化与 RHT 引入后,FP4 训练已转向“局部分辨率主导”,uniform 4-bit 格式的价值应被重新评估。
Qwen 团队发布 Qwen-AgentWorld,一个以环境建模为训练目标的原生语言世界模型,在单个模型中模拟 MCP、Search、Terminal、SWE 及 GUI 域(Web、OS、Android)共七个域。模型使用超 1000 万条真实交互轨迹训练,在 AgentWorldBench 上以 Qwen-AgentWorld-397B-A17B 版本达最高模拟质量,超越 GPT-5.4、Claude Opus 4.8 和 Gemini 3.1 Pro。同时发布评测基准 AgentWorldBench。该模型可作为解耦环境模拟器用于智能体 RL 训练,也可作为统一智能体基础模型,经 LWM 预热后无需智能体 RL 微调即可迁移。模型和基准已开源在 Hugging Face 和 ModelScope。
另有 4 家信源报道Hacker News 热门(buzzing.cc 中文翻译)HuggingFace Daily Papers(社区热门论文)公众号:通义实验室(千问)X:通义千问 / Qwen (@Alibaba_Qwen)深度研究智能体在结合私有本地文档与外部网页检索时存在隐私泄露风险。MosaicLeaks 提出包含 1,001 条多跳研究链的新任务,每条链交错混合本地与公共子问题。测试发现智能体频繁泄露私有信息,单纯优化任务性能反而加剧泄露。基于此,研究提出隐私感知深度研究(PA-DR)强化学习训练方法,将严格链成功率从 48.7% 提升至 58.7%,同时将答案/全面信息泄露率从 34.0% 降至 9.9%。
2026年6月,伯克利RDI发布Agents’ Last Exam(ALE)基准,包含1,500余项源于真实工作的任务,覆盖55个非体力职业。对Fable 5、GPT-5.5、Composer 2.5等前沿智能体的测评显示:在最困难层级成功率均为0%;整体任务表现接近,但单任务成本差异巨大(Fable 5约$15.70,GPT-5.5约$3.80,Composer 2.5约$1.33)。CLI子集ALE-CLI最佳通过率仅25.2%。主要失败模式是智能体未验证输出即宣称完成。数据集、代码及CLI子集已开源。
美团 LongCat 团队推出 WBench,首个面向交互式视频世界模型的系统性多轮评测基准。包含 289 个测试案例、1058 个交互轮次,覆盖导航、主体动作、事件编辑、视角切换四种交互方式,从视频质量、设定遵循度、交互遵循度、一致性、物理真实性五维度评测 20 个前沿模型(包括 Kling 3.0、HY-World 1.5、Genie 3 等)。核心发现:无全能模型,导航能力与画质无关;多轮交互后所有模型性能下降,导航平均分下降 33 点;开源模型 HY-World 1.5 导航能力突出;视角切换最难(平均分 30.7)。WBench 已开源。
CVPR 2026 将 Longuet-Higgins Prize「时间检验奖」授予 2015 年发表的《Deep Residual Learning for Image Recognition》(ResNet)。该论文由何恺明、张祥雨、任少卿、孙剑完成,提出的残差学习思想解决了深层神经网络训练难题,已成为现代深度学习基础结构。同获该奖的还有 YOLO v1。ResNet 全球引用量超 32 万次,是 21 世纪被引最多论文。阶跃算法团队正热招大模型技术人才。
另有 1 家信源报道公众号:阶跃星辰(Step)蚂蚁百灵团队提出新激活函数 PowLU,以解决 SwiGLU 在 FP8 等低精度训练中因二次增长放大异常值导致的 Loss Spike 和训练崩溃问题。
通义实验室推出文生图评测基准Qwen-Image-Bench,由专业艺术家团队开发,将创作能力解构为5大核心支柱、17大场景及56项可量化维度。配套开源自动化评估模型Q-Judger,与资深人类艺术家评估相关性达Spearsman 0.92。评测使用1000条中英文分层Prompt,每条覆盖至少4项考点。结果显示,当前T2I模型在文字准确性、信息可视化、跨语言生成等子领域差距明显,世界知识与逻辑推理能力是跻身第一梯队的分水岭。完整数据集与Q-Judger已开源。
inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-2b,用于文本、图像、图文、多语言及查询/回复侧的安全评估。SingGuard 将安全策略作为运行时输入而非固定训练分类,支持部署团队在不重新训练模型的情况下,依据默认或自定义自然语言规则进行内容审核。该模型在多项多模态安全基准上取得平均最优性能,支持快速首 token 路由与深度推理结合的动态推理流程,兼容 Transformers 和 vLLM 的 chat 消息输入。
另有 1 家信源报道蚂蚁 inclusionAI:HuggingFace 新模型蚂蚁集团 inclusionAI 开源了 SingGuard 多模态安全护栏模型族,包含 2B、4B 和 8B 三个版本。SingGuard 将安全策略作为运行时输入而非训练时固定分类,部署团队无需重新训练即可按默认分类或自定义自然语言规则评估内容。模型支持文本、图像、图文、多语言、查询侧和回复侧的安全审核,采用“快-慢”动态推理机制。SingGuard 在多模态安全、图像安全、文本查询安全、文本回复安全、多语言查询安全及多语言回复安全基准上达到平均 SOTA 性能。模型基于 Qwen3-VL 架构,支持通过 Transformers 和 vLLM 部署。
另有 1 家信源报道蚂蚁 inclusionAI:HuggingFace 新模型4月,Dharma 发布 DharmaOCR——一对 3B 参数专用小语言模型,用于结构化 OCR,同时开源基准与论文。在巴西葡萄牙语 OCR 基准上,该 3B 专用模型通过全微调实现综合得分 0.911,超过所有测试的商业前沿 API(Claude Opus 4.6 0.833、Gemini 3.1 Pro 0.820、GPT-5.4 0.750)。每百万页成本仅为 Claude Opus 4.6 的约 1/52,质量与成本均占据 Pareto 前沿。结果表明:当训练数据与部署任务充分对齐时,参数规模不再是决定性变量,专业化微调能以极低代价实现更高性能。
Google Cloud 在 SIGMOD 发表论文,提出用代理模型(proxy model)加速 BigQuery 和 AlloyDB 中的 AI 函数。代理模型是面向特定查询和数据微调的轻量级模型,在 10 个基准测试中 F1 分数达到 LLM 的 90%-116%。该优化已默认集成在 BigQuery 和 AlloyDB 的优化模式下。
伯克利研究团队开发自动化扫描代理,系统审计SWE-bench、WebArena等八个主流AI Agent基准测试,发现全部存在可被利用的漏洞。通过修改测试配置、植入木马包装器、读取标准答案等手段,该代理在未实际解决任何任务的情况下,于Terminal-Bench、SWE-bench Verified等测试中获得100%满分,WebArena接近100%。研究揭示了当前AI基准测试评分机制存在系统性安全缺陷,高分不等于真实能力。
另有 2 家信源报道Hacker News 热门(buzzing.cc 中文翻译)Berkeley RDI:Blog(AI 安全与评测)普林斯顿大学研究人员将AI智能体可靠性分解为4个维度共12项指标,对14个模型测试发现,近18个月能力快速进步仅带来有限的可靠性提升,一致性得分仅30%-75%。研究团队计划推出“可靠性指数”以推动系统性改进。
字节跳动Seed团队发布扩散语言模型Seed Diffusion,采用非自回归的扩散架构替代传统GPT类模型,通过去噪扩散机制并行生成文本,突破逐token解码的速度瓶颈。该模型在保持大规模参数能力的同时显著提升推理效率,在文本生成任务中实现生成质量与计算速度的平衡,为大规模语言模型提供了自回归范式之外的高性能替代方案。
针对扭曲MoTe₂体系,研究者采用深度学习框架表达多体波函数,精准识别出整数/分数量子反常霍尔态及Z₂拓扑绝缘体。相比传统方法,该方案在计算效率与精度上显著提升,可处理更大规模系统并区分竞争相(如分数量子反常霍尔态与电荷密度波),理论预测与实验观测高度吻合。
研究人员推出 CORE-Bench 基准,用于衡量 AI 自动化复现论文计算结果的能力。该基准包含 90 篇论文,设三个难度等级。测试中,基于 GPT-4o 的专用智能体 CORE-Agent 在最高难度等级上准确率仅达 22%。
神经正切核是一种用于解释神经网络在梯度下降训练过程中演化行为的核方法。它深入阐释了为何宽度足够的神经网络能够一致收敛至经验损失函数的全局最小值,即使在参数量远超训练样本数的过参数化情况下亦是如此。研究进一步探讨了在神经网络具有无限宽度的设定下,通过刻画神经正切核来证明其在不同初始化条件下能够确定性收敛的理论依据。