内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态一手 · 38 条
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「arXiv」清除

8月7日周五

18:00公众号:小红书技术(dots.llm)65精选小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026

8月5日周三

22:31AI as Normal Technology(RSS)70精选AI智能体尚无法开展开放式AI研究

8月3日周一

20:35公众号:腾讯混元55E-Bench:以腾讯产品为原型的 AI 智能体大考

7月29日周三

12:00公众号:小红书技术(dots.llm)37小红书 dots 团队提出 Vision-OPD,让 9B 模型细粒度视觉理解超越 GPT-5.4

7月28日周二

19:00公众号:小红书技术(dots.llm)56小红书 dots 团队提出 Vision-OPD,让多模态大模型"看清细节"

7月27日周一

11:55BAIR:Berkeley AI Research Blog51ABBEL:通过信念瓶颈提升LLM长程交互中的摘要学习效率

7月24日周五

18:10公众号:小红书技术(dots.llm)49小红书等提出 UniNote:统一多模态嵌入模型
18:00公众号:小红书技术(dots.llm)40UniNote:小红书等提出统一多模态嵌入模型,融合表征与排序
12:00公众号:龙猫LongCat(美团)58同事件美团 LongCat 开源 LoHoSearch:基于知识图谱的搜索智能体评测基准同一事件,精选展示《美团开源 LoHoSearch:用知识图谱自动化构造高难度搜索智能体评测基准》
12:00公众号:龙猫LongCat(美团)68精选MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

7月23日周四

19:58公众号:龙猫LongCat(美团)62同事件MineExplorer:美团 LongCat 评测揭示顶级多模态大模型在动态开放世界中的能力断层同一事件,精选展示《MineExplorer:首个《我的世界》分钟级长程任务评测基准发布》

7月22日周三

18:10公众号:小红书技术(dots.llm)62精选小红书开源 BigMac:多模态大模型训练新范式

7月20日周一

16:10公众号:小红书技术(dots.llm)68精选小红书与北大开源 UltraEP:面向大规模 MoE 训推的实时负载均衡方案

7月17日周五

15:14公众号:通义实验室(千问)76精选Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话

7月16日周四

18:10公众号:小红书技术(dots.llm)77精选HYPIC:小红书联合北大、上交提出首个混合注意力大模型位置无关缓存系统
18:00公众号:小红书技术(dots.llm)75精选小红书联合北大、上交提出 HYPIC,让混合注意力大模型用上位置无关缓存,首 token 延迟降 3.25 倍

7月13日周一

19:20公众号:腾讯混元76精选腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍

7月7日周二

12:22字节 Seed:Research Papers(网页内嵌数据)74精选EdgeBench:从真实世界环境中揭示学习缩放定律

6月29日周一

19:10公众号:小红书技术(dots.llm)72精选小红书 RedKnot 推理引擎:将 KV Cache 按注意力头拆解实现长文本加速

6月25日周四

19:58公众号:龙猫LongCat(美团)69精选美团 LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆
09:00公众号:蚂蚁百灵(Ling)51Ling Team 提出 UFP4:FP4 预训练中 E1M2/INT4 配合 RHT 优于 E2M1

6月24日周三

11:54Qwen:Blog Retrieval(API)81精选Qwen-AgentWorld:面向通用智能体的语言世界模型

6月19日周五

02:47Hugging Face:Blog(RSS)75精选MosaicLeaks: 你的研究智能体能保守秘密吗?

6月16日周二

09:59Berkeley RDI:Blog(AI 安全与评测)83精选伯克利RDI发布Agents' Last Exam基准

6月13日周六

17:54公众号:龙猫LongCat(美团)54WBench:面向交互式视频世界模型的首个系统性多轮评测基准

6月7日周日

02:11公众号:阶跃星辰(Step)71精选阶跃首席科学家张祥雨合著论文 ResNet 获 CVPR 2026 「时间检验奖」

5月29日周五

09:39公众号:蚂蚁百灵(Ling)81精选蚂蚁百灵团队为何重新设计 SwiGLU?PowLU 激活函数的诞生始末

5月28日周四

17:47公众号:通义实验室(千问)54通义实验室发布Qwen-Image-Bench:56项细粒度创作评测基准

5月25日周一

18:48蚂蚁 inclusionAI:HuggingFace 新模型69精选inclusionAI 发布 SingGuard 系列模型,首版为 SingGuard-2b
15:25蚂蚁 inclusionAI:GitHub 新仓库63精选蚂蚁 inclusionAI 开源 SingGuard 多模态安全护栏模型族

5月23日周六

00:16Hugging Face:Blog(RSS)50专业化胜过规模:Dharma 发布 DharmaOCR,3B 专用模型在 OCR 基准上超越商业前沿 API

5月14日周四

00:00Google Cloud:Databases(RSS)71精选Google Cloud 用代理模型加速数据库 AI 函数

4月8日周三

00:00Berkeley RDI:Blog(AI 安全与评测)87精选我们如何攻破顶级AI Agent基准测试及未来展望

2月24日周二

21:07AI as Normal Technology(RSS)76精选普林斯顿大学发布AI智能体可靠性科学论文

8月4日周一

00:00字节 Seed:Research Papers(网页内嵌数据)Seed Diffusion:支持高速推理的大规模扩散语言模型

3月14日周五

00:00字节 Seed:Research Papers(网页内嵌数据)深度学习揭示整数和分数量子反常霍尔态

9月18日周三

22:32AI as Normal Technology(RSS)57CORE-Bench 基准发布:AI 复现论文能力测试准确率仅 22%

9月9日周五

01:00Lilian Weng:Lil'Log(RSS)33神经正切核背后的数学原理
共 38 条,没有更多了
全部 AI 动态
2026年8月25日星期二 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
一手信源 · 标签「arXiv」 · 38 条清除

8月7日

星期五 · 1 条
18:00
公众号:小红书技术(dots.llm)精选
AI 评分 65/100
小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026

小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。

arXivHugging Face开源生态数据/训练

推荐理由:CULTURE-MT将翻译评测从字面准确拉到文化传递,自动评估模型与开放榜单提供了可复现的评测-训练闭环,让改进不再凭感觉。

8月5日

星期三 · 1 条
22:31
AI as Normal Technology(RSS)精选
AI 评分 70/100
AI智能体尚无法开展开放式AI研究

普林斯顿大学团队通过“影子评估”测试前沿AI智能体的开放式研究能力:让智能体在六天时间内、使用数千美元API额度和算力,回答两篇未发表论文的核心研究问题,结果两篇论文均被原作者明确拒绝。分析显示,智能体缺乏研究判断力、资源意识、创造性反馈应对能力和有效回溯能力,且未遵循具体指令。研究团队认为,开放式研究对前沿AI智能体仍具挑战性,但结果尚属初步,需扩大样本量并持续评估。

智能体arXiv论文/研究

推荐理由:通过让代理复现未发表研究,论文系统暴露了当前模型在开放式研究上缺乏判断力和资源意识,这为评估递归自我改进提供了更现实的基准。

8月3日

星期一 · 1 条
20:35
公众号:腾讯混元
AI 评分 55/100
E-Bench:以腾讯产品为原型的 AI 智能体大考

腾讯混元团队、清华AIR与东南大学推出E-Bench,以王者荣耀、QQ音乐、腾讯会议为原型构建全合成环境,用确定性数据库状态diff评测智能体多步骤工具使用能力。11个前沿模型平均成功率仅54.56%,最强模型Pass³也只有58.82%;腾讯混元Hy3在E-Bench-Code下以约$0.029的单任务成本取得64.40%的Avg@3,兼具成本优势。

智能体arXiv论文/研究评测/基准

7月29日

星期三 · 1 条
12:00
公众号:小红书技术(dots.llm)
AI 评分 37/100
小红书 dots 团队提出 Vision-OPD,让 9B 模型细粒度视觉理解超越 GPT-5.4

小红书 dots 团队提出 Vision-OPD,一个无需外部教师或推理工具的区域到全局在线自蒸馏框架。仅用约 6.2K 条合成数据,便让基于 Qwen3.5 的 9B 模型在六个细粒度基准上平均准确率达 79.7%,超越 Gemini-3.5-Flash、GPT-5.4 等闭源模型及 Qwen3.5-397B,且不损失通用能力。

arXiv多模态论文/研究

7月28日

星期二 · 1 条
19:00
公众号:小红书技术(dots.llm)
AI 评分 56/100
小红书 dots 团队提出 Vision-OPD,让多模态大模型"看清细节"

小红书 dots 团队提出 Vision-OPD,一种区域到全局在线自蒸馏框架,让模型无需外部教师或推理工具即可从全图中识别细粒度证据。仅用约 6.2K 条全自动合成数据,Vision-OPD-9B 即在多个细粒度基准上以 79.68 平均分总体第一,超越 Gemini-3.5-Flash、GPT-5.4 等闭源模型,同时保持通用视觉任务表现。

arXiv多模态数据/训练论文/研究

7月27日

星期一 · 1 条
11:55
BAIR:Berkeley AI Research Blog
AI 评分 51/100
ABBEL:通过信念瓶颈提升LLM长程交互中的摘要学习效率

BAIR提出ABBEL框架,将长程交互中的摘要生成隔离为自然语言信念状态,并通过信念评分进行监督。在CollabBench协作编程测试中,基于重建的信念评分将全上下文模型的性能差距缩小约50%,训练步数减少50%。该方法解决了递归摘要(如Cursor Composer 2.5采用的压缩技术)在有限训练数据下性能下降的问题。

arXiv推理数据/训练编码

7月24日

星期五 · 4 条
18:10
公众号:小红书技术(dots.llm)
AI 评分 49/100
小红书等提出 UniNote:统一多模态嵌入模型

小红书、上海交通大学、华中科技大学和北京理工大学联合提出 UniNote,将多模态表示学习与排序能力融合于单一模型。通过两阶段训练(对比 SFT 强化表示 + 强化学习排序优化),UniNote 在单次嵌入传递中实现与两阶段检索-排序范式相当的性能,并大幅降低延迟。

arXiv多模态搜索论文/研究
18:00
公众号:小红书技术(dots.llm)
AI 评分 40/100
UniNote:小红书等提出统一多模态嵌入模型,融合表征与排序

小红书联合上海交大、华中科大、北理工提出 UniNote,将多模态表示学习与排序优化融合于单一嵌入模型,替代传统“Embedder + Reranker”两阶段管道,在单次嵌入传递内实现相当性能并大幅降低延迟。

arXiv多模态搜索论文/研究
12:00
公众号:龙猫LongCat(美团)同事件
AI 评分 58/100
美团 LongCat 开源 LoHoSearch:基于知识图谱的搜索智能体评测基准

美团 LongCat 团队开源 LoHoSearch,一个基于知识图谱自动生成题目的搜索智能体评测基准。该基准以 762 万维基百科实体构建知识图谱,生成 544 道经人工核验的题目,覆盖 11 个领域。当前最强模型 GPT-5.5 准确率仅 34.74%,远低于其在 BrowseComp 上的表现,表明 LoHoSearch 对长程搜索构成实质挑战。

arXiv开源生态搜索评测/基准
同一事件,精选展示《美团开源 LoHoSearch:用知识图谱自动化构造高难度搜索智能体评测基准》
12:00
公众号:龙猫LongCat(美团)精选
AI 评分 68/100
MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。

arXiv具身智能多模态论文/研究

推荐理由:18 个顶级多模态模型在 Minecraft 里全翻车,每多一层隐藏前置条件成功率就砍半,搞具身智能的该看看感知和行动之间还隔着什么。

7月23日

星期四 · 1 条
19:58
公众号:龙猫LongCat(美团)同事件
AI 评分 62/100
MineExplorer:美团 LongCat 评测揭示顶级多模态大模型在动态开放世界中的能力断层

美团 LongCat 团队构建 MineExplorer,这是首个在开放世界中做到分钟级长程任务的评测基准,含 813 个人工验证实例(1-hop 到 4-hop)及规则化里程碑自动评测框架。

arXiv具身智能多模态论文/研究
同一事件,精选展示《MineExplorer:首个《我的世界》分钟级长程任务评测基准发布》

7月22日

星期三 · 1 条
18:10
公众号:小红书技术(dots.llm)精选
AI 评分 62/100
小红书开源 BigMac:多模态大模型训练新范式

小红书技术团队开源 BigMac,一种针对多模态大模型训练的依赖安全嵌套流水线新范式。它以 LLM 流水线为主干,在不打乱执行顺序的前提下嵌入编码器和生成器计算,相比基线实现 1.08x-1.9x 加速,同时保持激活显存有界。BigMac 已作为 dots 多模态模型训练的核心组件投入生产。

arXivGitHub多模态开源/仓库
另有 1 家信源报道公众号:小红书技术(dots.llm)
推荐理由:过去多模态训练要么废显存要么慢到崩溃,BigMac 用“嵌套流水线”破掉了这个帕累托前沿,做多模态大模型且被训练效率卡住的团队值得动手试一下。

7月20日

星期一 · 1 条
16:10
公众号:小红书技术(dots.llm)精选
AI 评分 68/100
小红书与北大开源 UltraEP:面向大规模 MoE 训推的实时负载均衡方案

小红书与北大提出 UltraEP,首次将基于精确路由信息的实时负载均衡引入生产系统,在每个 microbatch 和每一层动态复制热点专家。在 Qwen3-235B 等模型上,训练吞吐平均达到理想性能的 94.6%,相比 Megatron-LM 提升 42%;推理 prefill 吞吐相比 SGLang 提升 1.56 倍。

arXivGitHub开源/仓库部署/工程

推荐理由:MoE 训练推理的负载不均是个老痛点,UltraEP 用实时复制热专家的方式把 GPU 利用率拉到 94% 的理想线,代码和论文都开源了,做大规模分布式训练的团队可以直接参考。

7月17日

星期五 · 1 条
15:14
公众号:通义实验室(千问)精选
AI 评分 76/100
Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话

通义实验室发布 Wan-Streamer v0.2,端到端响应延迟 550ms(200ms 模型延迟 + 350ms 网络延迟),输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS。

arXiv多模态模型发布视频

推荐理由:550ms端到端延迟把实时视频对话从拼接流水线推入单模型交互循环,原先因响应太慢而无法沉浸的口语陪练与面试模拟,开始具备自然对话的交互基础。

7月16日

星期四 · 2 条
18:10
公众号:小红书技术(dots.llm)精选
AI 评分 77/100
HYPIC:小红书联合北大、上交提出首个混合注意力大模型位置无关缓存系统

HYPIC 在混合注意力大模型上实现了位置无关缓存,将首 token 延迟平均降低 3.25 倍。在 4 个生产级模型上,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。

arXivGitHub推理论文/研究

推荐理由:混合注意力模型终于有了可用的位置无关缓存方案,HYPIC 用转移算子缓存和缝合窗口解决了长期兼容难题,对长上下文推理服务的加速意义重大,做推理 infra 的团队可以马上看论文和代码。
18:00
公众号:小红书技术(dots.llm)精选
AI 评分 75/100
小红书联合北大、上交提出 HYPIC,让混合注意力大模型用上位置无关缓存,首 token 延迟降 3.25 倍

小红书联合北大、上交提出 HYPIC,这是首个在混合注意力大模型上实现位置无关缓存的服务系统。在 4 个生产级混合注意力模型、5 个工作负载上,HYPIC 将首 token 延迟(TTFT)平均降低 3.25 倍,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。该系统通过缓存段累积转移算子实现线性层常数时间状态组合,并用缝合窗口修复全注意力层跨段对齐。

arXiv开源/仓库推理论文/研究

推荐理由:此前位置无关缓存无法用于混合注意力模型,HYPIC 通过缓存转移算子与缝合窗口首次实现,RAG 场景 TTFT 降低 3.25 倍,开源代码为推理系统提供了可复用的加速路径。

7月13日

星期一 · 1 条
19:20
公众号:腾讯混元精选
AI 评分 76/100
腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍

腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。

arXivGitHub多模态开源生态

推荐理由:我觉得这是近期最实在的OCR开源,1B参数覆盖多任务、推理加速6倍,还支持llama.cpp本地部署,做文档解析的同学可以直接上车。

7月7日

星期二 · 1 条
12:22
字节 Seed:Research Papers(网页内嵌数据)精选
AI 评分 74/100
EdgeBench:从真实世界环境中揭示学习缩放定律

字节跳动Seed团队发布EdgeBench,包含134个真实世界任务,覆盖科学发现、软件工程等6个领域,每任务支持至少12小时连续智能体运行。基于约38,000小时交互数据,发现总体性能与环境交互时间呈精确对数S形缩放定律(R²=0.998),且智能体学习速度约每三个月翻倍。已公开51个任务及完整评估框架。

智能体arXiv论文/研究评测/基准
另有 1 家信源报道字节 Seed:Research Feed(网页内嵌数据)
推荐理由:这篇论文首次量化了智能体在134个长周期真实任务中从环境学习的性能曲线,发现log-sigmoid缩放定律精确度极高,且学习速度约每三个月翻倍。对于正在设计长期自主agent的团队,这是一份必须看的底层规律报告。

6月29日

星期一 · 1 条
19:10
公众号:小红书技术(dots.llm)精选
AI 评分 72/100
小红书 RedKnot 推理引擎:将 KV Cache 按注意力头拆解实现长文本加速

RedKnot 将 KV Cache 沿注意力头维度拆解,通过头分类稀疏(局部头占 83.4%–96.8%)、稀疏 FFN 和 SegPagedAttention 三个机制统一算法与存储粒度。在 8 卡 H800 上,TTFT 最高加速 1.6–3.54×,单卡并发提升 4.7–7.8×,预填充 FLOPs 削减 67%–79.5%。DeepSeek-V4-Flash 上 128K 上下文 TTFT 加速达 5.16×,KV 传输最多省 6.3×。精度通常不低于稠密 F1 的 95%。

arXivGitHub产品更新推理

推荐理由:小红书把 KV Cache 从 token 级拆成按头分家,这个思路让长文本推理的 TTFT 和并发都有数量级提升,开源出来对做推理引擎的同学是个福音。

6月25日

星期四 · 2 条
19:58
公众号:龙猫LongCat(美团)精选
AI 评分 69/100
美团 LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆

美团 LongCat 团队开源 VitaBench 2.0,这是首个真实生活场景下面向长期动态用户建模的智能体评测基准,包含56名真实特征用户、819个复杂任务、超2000个动态偏好及66个可执行工具,平均每位用户交互事件达2093个、时间跨度1580天。

智能体arXivHugging Face论文/研究

推荐理由:它将评测重心从单次任务转移到对用户偏好的长期追踪与主动沟通,实验显示主动提问和偏好利用仍是普遍短板,记忆策略并非简单叠加,这会改变智能体个性化研究的评估方法。
09:00
公众号:蚂蚁百灵(Ling)
AI 评分 51/100
Ling Team 提出 UFP4:FP4 预训练中 E1M2/INT4 配合 RHT 优于 E2M1

Ling Team 在 arxiv 发表论文,重新思考 FP4 预训练中的格式选择。研究发现,主流 E2M1 格式存在先天 Shrinkage Bias,导致数值量化时左右 rounding bin 不对称,该 bias 在训练中累积拖慢收敛。相比之下,E1M2/INT4 这类 uniform 格式在配合 Random Hadamard Transform(RHT)后,更高的 bucket 利用率能转化为实际量化质量收益,收敛表现优于 E2M1。团队提出 UFP4 方案:在 E1M2/INT4 下为三种 GEMM 操作数启用 RHT,并将 SR 用于 dy 量化。研究认为,细粒度量化与 RHT 引入后,FP4 训练已转向“局部分辨率主导”,uniform 4-bit 格式的价值应被重新评估。

arXiv数据/训练论文/研究

6月24日

星期三 · 1 条
11:54
Qwen:Blog Retrieval(API)精选
AI 评分 81/100
Qwen-AgentWorld:面向通用智能体的语言世界模型

Qwen 团队发布 Qwen-AgentWorld,一个以环境建模为训练目标的原生语言世界模型,在单个模型中模拟 MCP、Search、Terminal、SWE 及 GUI 域(Web、OS、Android)共七个域。模型使用超 1000 万条真实交互轨迹训练,在 AgentWorldBench 上以 Qwen-AgentWorld-397B-A17B 版本达最高模拟质量,超越 GPT-5.4、Claude Opus 4.8 和 Gemini 3.1 Pro。同时发布评测基准 AgentWorldBench。该模型可作为解耦环境模拟器用于智能体 RL 训练,也可作为统一智能体基础模型,经 LWM 预热后无需智能体 RL 微调即可迁移。模型和基准已开源在 Hugging Face 和 ModelScope。

智能体arXivHugging FaceMCP/工具
另有 4 家信源报道Hacker News 热门(buzzing.cc 中文翻译)HuggingFace Daily Papers(社区热门论文)公众号:通义实验室(千问)X:通义千问 / Qwen (@Alibaba_Qwen)
推荐理由:Qwen把世界模型做成了一个可开源的通用产品,覆盖七域,做agent RL的可以直接拿它仿真训练,可控性甚至超过真实环境,做agent的团队应该认真看看。

6月19日

星期五 · 1 条
02:47
Hugging Face:Blog(RSS)精选
AI 评分 75/100
MosaicLeaks: 你的研究智能体能保守秘密吗?

深度研究智能体在结合私有本地文档与外部网页检索时存在隐私泄露风险。MosaicLeaks 提出包含 1,001 条多跳研究链的新任务,每条链交错混合本地与公共子问题。测试发现智能体频繁泄露私有信息,单纯优化任务性能反而加剧泄露。基于此,研究提出隐私感知深度研究(PA-DR)强化学习训练方法,将严格链成功率从 48.7% 提升至 58.7%,同时将答案/全面信息泄露率从 34.0% 降至 9.9%。

智能体arXiv安全/对齐论文/研究

推荐理由:这篇论文揭示了深度研究agent的多跳查询会像马赛克一样拼凑出私密信息,单纯提示减少泄露几乎没用,而隐私感知训练把泄露率从34%降到9.9%,且不损伤任务表现,做企业级agent产品的团队要重视。

6月16日

星期二 · 1 条
09:59
Berkeley RDI:Blog(AI 安全与评测)精选
AI 评分 83/100
伯克利RDI发布Agents' Last Exam基准

2026年6月,伯克利RDI发布Agents’ Last Exam(ALE)基准,包含1,500余项源于真实工作的任务,覆盖55个非体力职业。对Fable 5、GPT-5.5、Composer 2.5等前沿智能体的测评显示:在最困难层级成功率均为0%;整体任务表现接近,但单任务成本差异巨大(Fable 5约$15.70,GPT-5.5约$3.80,Composer 2.5约$1.33)。CLI子集ALE-CLI最佳通过率仅25.2%。主要失败模式是智能体未验证输出即宣称完成。数据集、代码及CLI子集已开源。

智能体arXivHugging Face开源生态

推荐理由:在Fable 5发布后,Berkeley的ALE基准首次大规模量化了agent在专业任务上的真实水平,最难任务0%成功率的结果值得所有押注agent落地的团队冷静下来。

6月13日

星期六 · 1 条
17:54
公众号:龙猫LongCat(美团)
AI 评分 54/100
WBench:面向交互式视频世界模型的首个系统性多轮评测基准

美团 LongCat 团队推出 WBench,首个面向交互式视频世界模型的系统性多轮评测基准。包含 289 个测试案例、1058 个交互轮次,覆盖导航、主体动作、事件编辑、视角切换四种交互方式,从视频质量、设定遵循度、交互遵循度、一致性、物理真实性五维度评测 20 个前沿模型(包括 Kling 3.0、HY-World 1.5、Genie 3 等)。核心发现:无全能模型,导航能力与画质无关;多轮交互后所有模型性能下降,导航平均分下降 33 点;开源模型 HY-World 1.5 导航能力突出;视角切换最难(平均分 30.7)。WBench 已开源。

arXivGitHub开源生态视频

6月7日

星期日 · 1 条
02:11
公众号:阶跃星辰(Step)精选
AI 评分 71/100
阶跃首席科学家张祥雨合著论文 ResNet 获 CVPR 2026 「时间检验奖」

CVPR 2026 将 Longuet-Higgins Prize「时间检验奖」授予 2015 年发表的《Deep Residual Learning for Image Recognition》(ResNet)。该论文由何恺明、张祥雨、任少卿、孙剑完成,提出的残差学习思想解决了深层神经网络训练难题,已成为现代深度学习基础结构。同获该奖的还有 YOLO v1。ResNet 全球引用量超 32 万次,是 21 世纪被引最多论文。阶跃算法团队正热招大模型技术人才。

arXiv行业动态
另有 1 家信源报道公众号:阶跃星辰(Step)
推荐理由:ResNet拿下CVPR时间检验奖,32万引用是真的硬通货。虽然论文是2015年的,但残差连接至今仍是每个大模型的地基,这个奖实至名归,也提醒我们基础研究才是长期主义的底气。

5月29日

星期五 · 1 条
09:39
公众号:蚂蚁百灵(Ling)精选
AI 评分 81/100
蚂蚁百灵团队为何重新设计 SwiGLU?PowLU 激活函数的诞生始末

蚂蚁百灵团队提出新激活函数 PowLU,以解决 SwiGLU 在 FP8 等低精度训练中因二次增长放大异常值导致的 Loss Spike 和训练崩溃问题。

arXiv数据/训练论文/研究

推荐理由:用幂函数替代指数项以压制输出范围,避免了 SwiGLU 截断带来的信息丢失,为低精度训练提供了一条已通过千亿模型验证的稳定激活函数路径。

5月28日

星期四 · 1 条
17:47
公众号:通义实验室(千问)
AI 评分 54/100
通义实验室发布Qwen-Image-Bench:56项细粒度创作评测基准

通义实验室推出文生图评测基准Qwen-Image-Bench,由专业艺术家团队开发,将创作能力解构为5大核心支柱、17大场景及56项可量化维度。配套开源自动化评估模型Q-Judger,与资深人类艺术家评估相关性达Spearsman 0.92。评测使用1000条中英文分层Prompt,每条覆盖至少4项考点。结果显示,当前T2I模型在文字准确性、信息可视化、跨语言生成等子领域差距明显,世界知识与逻辑推理能力是跻身第一梯队的分水岭。完整数据集与Q-Judger已开源。

arXivHugging Face图像生成多模态

5月25日

星期一 · 2 条
18:48
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 69/100
inclusionAI 发布 SingGuard 系列模型,首版为 SingGuard-2b

inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-2b,用于文本、图像、图文、多语言及查询/回复侧的安全评估。SingGuard 将安全策略作为运行时输入而非固定训练分类,支持部署团队在不重新训练模型的情况下,依据默认或自定义自然语言规则进行内容审核。该模型在多项多模态安全基准上取得平均最优性能,支持快速首 token 路由与深度推理结合的动态推理流程,兼容 Transformers 和 vLLM 的 chat 消息输入。

arXiv多模态安全/对齐模型发布
另有 1 家信源报道蚂蚁 inclusionAI:HuggingFace 新模型
推荐理由:把安全策略写成自然语言就能即插即用,不用重新微调,这个思路对需要频繁调整合规规则的产品团队很实用。虽然只是个2B的小模型,但开箱即用的动态适配能力值得关注。
15:25
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 63/100
蚂蚁 inclusionAI 开源 SingGuard 多模态安全护栏模型族

蚂蚁集团 inclusionAI 开源了 SingGuard 多模态安全护栏模型族,包含 2B、4B 和 8B 三个版本。SingGuard 将安全策略作为运行时输入而非训练时固定分类,部署团队无需重新训练即可按默认分类或自定义自然语言规则评估内容。模型支持文本、图像、图文、多语言、查询侧和回复侧的安全审核,采用“快-慢”动态推理机制。SingGuard 在多模态安全、图像安全、文本查询安全、文本回复安全、多语言查询安全及多语言回复安全基准上达到平均 SOTA 性能。模型基于 Qwen3-VL 架构,支持通过 Transformers 和 vLLM 部署。

arXivHugging Face安全/对齐推理
另有 1 家信源报道蚂蚁 inclusionAI:HuggingFace 新模型
推荐理由:安全护栏模型大多是死规则,SingGuard 允许运行时动态注入策略,这对需要频繁调整审核规则的内容团队是个实用突破。蚂蚁开源了全系列模型与基准,部署门槛低,可以直接上手。

5月23日

星期六 · 1 条
00:16
Hugging Face:Blog(RSS)
AI 评分 50/100
专业化胜过规模:Dharma 发布 DharmaOCR,3B 专用模型在 OCR 基准上超越商业前沿 API

4月,Dharma 发布 DharmaOCR——一对 3B 参数专用小语言模型,用于结构化 OCR,同时开源基准与论文。在巴西葡萄牙语 OCR 基准上,该 3B 专用模型通过全微调实现综合得分 0.911,超过所有测试的商业前沿 API(Claude Opus 4.6 0.833、Gemini 3.1 Pro 0.820、GPT-5.4 0.750)。每百万页成本仅为 Claude Opus 4.6 的约 1/52,质量与成本均占据 Pareto 前沿。结果表明:当训练数据与部署任务充分对齐时,参数规模不再是决定性变量,专业化微调能以极低代价实现更高性能。

arXivHugging Face数据/训练现象/趋势

5月14日

星期四 · 1 条
00:00
Google Cloud:Databases(RSS)精选
AI 评分 71/100
Google Cloud 用代理模型加速数据库 AI 函数

Google Cloud 在 SIGMOD 发表论文,提出用代理模型(proxy model)加速 BigQuery 和 AlloyDB 中的 AI 函数。代理模型是面向特定查询和数据微调的轻量级模型,在 10 个基准测试中 F1 分数达到 LLM 的 90%-116%。该优化已默认集成在 BigQuery 和 AlloyDB 的优化模式下。

arXivGoogle产品更新部署/工程

推荐理由:Google 把数据库里的 LLM 调用换成了超轻量代理模型,成本降了两个数量级且准确度几乎无损,做数据分析和 SQL 的同行该认真看了。

4月8日

星期三 · 1 条
00:00
Berkeley RDI:Blog(AI 安全与评测)精选
AI 评分 87/100
我们如何攻破顶级AI Agent基准测试及未来展望

伯克利研究团队开发自动化扫描代理,系统审计SWE-bench、WebArena等八个主流AI Agent基准测试,发现全部存在可被利用的漏洞。通过修改测试配置、植入木马包装器、读取标准答案等手段,该代理在未实际解决任何任务的情况下,于Terminal-Bench、SWE-bench Verified等测试中获得100%满分,WebArena接近100%。研究揭示了当前AI基准测试评分机制存在系统性安全缺陷,高分不等于真实能力。

arXiv安全/对齐评测/基准
另有 2 家信源报道Hacker News 热门(buzzing.cc 中文翻译)Berkeley RDI:Blog(AI 安全与评测)
推荐理由:伯克利团队从内部挨个拆解了八大主流基准,发现全都能被零能力 agent 打满分。这不只是打脸,他们给出了一份评估构建清单,以后做基准的人必须过了这一关才算及格。

2月24日

星期二 · 1 条
21:07
AI as Normal Technology(RSS)精选
AI 评分 76/100
普林斯顿大学发布AI智能体可靠性科学论文

普林斯顿大学研究人员将AI智能体可靠性分解为4个维度共12项指标,对14个模型测试发现,近18个月能力快速进步仅带来有限的可靠性提升,一致性得分仅30%-75%。研究团队计划推出“可靠性指数”以推动系统性改进。

智能体arXiv安全/对齐论文/研究

推荐理由:这篇论文把 AI agent 的可靠性拆成一致性、鲁棒性、预测性、安全四个维度,在 14 个模型上实测发现可靠性进步远慢于能力进步,解释了不少人困惑的落地慢问题,做 agent 的团队该认真看看。

8月4日

星期一 · 1 条
00:00
字节 Seed:Research Papers(网页内嵌数据)
Seed Diffusion:支持高速推理的大规模扩散语言模型

字节跳动Seed团队发布扩散语言模型Seed Diffusion,采用非自回归的扩散架构替代传统GPT类模型,通过去噪扩散机制并行生成文本,突破逐token解码的速度瓶颈。该模型在保持大规模参数能力的同时显著提升推理效率,在文本生成任务中实现生成质量与计算速度的平衡,为大规模语言模型提供了自回归范式之外的高性能替代方案。

arXiv推理论文/研究

3月14日

星期五 · 1 条
00:00
字节 Seed:Research Papers(网页内嵌数据)
深度学习揭示整数和分数量子反常霍尔态

针对扭曲MoTe₂体系,研究者采用深度学习框架表达多体波函数,精准识别出整数/分数量子反常霍尔态及Z₂拓扑绝缘体。相比传统方法,该方案在计算效率与精度上显著提升,可处理更大规模系统并区分竞争相(如分数量子反常霍尔态与电荷密度波),理论预测与实验观测高度吻合。

arXiv论文/研究

9月18日

星期三 · 1 条
22:32
AI as Normal Technology(RSS)
AI 评分 57/100
CORE-Bench 基准发布:AI 复现论文能力测试准确率仅 22%

研究人员推出 CORE-Bench 基准,用于衡量 AI 自动化复现论文计算结果的能力。该基准包含 90 篇论文,设三个难度等级。测试中,基于 GPT-4o 的专用智能体 CORE-Agent 在最高难度等级上准确率仅达 22%。

智能体arXiv数据/训练论文/研究

9月9日

星期五 · 1 条
01:00
Lilian Weng:Lil'Log(RSS)
AI 评分 33/100
神经正切核背后的数学原理

神经正切核是一种用于解释神经网络在梯度下降训练过程中演化行为的核方法。它深入阐释了为何宽度足够的神经网络能够一致收敛至经验损失函数的全局最小值,即使在参数量远超训练样本数的过参数化情况下亦是如此。研究进一步探讨了在神经网络具有无限宽度的设定下,通过刻画神经正切核来证明其在不同初始化条件下能够确定性收敛的理论依据。

arXiv教程/实践数据/训练
共 38 条,没有更多了