内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态一手 · 459 条
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「论文/研究」清除

8月14日周五

00:56Apple Machine Learning Research(RSS)41当"遗忘"无需成本:利用低影响力数据点降低机器学习计算开销

8月13日周四

12:01公众号:龙猫LongCat(美团)35KDD'26 美团 8 篇论文精选及 KDD Cup'26 DataAgents 赛道冠军思路解读
09:20Anthropic:Research(发表成果 · 网页)79精选新兴多智能体系统的模式与问题
01:57Google Research:Blog(网页)66精选空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈
01:18Anthropic:Research(发表成果 · 网页)55Anthropic 联合独立研究者发布工人再培训项目证据综述

8月12日周三

12:01公众号:百度智能云(文心)39百度智能云虚拟交换机BvS新数据面Sonata论文入选NSDI'27
01:17Google Blog:AI(RSS)69精选AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力

8月11日周二

21:51LMSYS:Blog(Chatbot Arena 团队)72精选统一 Radix 缓存:为混合模型前缀缓存构建单一树结构
07:51CMU:Machine Learning Blog38Forking-Sequences 系列(二):多时域预测集成如何降低波动性
01:46Anthropic:Research(发表成果 · 网页)57精选Claude 未发布研究版将黎曼 zeta 函数零点下界从 41.6% 提升至 67.2%

8月10日周一

07:42Sakana AI:Blog(网页)0ベースモデルに依存しないオーケストレーションに向けて:Gemma 4版 Sakana Fuguの検証

8月8日周六

06:53Apple Machine Learning Research(RSS)51Arbitrage:利用优势感知投机实现高效推理
06:53Apple Machine Learning Research(RSS)44超越下一个 token 预测:扩散语言模型与自回归语言模型的性能对比研究

8月7日周五

23:53Apple Machine Learning Research(RSS)64精选扩展分类流映射(Categorical Flow Maps)规模
18:00公众号:小红书技术(dots.llm)65精选小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026
08:53Apple Machine Learning Research(RSS)40DeepAmbigQA:用于评测 LLM 答案完整性的歧义多跳问答基准

8月6日周四

23:53Apple Machine Learning Research(RSS)29锁定预训练权重:深度低秩残差蒸馏方法解析
12:00公众号:百度智能云(文心)50百度沧海MetaDB入选国际顶级学术会议NSDI'27
06:52Apple Machine Learning Research(RSS)56驯服扩散 Transformer 中的离群 token:Dual-Stage Registers 干预

8月5日周三

22:31AI as Normal Technology(RSS)70精选AI智能体尚无法开展开放式AI研究

8月3日周一

23:52Apple Machine Learning Research(RSS)51多模态大语言模型对齐的全面研究:Apple 团队独立拆解偏好对齐各环节
20:35公众号:腾讯混元55E-Bench:以腾讯产品为原型的 AI 智能体大考

8月1日周六

15:43OpenAI:官网动态(RSS · 排除企业/客户案例)27OpenAI 在数学与理论计算机科学领域取得十项进展

7月31日周五

12:10公众号:腾讯混元89精选腾讯混元 Hyra 攻克加法组合学 50 年未解难题
07:51Apple Machine Learning Research(RSS)44MoMo:通过时空动作分词实现机器人操作中的运动模式控制
01:51Apple Machine Learning Research(RSS)48降维遇见网络科学:UMAP的kNN图在数据理解中的应用

7月30日周四

07:55BAIR:Berkeley AI Research Blog57K-Search 将 CUDA 内核优化经验迁移至 Apple Silicon MLX,性能接近专家水平
07:37Microsoft AI:官方博客(网页)9Optimizing the frontier performance curve
01:50LMSYS:Blog(Chatbot Arena 团队)69精选Miles 在 Blackwell 架构上实现端到端 MXFP8 与逐 token NVFP4 强化学习方案
00:00Google Research:Blog(网页)76精选Science One Framework:通过 Chain-of-Evidence 实现可验证的自主科研框架

7月29日周三

20:32Sakana AI:Blog(网页)21Dreaming in Voxels: How AI is Generating Playable Minecraft Worlds
12:00公众号:小红书技术(dots.llm)37小红书 dots 团队提出 Vision-OPD,让 9B 模型细粒度视觉理解超越 GPT-5.4
05:50Apple Machine Learning Research(RSS)55Apple 为 Siri Expressive Voices 推出内存高效的音频合成架构
01:27Anthropic:Research(发表成果 · 网页)79同事件Anthropic 用 Claude 发现密码学算法缺陷,HAWK 密钥强度减半同一事件,精选展示《Claude 发现加密算法弱点研究发布》

7月28日周二

19:00公众号:小红书技术(dots.llm)56小红书 dots 团队提出 Vision-OPD,让多模态大模型"看清细节"

7月27日周一

23:50Apple Machine Learning Research(RSS)40Apple 提出 GH-ESD:面向实例级视觉任务的假设驱动错误切片发现方法
18:39OpenAI:官网动态(RSS · 排除企业/客户案例)35OpenAI 研究:ChatGPT 正扩展员工工作边界,跨角色任务增加
11:55BAIR:Berkeley AI Research Blog51ABBEL:通过信念瓶颈提升LLM长程交互中的摘要学习效率

7月24日周五

23:49Apple Machine Learning Research(RSS)51Apple 提出 LEAD 方法,破解长程推理中的"不可恢复瓶颈"
23:25Anthropic:Research(发表成果 · 网页)73精选Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力
已加载 40 条
全部 AI 动态
2026年8月17日星期一 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
一手信源 · 标签「论文/研究」 · 459 条清除

8月14日

星期五 · 1 条
00:56
Apple Machine Learning Research(RSS)
AI 评分 41/100
当"遗忘"无需成本:利用低影响力数据点降低机器学习计算开销

苹果机器学习研究团队提出,在模型遗忘任务中,对训练数据中影响可忽略的点无需逐一移除,从而降低计算成本。通过对比语言与视觉任务中的影响力函数,他们识别出对模型输出影响极小的数据子集,并据此优化遗忘流程。该方法挑战了现有遗忘技术对所有遗忘集数据点一视同仁的做法。

数据/训练论文/研究

8月13日

星期四 · 4 条
12:01
公众号:龙猫LongCat(美团)
AI 评分 35/100
KDD'26 美团 8 篇论文精选及 KDD Cup'26 DataAgents 赛道冠军思路解读

美团技术团队 8 篇论文被 KDD 2026 收录,覆盖推荐大模型、奖励建模、智能体搜索、自动竞价等领域,其中 MTFM 已构建统一基座推荐大模型并完成全量,MTGenRec 相比 TorchRec 取得 1.6 倍~2.4 倍训练加速。大众点评技术部获 2026 KDD Cup DataAgents 赛道冠军与季军,相关代码已在 GitHub 开源。

搜索数据/训练论文/研究
09:20
Anthropic:Research(发表成果 · 网页)精选
AI 评分 79/100
新兴多智能体系统的模式与问题

Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。

智能体Anthropic论文/研究

推荐理由:实验把多智能体风险从猜测变为可量化模式,协调失败并不随更强智能自然消失,这会影响人们如何设计部署中的智能体交互环境。
01:57
Google Research:Blog(网页)精选
AI 评分 66/100
空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈

Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于“丢钥匙”而非“空货架”。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。

Google推理论文/研究

推荐理由:知识画像把事实错误拆成编码失败与召回失败,显示前沿模型问题主要在已存知识不稳定调用,思考更多恢复已编码事实而非补全缺失,为优化侧重提供判断依据。
01:18
Anthropic:Research(发表成果 · 网页)
AI 评分 55/100
Anthropic 联合独立研究者发布工人再培训项目证据综述

Anthropic 与独立研究者 David Roodman 合作发布报告,基于 56 项美国随机研究和欧洲实验证据,评估工人再培训项目应对 AI 劳动力市场冲击的效果。

Anthropic论文/研究

8月12日

星期三 · 2 条
12:01
公众号:百度智能云(文心)
AI 评分 39/100
百度智能云虚拟交换机BvS新数据面Sonata论文入选NSDI'27

百度智能云网络团队与中国科学院计算机网络信息中心合作的论文被计算机网络顶会NSDI'27录用,该届投稿355篇、录用60篇。论文提出BvS虚拟交换机的新一代数据面Sonata,采用软件为中心路线,以标准化接口卸载稳定流量、软件处理复杂流量。生产环境中Sonata将软件CPS提升2.13至2.51倍,开启硬件卸载后提升4.3至11.5倍,热升级抖动控制在数百微秒,已部署于数十万台服务器。

论文/研究部署/工程
01:17
Google Blog:AI(RSS)精选
AI 评分 69/100
AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力

Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。

Google多模态推理论文/研究

推荐理由:AMIE 在视频中融合视觉与听觉线索进行诊断,展示了多模态临床推理的可行性,对远程医疗产品方向有参考价值。

8月11日

星期二 · 3 条
21:51
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 72/100
统一 Radix 缓存:为混合模型前缀缓存构建单一树结构

LMSYS 团队提出 Unified Radix Cache,用单一 token 键控 radix 拓扑统一管理混合模型的 FULL、SWA 和 MAMBA 组件缓存,各组件独立执行路径、滑动窗口和检查点复用语义。

推理论文/研究部署/工程

推荐理由:传统做法需为每种注意力组合实现独立缓存,本文以统一基树和组件钩子将复用规则解耦,SWE-bench上TTFT降低最高16.6%。
07:51
CMU:Machine Learning Blog
AI 评分 38/100
Forking-Sequences 系列(二):多时域预测集成如何降低波动性

CMU 研究团队提出,基于 forking-sequences 架构的模型可在单次前向传播中天然生成多个重叠预测,推理时集成几乎零额外编码器计算。新指标 sFPC 实时衡量预测修订幅度,Excess Volatility 则只惩罚偏离真实值的修订。

数据/训练论文/研究
01:46
Anthropic:Research(发表成果 · 网页)精选
AI 评分 57/100
Claude 未发布研究版将黎曼 zeta 函数零点下界从 41.6% 提升至 67.2%

Anthropic 员工让 Claude 尝试攻克黎曼猜想,虽未成功,但一个未发布的研究版 Claude 在相关问题上取得突破:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。

Anthropic推理论文/研究
另有 7 家信源报道X:Deedy Das (@deedydas)X:Anthropic (@AnthropicAI)X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)TechCrunch:AI(RSS)X:Kim (@kimmonismus)
推荐理由:Claude 的结果并未直接冲击黎曼猜想,但它组合现有技术将零点比例下界提升超过 25 个百分点,为数学研究提供了一种 AI 辅助探索的可行路径。

8月10日

星期一 · 1 条
07:42
Sakana AI:Blog(网页)
AI 评分 0/100
ベースモデルに依存しないオーケストレーションに向けて:Gemma 4版 Sakana Fuguの検証
论文/研究部署/工程

8月8日

星期六 · 2 条
06:53
Apple Machine Learning Research(RSS)
AI 评分 51/100
Arbitrage:利用优势感知投机实现高效推理

现代大语言模型通过长思维链实现强大推理能力,但推理计算成本高昂。投机解码(Speculative Decoding)用快速但不精确的草稿模型提议 token,再由更强的目标模型并行验证,以加速推理。然而,语义等价步骤中的 token 不匹配会导致不必要的拒绝,传统 token 级投机解码因此受限。

推理论文/研究部署/工程
06:53
Apple Machine Learning Research(RSS)
AI 评分 44/100
超越下一个 token 预测:扩散语言模型与自回归语言模型的性能对比研究

苹果机器学习研究团队系统对比了扩散语言模型(DLMs)与自回归语言模型(ARMs)的性能表现。ARMs 虽在多项 NLP 任务上精度领先,但因逐 token 生成的顺序依赖导致算术强度较低。DLMs 作为新兴范式展现出潜力,研究对其性能特征进行了详细刻画。

数据/训练论文/研究

8月7日

星期五 · 3 条
23:53
Apple Machine Learning Research(RSS)精选
AI 评分 64/100
扩展分类流映射(Categorical Flow Maps)规模

连续扩散与流匹配模型有望成为语言建模中自回归方法的有力替代,可解锁加速采样与倾斜等连续模态优势。近期研究通过高斯分布与one-hot编码数据分布间的简单流匹配过程,实现离散数据的连续生成,并借助分类流映射(CFMs)验证了加速采样的可行性,样本质量具有竞争力。

数据/训练论文/研究

推荐理由:研究将分类流映射扩展到大规模语言建模,为连续扩散替代自回归提供了实验证据,可能影响模型架构选择。
18:00
公众号:小红书技术(dots.llm)精选
AI 评分 65/100
小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026

小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。

arXivHugging Face开源生态数据/训练

推荐理由:CULTURE-MT将翻译评测从字面准确拉到文化传递,自动评估模型与开放榜单提供了可复现的评测-训练闭环,让改进不再凭感觉。
08:53
Apple Machine Learning Research(RSS)
AI 评分 40/100
DeepAmbigQA:用于评测 LLM 答案完整性的歧义多跳问答基准

苹果研究团队推出 DeepAmbigQA,一个用于评测大语言模型答案完整性的歧义多跳问答基准。该基准聚焦“同名电影《盗火线》中哪位演员获得过奥斯卡奖”这类复杂问题,要求模型同时区分同名实体并跨大量实体进行多跳推理。研究团队还发布了自动数据生成流程 DEEPAMBIGQAGEN,以构建此类评测数据。

推理论文/研究

8月6日

星期四 · 3 条
23:53
Apple Machine Learning Research(RSS)
AI 评分 29/100
锁定预训练权重:深度低秩残差蒸馏方法解析

Apple 提出深度低秩残差蒸馏方法,在锁定预训练权重的同时实现模型压缩。该方法通过低秩残差结构蒸馏知识,避免直接修改原始权重,从而保留预训练模型的既有能力。研究展示了该方法在保持模型质量的同时,为开源权重模型的高效适配提供了新路径。

数据/训练论文/研究
12:00
公众号:百度智能云(文心)
AI 评分 50/100
百度沧海MetaDB入选国际顶级学术会议NSDI'27

百度沧海·存储团队与北京大学、阿姆斯特丹自由大学合作的论文《MetaDB》入选NSDI'27 Operational Systems Track。该系统让底层数据库理解目录树结构,高并发同目录操作下吞吐最高提升10.7倍,已在百度智能云生产环境稳定运行超5年,支撑EB级存储规模。

数据/训练论文/研究部署/工程
06:52
Apple Machine Learning Research(RSS)
AI 评分 56/100
驯服扩散 Transformer 中的离群 token:Dual-Stage Registers 干预

研究发现扩散 Transformer(DiT)图像生成流程中,预训练 ViT 编码器和 DiT 去噪器均会产生离群 token,尤其在中间层,且简单掩蔽高范数 token 无法改善性能,问题与局部 patch 语义损坏相关。为此提出 Dual-Stage Registers(DSR)干预方法,在 ImageNet 和文生图任务上持续减少离群伪影并提升生成质量。

图像生成数据/训练论文/研究

8月5日

星期三 · 1 条
22:31
AI as Normal Technology(RSS)精选
AI 评分 70/100
AI智能体尚无法开展开放式AI研究

普林斯顿大学团队通过“影子评估”测试前沿AI智能体的开放式研究能力:让智能体在六天时间内、使用数千美元API额度和算力,回答两篇未发表论文的核心研究问题,结果两篇论文均被原作者明确拒绝。分析显示,智能体缺乏研究判断力、资源意识、创造性反馈应对能力和有效回溯能力,且未遵循具体指令。研究团队认为,开放式研究对前沿AI智能体仍具挑战性,但结果尚属初步,需扩大样本量并持续评估。

智能体arXiv论文/研究

推荐理由:通过让代理复现未发表研究,论文系统暴露了当前模型在开放式研究上缺乏判断力和资源意识,这为评估递归自我改进提供了更现实的基准。

8月3日

星期一 · 2 条
23:52
Apple Machine Learning Research(RSS)
AI 评分 51/100
多模态大语言模型对齐的全面研究:Apple 团队独立拆解偏好对齐各环节

Apple 研究团队系统梳理了多模态大语言模型(MLLM)中的偏好对齐方法,将算法分为离线(如 DPO)与在线(如 online-DPO)两类,并发现两者结合可在特定场景下提升模型性能。团队还提出无需额外标注或外部模型的新型多模态偏好数据构建方法 Bias-Driven Hallucination Sampling(BDHS),在多项基准上取得与既有对齐工作相当的竞争力。

多模态安全/对齐论文/研究
20:35
公众号:腾讯混元
AI 评分 55/100
E-Bench:以腾讯产品为原型的 AI 智能体大考

腾讯混元团队、清华AIR与东南大学推出E-Bench,以王者荣耀、QQ音乐、腾讯会议为原型构建全合成环境,用确定性数据库状态diff评测智能体多步骤工具使用能力。11个前沿模型平均成功率仅54.56%,最强模型Pass³也只有58.82%;腾讯混元Hy3在E-Bench-Code下以约$0.029的单任务成本取得64.40%的Avg@3,兼具成本优势。

智能体arXiv论文/研究评测/基准

8月1日

星期六 · 1 条
15:43
OpenAI:官网动态(RSS · 排除企业/客户案例)
AI 评分 27/100
OpenAI 在数学与理论计算机科学领域取得十项进展

OpenAI 公布了数学与理论计算机科学领域十项新成果,涵盖几何、密码学与计算复杂性等长期未解难题。这些进展涉及多个基础研究方向,具体技术细节与 benchmark 数据尚未在公告中披露。

OpenAI论文/研究

7月31日

星期五 · 3 条
12:10
公众号:腾讯混元精选
AI 评分 89/100
腾讯混元 Hyra 攻克加法组合学 50 年未解难题

腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。

开源生态推理论文/研究

推荐理由:构造不再依赖暴力搜索,而是从数学结构入手自主推理,同时给出可形式化证明,让AI在定理型科学问题上从辅助工具转向共同研究者。
07:51
Apple Machine Learning Research(RSS)
AI 评分 44/100
MoMo:通过时空动作分词实现机器人操作中的运动模式控制

机器人操作需根据任务、物体和交互环境调整动作执行方式。MoMo 提出两阶段模仿学习框架,包含时空动作分词器和行为克隆 Transformer,将任务与连续运动模式条件作为输入。在六项真实机器人操作任务中,改变该条件可稳定生成不同执行风格的动作。

具身智能数据/训练论文/研究
01:51
Apple Machine Learning Research(RSS)
AI 评分 48/100
降维遇见网络科学:UMAP的kNN图在数据理解中的应用

Apple研究团队展示了UMAP内部kNN图在数据理解中的潜力,该图在原始高维空间编码数据流形。将PageRank、k-core分解和聚类系数等图算法应用于该图,可识别代表性数据点、揭示密集核心与稀疏边缘。在MNIST和Fashion MNIST上的评估表明,这些方法与k-medoids、HDBSCAN等专用方法具有竞争力或互补性。

数据/训练论文/研究

7月30日

星期四 · 4 条
07:55
BAIR:Berkeley AI Research Blog
AI 评分 57/100
K-Search 将 CUDA 内核优化经验迁移至 Apple Silicon MLX,性能接近专家水平

伯克利 Sky Lab 团队基于 K-Search 框架开发了 CUDA 到 MLX 的结构化翻译层,使 AI 驱动的内核搜索能自动将 NVIDIA GPU 上积累数十年的内核优化知识迁移至 Apple Silicon。

推理端侧论文/研究
07:37
Microsoft AI:官方博客(网页)
AI 评分 9/100
Optimizing the frontier performance curve
Microsoft论文/研究部署/工程
01:50
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 69/100
Miles 在 Blackwell 架构上实现端到端 MXFP8 与逐 token NVFP4 强化学习方案

Miles 团队在 Blackwell 架构上实现了两种原生低精度强化学习方案:端到端 MXFP8 和 MoE 专家权重的逐 token NVFP4。在 8x B200 上对 Qwen3-30B-A3B 的消融实验中,BF16 与所有五种低精度配置的原始奖励曲线高度重合,且 MXFP8 和 NVFP4 减少了推理时间。

数据/训练论文/研究部署/工程

推荐理由:虽然只针对Blackwell,但这份报告把MXFP8和NVFP4在RL里的实现细节讲清楚了,从量化合约到每token缩放都给了可复现配置,做大规模RL训练的能直接上手。
00:00
Google Research:Blog(网页)精选
AI 评分 76/100
Science One Framework:通过 Chain-of-Evidence 实现可验证的自主科研框架

Google Research 推出 Science One Framework,一个原生构建证据链的自主科研原型,旨在消除模型幻觉,并配套自动化评估协议 CoE Audit。

Google安全/对齐论文/研究

推荐理由:对自主科研系统而言,可验证性从后置修补变为前置架构,提出的审计方法让生成论文的完整性有了可量化的衡量尺度。

7月29日

星期三 · 4 条
20:32
Sakana AI:Blog(网页)
AI 评分 21/100
Dreaming in Voxels: How AI is Generating Playable Minecraft Worlds
论文/研究
12:00
公众号:小红书技术(dots.llm)
AI 评分 37/100
小红书 dots 团队提出 Vision-OPD,让 9B 模型细粒度视觉理解超越 GPT-5.4

小红书 dots 团队提出 Vision-OPD,一个无需外部教师或推理工具的区域到全局在线自蒸馏框架。仅用约 6.2K 条合成数据,便让基于 Qwen3.5 的 9B 模型在六个细粒度基准上平均准确率达 79.7%,超越 Gemini-3.5-Flash、GPT-5.4 等闭源模型及 Qwen3.5-397B,且不损失通用能力。

arXiv多模态论文/研究
05:50
Apple Machine Learning Research(RSS)
AI 评分 55/100
Apple 为 Siri Expressive Voices 推出内存高效的音频合成架构

Apple 为 Siri Expressive Voices 推出了一种内存高效的音频合成架构,其 detokenizer 在 AMX 上以约 10ms/步运行,峰值内存仅约 21MB。相比此前设备端系统,该架构将 Mean Opinion Score (MOS) 整体提升 +0.28(4.15 vs. 3.87),对话语音提升 +0.42(4.24 vs. 3.82)。

论文/研究语音
01:27
Anthropic:Research(发表成果 · 网页)同事件
AI 评分 79/100
Anthropic 用 Claude 发现密码学算法缺陷,HAWK 密钥强度减半

Anthropic 研究人员使用 Claude Mythos Preview 在 60 小时内改进了对后量子签名方案 HAWK 的最佳已知攻击,将其有效密钥强度减半。该模型还发现了一种攻击轮数缩减版 AES 的新方法,将攻击速度提升 200-800 倍。两项结果均不直接影响当前生产系统,研究总 API 成本约 10 万美元。

Anthropic安全/对齐模型发布论文/研究
同一事件,精选展示《Claude 发现加密算法弱点研究发布》

7月28日

星期二 · 1 条
19:00
公众号:小红书技术(dots.llm)
AI 评分 56/100
小红书 dots 团队提出 Vision-OPD,让多模态大模型"看清细节"

小红书 dots 团队提出 Vision-OPD,一种区域到全局在线自蒸馏框架,让模型无需外部教师或推理工具即可从全图中识别细粒度证据。仅用约 6.2K 条全自动合成数据,Vision-OPD-9B 即在多个细粒度基准上以 79.68 平均分总体第一,超越 Gemini-3.5-Flash、GPT-5.4 等闭源模型,同时保持通用视觉任务表现。

arXiv多模态数据/训练论文/研究

7月27日

星期一 · 3 条
23:50
Apple Machine Learning Research(RSS)
AI 评分 40/100
Apple 提出 GH-ESD:面向实例级视觉任务的假设驱动错误切片发现方法

Apple 机器学习研究团队提出 GH-ESD(Grounded Hypothesis-Driven Error Slice Discovery),一种针对目标检测与分割等实例级视觉任务的错误切片发现方法。现有方法主要适用于图像级分类,难以捕捉由上下文关系和空间视觉模式导致的实例级失败。GH-ESD 通过基于假设的驱动方式,系统性地发现模型在语义连贯子集上的系统性失效。

论文/研究评测/基准
18:39
OpenAI:官网动态(RSS · 排除企业/客户案例)
AI 评分 35/100
OpenAI 研究:ChatGPT 正扩展员工工作边界,跨角色任务增加

OpenAI 最新研究显示,ChatGPT 用户正在跨角色承担更多任务,AI 正在重塑工作边界。研究发现,AI 并非简单替代岗位,而是帮助员工扩展技能范围,从事原本不属于其职责的工作。这一趋势表明,AI 工具正在推动职业边界的模糊化与工作内容的多样化。

OpenAI论文/研究
11:55
BAIR:Berkeley AI Research Blog
AI 评分 51/100
ABBEL:通过信念瓶颈提升LLM长程交互中的摘要学习效率

BAIR提出ABBEL框架,将长程交互中的摘要生成隔离为自然语言信念状态,并通过信念评分进行监督。在CollabBench协作编程测试中,基于重建的信念评分将全上下文模型的性能差距缩小约50%,训练步数减少50%。该方法解决了递归摘要(如Cursor Composer 2.5采用的压缩技术)在有限训练数据下性能下降的问题。

arXiv推理数据/训练编码

7月24日

星期五 · 2 条
23:49
Apple Machine Learning Research(RSS)
AI 评分 51/100
Apple 提出 LEAD 方法,破解长程推理中的"不可恢复瓶颈"

Apple 研究发现,大语言模型在长程执行中即使有高层策略也不稳定,极端分解会导致“不可恢复瓶颈”——少数“困难”步骤上的持续错误变得不可逆转。为此提出 Lookahead-Enhanced Atomic Decomposition(LEAD),通过引入短程未来验证与聚合来打破这一瓶颈。该方法在受控算法谜题上验证了有效性。

推理论文/研究
23:25
Anthropic:Research(发表成果 · 网页)精选
AI 评分 73/100
Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力

Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。

Anthropic具身智能安全/对齐论文/研究

推荐理由:Anthropic首次公开AI端到端控制无人机执行监视任务,Fable 5仅因3D重建瑕疵未能全通。六个月内模型一致性突飞猛进,安全压力比技术潜力更紧迫。
已加载 40 条