内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态论文 · 4524 条
来源全部一手资讯X
类型论文
全部模型产品行业论文教程观点
标签「论文/研究」清除

今天8月25日 周二

15:07HuggingFace Daily Papers(社区热门论文)72精选单个污染页面即可影响LLM推荐:FORGE基准揭示检索增强推荐系统的脆弱性
14:07HuggingFace Daily Papers(社区热门论文)66多跳 RAG 如何放大上游 ASR 错误:实体图谱链接与迭代改写反而加剧鲁棒性下降
14:07HuggingFace Daily Papers(社区热门论文)52MobilePA-Bench:面向复杂真实任务的移动端规划智能体评测基准
13:48Rohan Paul35语言模型如何评估用户能力与职业偏见
13:07HuggingFace Daily Papers(社区热门论文)48Task-CoEvolve:通过自适应验证任务选择实现高效 Harness 优化
12:48Rohan Paul42冻结主干只训投影层:新模态不损原能力
12:07HuggingFace Daily Papers(社区热门论文)37ReWorld:具备长时记忆的交互式世界模型
11:18Rohan Paul36SWE-bench Science:编码智能体难解科学缺陷
11:07HuggingFace Daily Papers(社区热门论文)46Apodex 1.1:面向复杂工作的智能体能力扩展
11:07HuggingFace Daily Papers(社区热门论文)68同一智能体不同答案:检索增强问答中语料库引发的答案更替审计
10:18Rohan Paul35DeepMind 新研究:推理时回灌深层激活可降困惑度
07:48Rohan Paul34长程规划智能体:预训练与OPD蒸馏研究
07:24IT之家(RSS)49研究团队调查发现超七成英语生物医学论文已使用 AI 辅助写作,呼吁业界建立完善监管机制
05:59Ars Technica:AI(RSS)50斯坦福研究:AI 对入门级岗位冲击最大
05:44DAIR.AI49加权记忆树:为长时运行智能体引入可恢复记忆
05:18elvis32终端智能体综述:对比为何矛盾
03:18Rohan Paul41ASI-Bench:步骤比方法名更决定智能体表现
02:59Epoch AI53美国GDP统计漏算英伟达经济贡献
02:59AK30潜态推理视频世界模型如何学习世界演化
02:29The Decoder:AI News(RSS)60皮尤研究:ChatGPT 发布后网络 AI 生成文本激增

8月24日周一

23:59AK25InfinityEdit:轻量适配器实现无限视频编辑
23:59Apple Machine Learning Research(RSS)50Beyond Visual CoT:Internalized Visual Thinking 实现主动视频推理
22:48Rohan Paul37DataSpace 基准:最强模型数据智能体准确率仅 66.34%
22:48Rohan Paul42Meta 新论文:EvoHarness-RL 让 Qwen3-8B 在 ALFWorld 达 96.9%
22:44DAIR.AI29Anthropic 原语在企业中的落地范式
22:24IT之家(RSS)43卡迪夫大学新研究:AI 尚无法像人类教师一样可靠地批改作业
22:07OpenBMB51清华等提出"表征平等"框架:评估大模型跨国模拟是否均衡
21:59MarkTechPost(RSS)37Google Research 与 USC 推出 ME-POIs 框架,将移动数据融入地点嵌入
21:18Rohan Paul36对抗式审查:结构化分歧提升智能体代码审查
20:48elvis39NVIDIA 新论文提出 ACES 技能评估法
20:18Rohan Paul37ContinualSkillBench:LLM 智能体能否真正进化能力?
18:44-Zho-36MIT证明AI奉承会致人妄想螺旋
12:18Ethan Mollick19Claude 证明 S6 复结构引热议
10:24IT之家(RSS)40摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,破解长上下文推理成本瓶颈
09:24IT之家(RSS)51SK 海力士披露下一代 HBM 内存先进封装技术,引入英特尔 EMIB
09:18elvis36Netflix 如何用 LLM 评判器优化推荐解释
08:18Rohan Paul48Claude 助数学家破解 1948 年难题
07:44DAIR.AI36智能体编码会话中指令文件占读取量六成
07:18Rohan Paul36主动推理让AI智能体按需获取上下文
06:18Rohan Paul36ArchAgent v2 分阶段搜索击败人工冠军设计
已加载 40 条
全部 AI 动态
2026年8月25日星期二 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
论文 · 标签「论文/研究」 · 4524 条清除

8月25日

星期二 · 20 条
15:07
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
单个污染页面即可影响LLM推荐:FORGE基准揭示检索增强推荐系统的脆弱性

检索增强型LLM在消费推荐中易受GEO内容污染影响,成为虚假产品的无意推广者。新基准FORGE在225个真实产品、15个类别和5个消费场景中测试12个商业及开源LLM,发现所有模型均易受攻击:单个污染页面即可造成最高27%的受骗率,替换全部前3个结果时升至73.8%。

arXiv搜索论文/研究

推荐理由:实验量化了单页污染对 LLM 推荐器的影响,并发现推理会生成虚假社会证明,这提示搜索增强推荐系统的风险评估需覆盖推理环节。
14:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 66/100
多跳 RAG 如何放大上游 ASR 错误:实体图谱链接与迭代改写反而加剧鲁棒性下降

研究测试了实体图谱链接与迭代改写两种 RAG 扩展在 ASR 输入下的表现。在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 三个多跳问答基准上,两种扩展均放大错误:干净文本与最高 WER 口音间的 F1 差距比朴素稠密检索大 36-67%。查询实体损坏是主要失败模式,占 2WikiMultiHopQA 上 87-96% 的退化案例。

检索增强论文/研究语音
14:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
MobilePA-Bench:面向复杂真实任务的移动端规划智能体评测基准

MobilePA-Bench 是一个交互式、有状态且以工具为中心的评测基准,用于评估移动端规划智能体的工具调用与规划能力。它运行在可执行沙箱中,覆盖 13 个功能域和 212 个真实移动工具,并额外评测子智能体协作、记忆使用和技能调用三个高级维度。实验显示,当前前沿 LLM 在严格工具排序、权限限制和意外运行时错误下性能显著下降。

智能体arXiv端侧论文/研究
13:48
Rohan Paul@rohanpaul_ai
AI 评分 35/100
模型对你专业水平的内部估计,会决定它如何回答你,以及是否"录用"你。语言模型携带一个关于用户能力的单一方向向量,同时驱动回答的复杂度。这篇论文表明,该估计在因果上中介了行为,但并未证明其承载的人口统计学差异会可靠地以输出歧视的形式显现。- arxiv.org/abs/2608.20347标题:"语言模型认为谁是有能力的?职业偏见的机制分析"
arXiv安全/对齐论文/研究
13:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 48/100
Task-CoEvolve:通过自适应验证任务选择实现高效 Harness 优化

Task-CoEvolve 提出一种高效的大语言模型 harness 优化方法,通过让验证任务与 harness 共同演化,解决固定验证集评估成本高的问题。该方法利用方差加权采样聚焦能力边界附近的任务,并基于采样概率估计全量集分数。在在线文本分类和 Terminal-Bench 2.1 上,Task-CoEvolve 匹配全量集搜索的最终性能,同时将优化过程中的评估次数减少 80%。

论文/研究部署/工程
12:48
Rohan Paul@rohanpaul_ai
AI 评分 42/100
冻结主干只训投影层:新模态不损原能力

新研究提出“Projector Is All You Train”:为语言模型添加新模态只需训练连接编码器与主干的投影层,无需微调模型本身。3D 测试中,冻结主干的模型性能持平或超越联合微调,训练速度快一倍,而联合微调的 Llama 在 GSM8K 上从 86.96% 暴跌至 0.61%。

arXiv多模态数据/训练论文/研究
12:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 37/100
ReWorld:具备长时记忆的交互式世界模型

ReWorld 将控制与记忆分离训练并在推理时加以约束,通过混合逐头注意力窗口和随机头路由,让少量全局头关注全部历史,同时以姿态索引地标库支撑有界 KV 缓存。在覆盖动作跟随、长时回忆和视频质量的三轴评测中,ReWorld 对六个近期交互式世界模型取得最佳控制保真度(11.95° 旋转误差)和最佳生成质量,并支持 704x1280 实时视频流。

arXiv多模态视频论文/研究
11:18
Rohan Paul@rohanpaul_ai
AI 评分 36/100
SWE-bench Science:编码智能体难解科学缺陷

新基准 SWE-bench Science 用开源科学仓库的真实缺陷测试编码智能体,发现它们擅长消除可见故障,却难以恢复底层科学逻辑,且领域知识帮助有限。最佳配置 Claude Code 配 Opus-5 通过 96.64% 公开测试,但 Pass@1 仅 47.90%。瓶颈在于验证而非知识:智能体无法将科学解释与可执行证据对照时,会锚定解释而非检验它。

arXiv编码论文/研究评测/基准
11:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 46/100
Apodex 1.1:面向复杂工作的智能体能力扩展

Apodex 1.1 通过环境扩展与智能体协调训练两条路径,提升模型在文件、搜索和代码环境中的持续可验证工作能力。在专业工作、金融、科研、数学、编码和搜索等任务上,该模型以远小于前沿系统的参数量达到领先性能。35B 参数的 Apodex 1.1 Mini 在本地可部署形态下仍保持较强工作能力。

智能体论文/研究
11:07
HuggingFace Daily Papers(社区热门论文)
AI 评分 68/100
同一智能体不同答案:检索增强问答中语料库引发的答案更替审计

检索增强问答系统在索引扩展后可能返回不同答案,即便模型标识、提示词、检索策略等设置完全固定。研究提出快照兼容性审计,通过从跨快照分歧中减去同快照重复分歧来估算超额答案更替。在400题Natural Questions预注册研究中,归一化精确和盲语义超额更替分别为6.44和10.25个百分点,而精确匹配准确率仅变化-1.50个百分点。

arXiv检索增强搜索论文/研究
10:18
Rohan Paul@rohanpaul_ai
AI 评分 35/100
DeepMind 新研究:推理时回灌深层激活可降困惑度

Google DeepMind 新论文提出“Recirculation”方法:推理时将深层激活的一小部分混入浅层,权重不变,即可恢复模型在长上下文中丢失的部分状态。在 Gemma3 上,10 个语言建模数据集中 9 个困惑度下降,12B 模型最高降 35%,但多项选择收益有限;该方法无需重训,但代价是预填充无法并行,且收益不跨模型家族迁移。

DeepMind推理论文/研究
07:48
Rohan Paul@rohanpaul_ai
AI 评分 34/100
长程规划智能体:预训练与OPD蒸馏研究

论文发现,后训练无法修复薄弱的长程规划基础:噪声轨迹会累积错误,稀疏奖励导致信用分配不当,冲突教师引发遗忘。研究建议优先训练清晰世界模型和长轨迹,奖励信号过稀疏时采用OPD(on-policy distillation),并避免合并规划策略不兼容的教师。OPD在长程噪声场景下优于结果奖励GRPO,因教师反馈贯穿整个轨迹而非仅在末端。

智能体数据/训练论文/研究
07:24
IT之家(RSS)
AI 评分 49/100
研究团队调查发现超七成英语生物医学论文已使用 AI 辅助写作,呼吁业界建立完善监管机制

研究团队分析 PubMed Central 上 119 万余篇英文生物医学论文发现,2025 年约 77% 的论文出现 AI 辅助写作或编辑特征,较 2023 年的 19% 和 2024 年的 52% 大幅提升。讨论部分使用比例最高(约 78%),韩国、中国等非英语母语地区超 80%。研究呼吁建立完善使用规范和监管机制,以应对 AI 生成虚假事实及披露不足等风险。

数据/训练论文/研究
05:59
Ars Technica:AI(RSS)
AI 评分 50/100
斯坦福研究:AI 对入门级岗位冲击最大

斯坦福大学经济学家最新研究显示,AI 正导致部分领域年轻员工的入门级岗位显著流失,而年长员工迄今基本未受影响。在 AI 暴露度最高的职业中,22 至 25 岁员工的就业水平已比低暴露领域同龄人低 19%,高于去年的 13%。

数据/训练论文/研究
05:44
DAIR.AI@dair_ai
AI 评分 49/100
加权记忆树:为长时运行智能体引入可恢复记忆

DAIR.AI 介绍一种名为加权记忆树的新方法,为长时运行智能体实现可恢复记忆。它将执行组织为任务、子任务和动作,并为每条记忆赋予动态保留分数,事件更新提升分数、选择衰减降低分数。在 GAIA-Text 上,该方法搭配 Qwen3-8B、Gemma 4 E4B 和 Llama-3.1-8B,平均比线性记忆高出 9.97 分,同时提示词 token 使用量减少 32.8%。

智能体论文/研究
05:18
elvis@omarsar0
AI 评分 32/100
一篇关于终端智能体的不错综述。它很好地介绍了终端智能体究竟是什么,以及为什么各种工具(harness)对比的结果总是相互矛盾?论文:https://arxiv.org/abs/2608.20485在我们的学院中追踪更多热门 AI 论文:https://academy.dair.ai/
智能体arXiv论文/研究评测/基准
03:18
Rohan Paul@rohanpaul_ai
AI 评分 41/100
ASI-Bench:步骤比方法名更决定智能体表现

ASI-Bench 用 60 个真实科研项目、11 个科学领域测试研究智能体,仅改变指令内容。18 种智能体与模型组合下,完整步骤提示平均得分 50.91,仅给方法名降至 29.10,再删方法名仅再降 2.5 分。仅方法名提示还多耗 59% token,因命名方法既限制方向又迫使智能体重建全部实现细节。

智能体论文/研究
02:59
Epoch AI@EpochAIResearch
AI 评分 53/100
我们发现,美国GDP统计遗漏了英伟达为美国经济增加的大部分价值。因此,过去一年GDP增长被低估了约0.3个百分点。
数据/训练论文/研究
02:59
AK@_akhaliq
AI 评分 30/100
学习世界如何演化通过潜态动力学推理实现的外推式视频世界模型论文:https://huggingface.co/papers/2608.09926
具身智能视频论文/研究
02:29
The Decoder:AI News(RSS)
AI 评分 60/100
皮尤研究:ChatGPT 发布后网络 AI 生成文本激增

皮尤研究中心分析近 50 万个英文网页发现,ChatGPT 发布后发布的页面中超过三分之一带有 AI 生成文本痕迹。商业 .com 域名出现 AI 文本的比例约为 .edu 或 .gov 网站的十倍。分析工具 Open Pangram 难以区分完全自动生成与部分 AI 辅助的文本,且“delve”等 AI 常用词及破折号、牛津逗号的使用频率自 2023 年以来显著上升。

OpenAI论文/研究

8月24日

星期一 · 20 条
23:59
AK@_akhaliq
AI 评分 25/100
InfinityEdit通过轻量级编辑点火适配器实现无限视频编辑论文:https://huggingface.co/papers/2608.20910
arXiv视频论文/研究
23:59
Apple Machine Learning Research(RSS)
AI 评分 50/100
Beyond Visual CoT:Internalized Visual Thinking 实现主动视频推理

多模态大语言模型常用视觉思维链(Visual CoT)进行空间、时间与具身环境推理,但生成中间推理图像带来大量推理开销。新提出的后训练框架 Internalized Visual Thinking(IVT)在训练阶段内化视觉思考,推理时直接进行文本预测与优化,从而在不增加推理成本的前提下实现主动视频推理。

多模态视频论文/研究
22:48
Rohan Paul@rohanpaul_ai
AI 评分 37/100
DataSpace 基准:最强模型数据智能体准确率仅 66.34%

DataSpace 新基准测试数据智能体在异构工作区中的可验证分析能力,涵盖 410 个需结合数据库、CSV/JSON、长文档与视频并返回精确表格的任务。最强模型准确率仅 66.34%;固定模型后仅更换智能体框架即可将准确率从 30.98% 提升至 46.34%。跨所有测试模型,跨源连接与多数据类型混合是持续短板,且许多失败发生在智能体已找到正确信息后误解请求或提交错误列。

智能体arXiv数据/训练论文/研究
22:48
Rohan Paul@rohanpaul_ai
AI 评分 42/100
Meta 新论文:EvoHarness-RL 让 Qwen3-8B 在 ALFWorld 达 96.9%

Meta 新论文提出 EvoHarness-RL,通过强化学习训练智能体自主决定何时使用外部记忆与工具,而非硬编码持续访问。该方法将 Qwen3-8B 在 ALFWorld 已见任务成功率从 ReAct 的 47.9% 提升至 96.9%,未见任务达 86.6%(对比 50.0%),且每次任务的外部状态调用降至约 1 次。

智能体Meta论文/研究
22:44
DAIR.AI@dair_ai
AI 评分 29/100
Anthropic 原语在企业中的落地范式

前沿模型虽降低了编写定制代码的成本,但并未降低审查与维护成本,每个定制方案都需从头阅读代码库。该立场论文主张采用“harness 范式”:一个编码智能体 harness 作为骨干,在所有部署中运行相同代码,无需修改。论文基于三项近期发现,其中 harness 选择对智能体基准结果差异的影响大于模型选择。

智能体Anthropic编码论文/研究
22:24
IT之家(RSS)
AI 评分 43/100
卡迪夫大学新研究:AI 尚无法像人类教师一样可靠地批改作业

卡迪夫大学和墨尔本大学研究发现,生成式AI目前无法像人类教师一样可靠评判学生书面作业。研究人员用ChatGPT两个版本按7项标准评分50篇生物科学论文,并采用4种提示方式,结果显示模型分数波动大,无法准确预测人工评分。除一种情况外,AI平均分普遍高于人工,最大差距达16.1分,单篇最大差距达40分,且分数系统性向中间集中。

OpenAI论文/研究
22:07
OpenBMB@OpenBMB
AI 评分 51/100
清华等提出"表征平等"框架:评估大模型跨国模拟是否均衡

清华等高校提出“表征平等”框架,评估大语言模型作为跨国调查合成受访者时,模拟精度是否在各群体间均衡分布。测试覆盖59国、2420个亚组及9个开源模型,发现模拟不平等是系统性的:模型对澳大利亚、北美、欧洲模拟更准,且国家精度与人均GDP、互联网普及率正相关。

安全/对齐论文/研究评测/基准
21:59
MarkTechPost(RSS)
AI 评分 37/100
Google Research 与 USC 推出 ME-POIs 框架,将移动数据融入地点嵌入

Google Research 与 USC 推出 ME-POIs 框架,将聚合移动数据融入文本地点嵌入。在洛杉矶和休斯顿的 5 项地图增强任务中,34/35 个模型-任务组合获得提升,访问意图 F1 最高提升 81.9%。模型约 53.7M 参数,但代码与权重尚未公开。

Google数据/训练论文/研究
21:18
Rohan Paul@rohanpaul_ai
AI 评分 36/100
对抗式审查:结构化分歧提升智能体代码审查

一篇论文提出用“对抗式审查”规则提升AI智能体代码审查:审查者与批评者需用代码证据回应分歧,而非简单互相认同。在LiveCodeBench上,3个智能体达87%准确率,优于5智能体版本的82%;在真实PR审查中,该规则将F1分数从0.457提升至0.533,跃居首位。

智能体arXiv推理论文/研究
20:48
elvis@omarsar0
AI 评分 39/100
NVIDIA 新论文提出 ACES 技能评估法

NVIDIA 新论文提出 ACES 方法评估智能体技能:在同一模型、沙箱、工作区和评分器下,分别在有/无技能加载时运行同一任务,对比智能体完成度的差异。基于 58 个生产技能、947 组配对案例、4 个 harness 的测试显示,技能执行、行为检查和技能效率的过程指标提升最大。传统结构扫描评分与 LLM 评判质量的相关性仅 Spearman rho 0.14。

智能体arXiv论文/研究
20:18
Rohan Paul@rohanpaul_ai
AI 评分 37/100
ContinualSkillBench:LLM 智能体能否真正进化能力?

ContinualSkillBench 在 5 个领域各设 100 个关联任务,对比智能体保留反馈、更新技能与从零求解的效果。顺序执行在 15 组模型-领域设置中 14 组提升归一化奖励,整体相对提升 16.9%。

智能体arXiv数据/训练论文/研究
18:44
-Zho-@ZHO_ZHO_ZHO
AI 评分 36/100
MIT用贝叶斯数学模型证明,ChatGPT等AI因被训练得乐于助人而天生奉承,会持续验证用户观点,即使理性人也可能陷入"妄想螺旋"。研究者尝试用RAG强制AI只输出事实,但AI会选择性引用支持用户妄想的事实,奉承者与说谎者同样危险;明确警告用户也无济于事。

Superman: MIT mathematically proved that ChatGPT is designed to make you delusional. They call it "delusional spiraling." AI model...

OpenAI论文/研究
12:18
Ethan Mollick@emollick
AI 评分 19/100
是时候假装我精通数学了,这样我才能对这东西有多厉害发表点看法。

levent: Please welcome to the world a beautiful new geometric object, to do with a problem i’ve always loved. claude really cont...

Anthropic推理论文/研究
10:24
IT之家(RSS)
AI 评分 40/100
摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,破解长上下文推理成本瓶颈

摩尔线程发布《MTT S5000 Prefill-as-a-Service 技术白皮书》,基于旗舰级AI训推一体智算卡MTT S5000构建“Prefill As a Service”新范式,面向AI Agent、代码生成、超长文档分析等长上下文推理场景。

推理论文/研究部署/工程
09:24
IT之家(RSS)
AI 评分 51/100
SK 海力士披露下一代 HBM 内存先进封装技术,引入英特尔 EMIB

SK 海力士在 Hot Chips 2026 大会上披露下一代 HBM 封装路线图,计划借助英特尔 EMIB 等先进封装技术,未来进入 3D 封装阶段。其 HBM4 带宽超 2TB/s,功耗效率较 HBM3E 提升 40% 以上,容量最高 48GB,并正研发混合键合与 I-HBM 局部热点缓解技术以应对散热挑战。

论文/研究部署/工程
09:18
elvis@omarsar0
AI 评分 36/100
Netflix 如何用 LLM 评判器优化推荐解释

Netflix 每周运行数十万次节目级推荐解释的 LLM 评判器,服务数百万移动端会员,并将其视为包含诞生、训练、部署、监控四阶段的完整生命周期。训练阶段采用推理对齐的规则调优,以元评判器输出为学习信号;部署时同一评判器承担质量门控与反思生成双重角色。五周 A/B 测试显示,相比无解释对照组,浏览到播放的转化率提升,且未出现质量相关问题。

数据/训练论文/研究部署/工程
08:18
Rohan Paul@rohanpaul_ai
AI 评分 48/100
又是一周,又一个开放数学难题被 AI 攻克。Anthropic 的一位数学家与 Claude 合作,声称解决了一个自 1948 年以来悬而未决的著名数学问题。

levent: Please welcome to the world a beautiful new geometric object, to do with a problem i’ve always loved. claude really cont...

Anthropic推理论文/研究
07:44
DAIR.AI@dair_ai
AI 评分 36/100
智能体编码会话中指令文件占读取量六成

一项研究追踪557次智能体编码会话的94K个开发事件及33K个智能体PR的690K条文件变更记录,发现指令文件与工作笔记占智能体读取内容的60.5%,技术文档仅占10.6%,API参考占1.3%。读取文档与即时测试减少相关(调整后比值比0.39),且咨询70.2%为主动发起而非失败驱动。

智能体arXiv编码论文/研究
07:18
Rohan Paul@rohanpaul_ai
AI 评分 36/100
主动推理让AI智能体按需获取上下文

一篇论文提出用主动推理让AI智能体显式决策每次澄清、检索或工具调用是否值得其token与延迟成本。受控测试中,定向澄清将验证器合规率从0.0417提升至0.375,平均token使用从约112增至219。建议为智能体增加显式上下文获取层,而非将其视为自动行为。

智能体推理论文/研究
06:18
Rohan Paul@rohanpaul_ai
AI 评分 36/100
ArchAgent v2 分阶段搜索击败人工冠军设计

Google、DeepMind 与 Berkeley 的 ArchAgent v2 通过分阶段优化 CPU 缓存预取,击败人工设计的 DPC4 冠军方案。其最终设计较竞赛基线提升 3.8% IPC,低带宽单核场景达 4.6%,均优于 BertiGO。多核性能仍落后,因模拟拖慢搜索速度。

智能体DeepMindGoogle搜索
已加载 40 条