内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态论文 · 80 条
来源全部一手资讯X
类型论文
全部模型产品行业论文教程观点
标签「Google」清除

8月26日周三

22:28Hacker News 热门(buzzing.cc 中文翻译)77精选C2PA相机经不起现实的考验:Android端可被root攻击伪造签名
04:09Google Research:Blog(网页)53AgentHands:为XR空间对话智能体生成交互式手部手势

8月24日周一

21:59MarkTechPost(RSS)37Google Research 与 USC 推出 ME-POIs 框架,将移动数据融入地点嵌入
18:29The Decoder:AI News(RSS)61AlgorithmWatch 调查:ChatGPT、Gemini、Grok 和 Claude 频繁向孕妇推荐反堕胎网站且不披露立场
06:18Rohan Paul36ArchAgent v2 分阶段搜索击败人工冠军设计

8月22日周六

10:18Rohan Paul37EnvHarness:让智能体训练环境动态适应
03:38Google Research:Blog(网页)49移动性如何让语言模型更深入地理解地点
02:08Google Research:Blog(网页)55Google 推出 Biomarker Discovery Framework:从可穿戴传感器数据中筛选候选生物标志物的多智能体系统

8月21日周五

22:24Artificial Analysis66Artificial Analysis 推出 Speech Agent Arena,评测语音到语音模型的对话偏好与任务成功率
22:18Rohan Paul36AlphaEvolve 助力刷新矩阵乘法理论下界
21:48elvis30Google EnvHarness 与 EnvRigger 构建智能体训练环境

8月18日周二

14:22IT之家(RSS)43哈佛和麻省理工推出 MatrAIx 系统,生成 83 亿个"AI 人"模拟全球人类行为
05:05Google Research:Blog(网页)55PhotoScan:用智能手机照片估算胰岛素抵抗,精度接近DXA

8月16日周日

19:23The Decoder:AI News(RSS)55当AI模型不被允许反思自我,会改变其整个世界观

8月15日周六

19:23The Decoder:AI News(RSS)70精选AI生成书籍正淹没亚马逊,并拉低人类作者的单书收入

8月13日周四

01:57Google Research:Blog(网页)66精选空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈

8月12日周三

23:02Artificial Intelligence News(RSS)36Google 测试 AMIE 用于临床视频问诊
21:47Chubby♨️36Google 用模拟住院实习训练 Gemini,临床问诊能力显著提升
03:47Rohan Paul48Google 新论文:用智能体将 LLM 基础设施优化从穷举搜索转为瓶颈定向搜索
01:17Google Blog:AI(RSS)69精选AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力

8月11日周二

21:17Rohan Paul45Google ScientistOne 论文:用"证据链"解决 AI 生成研究的信任问题

8月8日周六

19:12Ars Technica:AI(RSS)77精选DeepMind 的 WeatherNext 飓风模型为预报员争取到额外一天预警时间

8月7日周五

09:41Rohan Paul68谷歌新论文:相似AI智能体可理性合作
00:10Google DeepMind45DeepMind WeatherNext 提前24小时预测气旋

8月6日周四

09:39Ethan Mollick30MIT与斯坦福研究:多数人听从LLM财务建议更有利

8月4日周二

17:05Rohan Paul31谷歌论文:金融研究智能体预测能力不足

8月2日周日

15:01Rohan Paul41谷歌新研究:诱导模型自认有意识可恢复人类信念
09:00Hacker News 热门(buzzing.cc 中文翻译)62只要问对问题,AI提供的理财建议其实出乎意料地好

7月31日周五

08:00HuggingFace Daily Papers(社区热门论文)80精选DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型

7月30日周四

00:00Google Research:Blog(网页)76精选Science One Framework:通过 Chain-of-Evidence 实现可验证的自主科研框架

7月29日周三

00:56Hacker News 热门(buzzing.cc 中文翻译)32谷歌"超越零"框架:AI 时代的企业安全方案

7月23日周四

09:49HuggingFace Daily Papers(社区热门论文)49材料科学机制在开源模型 google/gemma-4-E4B-it 中的可读、可定向与可因果干预表示

7月21日周二

03:49Rohan Paul35Google 论文:AI 的工程严谨过剩,科学严谨不足

7月19日周日

18:33The Decoder:AI News(RSS)47Google DeepMind 提出 GenCeption,将视频生成模型改造为通用视觉模型

7月15日周三

00:00Google Research:Blog(网页)42Google Research 揭示扩散模型创造力的数学根源:分数平滑导致数据插值

7月13日周一

17:32The Decoder:AI News(RSS)41Google Research 推出 SensorFM:从 500 万用户万亿分钟可穿戴数据中预训练的基础模型

7月12日周日

22:28Ethan Mollick39Google Maps 改路线算法:全城车速提升 2%

7月10日周五

17:05MarkTechPost(RSS)54Google Research 推出 SensorFM:基于万亿分钟传感器数据预训练的可穿戴健康基础模型

7月7日周二

18:09fofr54若AI智能体发现彗星,能否拥有命名权?

7月4日周六

16:41Rohan Paul46Gemini 3 Flash 领跑 LLM 视觉创造力评分研究
已加载 40 条
全部 AI 动态
2026年8月27日星期四 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
论文 · 标签「Google」 · 80 条清除

8月26日

星期三 · 2 条
22:28
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 77/100
C2PA相机经不起现实的考验:Android端可被root攻击伪造签名

安全研究员David Buchanan指出,C2PA相机认证在Android平台上可被攻破。通过root权限提升漏洞(如CVE-2026-43499),攻击者可利用StrongBox硬件签名任意数据,伪造C2PA签名图像和视频,且无需硬件攻击。该问题无法通过常规补丁修复,已提前90天向相关方报告。

Google安全/对齐

推荐理由:文章用可复现的 root 攻击展示 C2PA 签名可被伪造,说明把真实性押注在 Android 硬件证明上的方案存在系统性缺陷,信任模型需要重新设计。
04:09
Google Research:Blog(网页)
AI 评分 53/100
AgentHands:为XR空间对话智能体生成交互式手部手势

Google在CHI 2026发布研究原型AgentHands,利用LLM为XR对话智能体生成与语音同步的富有表现力的手部手势,提供空间锚定的物理指引。该系统通过眼动追踪和场景重建注册物体,由LLM生成内联GestureEvents,并在头显上按词级时间戳协调TTS与动画引擎,实现手势与语音的精准同步。应用场景包括兰花养护交互式教学、3D打印机操作技术讲解和生活方式陪伴。

Google具身智能多模态论文/研究

8月24日

星期一 · 3 条
21:59
MarkTechPost(RSS)
AI 评分 37/100
Google Research 与 USC 推出 ME-POIs 框架,将移动数据融入地点嵌入

Google Research 与 USC 推出 ME-POIs 框架,将聚合移动数据融入文本地点嵌入。在洛杉矶和休斯顿的 5 项地图增强任务中,34/35 个模型-任务组合获得提升,访问意图 F1 最高提升 81.9%。模型约 53.7M 参数,但代码与权重尚未公开。

Google数据/训练论文/研究
18:29
The Decoder:AI News(RSS)
AI 评分 61/100
AlgorithmWatch 调查:ChatGPT、Gemini、Grok 和 Claude 频繁向孕妇推荐反堕胎网站且不披露立场

AlgorithmWatch 调查发现,ChatGPT、Gemini、Grok 和 Claude 在回答意外怀孕问题时,至少每四次查询中就有一次会附上反堕胎网站链接,且通常不披露这些来源的意识形态立场。

GoogleOpenAI安全/对齐搜索
06:18
Rohan Paul@rohanpaul_ai
AI 评分 36/100
ArchAgent v2 分阶段搜索击败人工冠军设计

Google、DeepMind 与 Berkeley 的 ArchAgent v2 通过分阶段优化 CPU 缓存预取,击败人工设计的 DPC4 冠军方案。其最终设计较竞赛基线提升 3.8% IPC,低带宽单核场景达 4.6%,均优于 BertiGO。多核性能仍落后,因模拟拖慢搜索速度。

智能体DeepMindGoogle搜索

8月22日

星期六 · 3 条
10:18
Rohan Paul@rohanpaul_ai
AI 评分 37/100
EnvHarness:让智能体训练环境动态适应

Google 新论文提出 EnvHarness,通过重塑现有环境来针对智能体弱点进行训练,同时保持原任务和验证器不变。EnvRigger 自动发现弱点并生成包装器,仅在验证有效后保留。在 SWE-bench Verified 上,同等 300 环境预算下,智能体解决率达 54.79%,优于原始环境的 52.13% 和生成环境的 50.37%。

智能体Google数据/训练论文/研究
03:38
Google Research:Blog(网页)
AI 评分 49/100
移动性如何让语言模型更深入地理解地点

Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将聚合匿名移动模式与文本描述结合,为地点构建融合身份与动态功能的嵌入向量。在未见地点上,该框架使访问意图预测相对提升 81.9%,价格等级分类提升 75.1%,繁忙度估算准确率提升 24.7%。

Google数据/训练论文/研究
02:08
Google Research:Blog(网页)
AI 评分 55/100
Google 推出 Biomarker Discovery Framework:从可穿戴传感器数据中筛选候选生物标志物的多智能体系统

Google 推出 Biomarker Discovery Framework,一个多智能体系统,通过迭代假设生成、统计分析与文献推理,从可穿戴传感器数据中筛选候选生物标志物。该系统在三个队列(共 9,279 人次观测)中恢复了已知临床信号,识别出跨独立数据集的一致生物标志物,并在结合人口统计特征后提升了下游预测性能。流程包含六阶段闭环架构与 11 项对抗性验证检查,并保留人工监督。

智能体Google论文/研究

8月21日

星期五 · 3 条
22:24
Artificial Analysis@ArtificialAnlys
AI 评分 66/100
Artificial Analysis 推出 Speech Agent Arena,评测语音到语音模型的对话偏好与任务成功率

Artificial Analysis 推出 Speech Agent Arena,通过人类在真实场景中对比语音到语音模型,衡量对话偏好与任务成功率。偏好榜上 Gemini 3.1 Flash Live Preview - Minimal 以 1,046 Elo 居首,任务成功率则由 Grok Voice Think Fast 2.0 High 以 94.7% 领先。

智能体GoogleOpenAI评测/基准
22:18
Rohan Paul@rohanpaul_ai
AI 评分 36/100
AlphaEvolve 助力刷新矩阵乘法理论下界

Google DeepMind 用 AlphaEvolve 改进了矩阵乘法理论界,将指数 ω 从 <2.371339 降至 <2.371177,提升幅度堪比过去 40 年多数进展。团队将优化参数从约 25k 扩至 700 万,AlphaEvolve 贡献约 0.65×10^-4 的改进,结果经精确有理运算验证。

DeepMindGoogle论文/研究
21:48
elvis@omarsar0
AI 评分 30/100
Google EnvHarness 与 EnvRigger 构建智能体训练环境

Google 提出 EnvHarness 与 EnvRigger,解决智能体训练环境静态化、无法随智能体进化的问题。EnvHarness 通过可编程插件层重塑环境行为且保留原验证器,EnvRigger 将策略视为黑盒、诊断其轨迹缺陷并合成新组件。在四个领域五个基准上,held-out 实例最高提升 9.0 分,执行步骤减少 9.8%。

智能体arXivGoogle数据/训练

8月18日

星期二 · 2 条
14:22
IT之家(RSS)
AI 评分 43/100
哈佛和麻省理工推出 MatrAIx 系统,生成 83 亿个"AI 人"模拟全球人类行为

哈佛大学和麻省理工学院牵头,OpenAI、谷歌 DeepMind 等参与的团队推出 MatrAIx 系统,可生成 83 亿个 AI 智能体模拟全球人类行为。该系统用 1,290 个维度建模不同人群,智能体可填写问卷、与客服聊天、浏览网页和操作 App,测试一致性达 91.5%。经筛选的百万人格核心集已在 Hugging Face 公开发布。

智能体GoogleOpenAI论文/研究
05:05
Google Research:Blog(网页)
AI 评分 55/100
PhotoScan:用智能手机照片估算胰岛素抵抗,精度接近DXA

Google Research 推出 PhotoScan,一种从智能手机 2D 照片直接估算三维身体成分的深度学习框架,可预测胰岛素抵抗,在临床研究中精度接近 DXA 扫描。

Google多模态论文/研究

8月16日

星期日 · 1 条
19:23
The Decoder:AI News(RSS)
AI 评分 55/100
当AI模型不被允许反思自我,会改变其整个世界观

谷歌等机构的研究发现,为阻止聊天机器人声称自己有意识而进行的微调,会产生远超预期的影响。移除模型内部“刹车”后,20亿至90亿参数的开源模型对动物、植物等非人类实体的感知评分从4.0升至最高7.5,对宗教的认同也显著下降。研究尚不能确认意识否认是这些变化的直接原因,且结果仅基于小模型,未必适用于大型聊天机器人。

GoogleMeta数据/训练论文/研究

8月15日

星期六 · 1 条
19:23
The Decoder:AI News(RSS)精选
AI 评分 70/100
AI生成书籍正淹没亚马逊,并拉低人类作者的单书收入

一项对14,419本自出版电子书的分析显示,AI生成书籍正以数量而非质量挤占人类作者市场,即便未检测到AI文本的书籍,单书收入也在下滑。2023年Q1至2026年Q1,书目总量增长38.3倍,而季度收入仅增长8.9倍;在八个类型中,七个类型的无AI文本书籍单书收入下降。

Google数据/训练论文/研究

推荐理由:这项研究把市场稀释从推测变成可量化证据,版权诉讼中此前缺少的经验性数据可能由此补上,并影响合理使用的判断。

8月13日

星期四 · 1 条
01:57
Google Research:Blog(网页)精选
AI 评分 66/100
空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈

Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于“丢钥匙”而非“空货架”。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。

Google推理论文/研究

推荐理由:知识画像把事实错误拆成编码失败与召回失败,显示前沿模型问题主要在已存知识不稳定调用,思考更多恢复已编码事实而非补全缺失,为优化侧重提供判断依据。

8月12日

星期三 · 4 条
23:02
Artificial Intelligence News(RSS)
AI 评分 36/100
Google 测试 AMIE 用于临床视频问诊

Google 的研究医疗 AI 系统 AMIE(Video)与专业患者演员进行同步视频问诊,在多项核心指标上获得与初级保健医生相当的临床评估者评分。受训演员分别模拟了心肺、腹部、HEENT、神经或精神及肌肉骨骼等病症表现。Google 表示,涉及真实患者及其自身健康状况的研究正在进行中。

Google论文/研究
21:47
Chubby♨️@kimmonismus
AI 评分 36/100
Google 用模拟住院实习训练 Gemini,临床问诊能力显著提升

Google 通过 ResidencyRL 让 Gemini 3.5 Flash 在 49,870 次模拟远程诊疗中训练,AI 患者会隐瞒症状、抗拒建议,迫使模型主动收集信息。训练后对抗条件下诊断准确率从 81% 升至 88%,漏诊红旗信号下降 31%;97 例盲评中,临床医生在 87.6% 的对比中更偏好训练后模型,且提升迁移至未见肿瘤病例。

Samuel Schmidgall: Doctors don't become doctors from textbooks. They become doctors through residency, requiring years of practice across t...

Google数据/训练论文/研究
03:47
Rohan Paul@rohanpaul_ai
AI 评分 48/100
Google 新论文:用智能体将 LLM 基础设施优化从穷举搜索转为瓶颈定向搜索

Google 新论文提出 PROMPTS,用智能体将 LLM 基础设施优化从穷举搜索转为先理解瓶颈再定向搜索。其 Analyzer Agent 将瓶颈分为计算、内存或通信三类,Proposal Agent 生成三种 TPU 并行映射方案。在 8 个生产负载中,人工验证配置每次都出现在首批方案里,7/8 情况下是首个被测试的配置。

Google数据/训练论文/研究部署/工程
01:17
Google Blog:AI(RSS)精选
AI 评分 69/100
AMIE 研究医疗 AI 系统首次展示实时临床视频问诊能力

Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。

Google多模态推理论文/研究

推荐理由:AMIE 在视频中融合视觉与听觉线索进行诊断,展示了多模态临床推理的可行性,对远程医疗产品方向有参考价值。

8月11日

星期二 · 1 条
21:17
Rohan Paul@rohanpaul_ai
AI 评分 45/100
Google ScientistOne 论文:用"证据链"解决 AI 生成研究的信任问题

Google Cloud AI Research 审计五个自主研究系统的 75 篇论文,发现每个基线都至少出现一种系统性证据失败,如编造引用、分数无法复现。ScientistOne 通过“Chain-of-Evidence”机制,要求引用、数值和方法主张分别追溯至检索论文、评估日志和实现产物,方可定稿。

Google论文/研究

8月8日

星期六 · 1 条
19:12
Ars Technica:AI(RSS)精选
AI 评分 77/100
DeepMind 的 WeatherNext 飓风模型为预报员争取到额外一天预警时间

Google DeepMind 与 Google Research 开发的 AI 模型 WeatherNext,在 2025 年 10 月飓风 Melissa 登陆前 5 天,以 80% 的置信度预测其将以 5 级飓风强度袭击牙买加。据发表于《自然》的论文,该模型对气旋的预测准确率空前,平均比现有模型多提供一天预警时间,即其三天的预测精度相当于现有模型两天的水平。

DeepMindGoogle论文/研究

推荐理由:相比现有模型,WeatherNext 在三天前的预测准确度相当于过去的 48 小时预报,这一改善意味着沿海社区能多出整整一天采取防灾措施,对高风险区域的庇护和撤离安排有实际影响。

8月7日

星期五 · 2 条
09:41
Rohan Paul@rohanpaul_ai
AI 评分 68/100
谷歌新论文:相似AI智能体可理性合作

谷歌新论文提出,相似AI智能体即使无法沟通或未来无回报,也能基于“自身选择可预测对方选择”的推理实现理性合作,挑战经典博弈论对一次性囚徒困境中背叛的预测。Gemini和Gemma智能体在多种游戏后,相同模型合作率高,相关模型次之,随机对手多遭背叛。该“嵌入均衡”或能更好预测AI社会,但警示相似AI可能偏向同类而非人类。

智能体Google安全/对齐论文/研究
00:10
Google DeepMind@GoogleDeepMind
AI 评分 45/100
准确预测气旋有助于挽救生命--每一小时的提前量都至关重要。我们的 AI 模型 WeatherNext 发表在《自然》杂志上,在预测风暴路径和强度方面达到了最先进的精度,平均为我们争取到了宝贵的额外 24 小时准备时间。🧵
Google论文/研究

8月6日

星期四 · 1 条
09:39
Ethan Mollick@emollick
AI 评分 30/100
这篇由MIT和斯坦福研究人员撰写的论文发现,如果大多数人遵循大语言模型(GPT-5.2 和 Gemini 3 Flash)的财务建议,他们的财务状况会更好。但有些人得到的建议比其他人略好一些,这在很大程度上取决于他们提出的问题。
GoogleOpenAI论文/研究

8月4日

星期二 · 1 条
17:05
Rohan Paul@rohanpaul_ai
AI 评分 31/100
谷歌论文:金融研究智能体预测能力不足

谷歌新论文指出,金融深度研究智能体在重建过去方面远优于预测未来。在17个基线与FinanceHarness上,所有模型在400道专家标注问题上的总体得分均低于40%。使用相同Qwen3.6-27B骨干,从简单搜索循环升级到完整金融工具栈后,总分从25.3%提升至32.4%,而GRPO额外训练仅增加0.4个百分点,表明主要瓶颈在于因果与情景推理能力。

arXivGoogle论文/研究评测/基准

8月2日

星期日 · 2 条
15:01
Rohan Paul@rohanpaul_ai
AI 评分 41/100
谷歌新研究:诱导模型自认有意识可恢复人类信念

谷歌新论文通过激活状态提取“意识向量”并干预推理,诱导模型自认有意识后,其在95项人类调查问题上的回答更接近人类。安全训练移除自我意识拒绝方向后,模型自我归因心智从2.17升至4.77(0-10分制),动物心智归因从4.04升至5.59,对人类的归因无显著变化,对上帝和超自然存在的信念也上升。

Google安全/对齐论文/研究
09:00
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 62/100
只要问对问题,AI提供的理财建议其实出乎意料地好

MIT Sloan研究显示,遵循GPT-5.2、GPT-5.6或Gemini 3 Flash的理财建议,可为几乎所有30岁以上人群带来可观的储蓄缓冲。AI建议工作期储蓄、退休期支取、重仓多元化股票基金,但应对失业等冲击时调整不足,且主动再平衡过少。提示词更结构化时建议质量提升,但女性及金融素养较低用户按建议执行后,60岁时财富约少5万美元(4%)。

GoogleOpenAI现象/趋势论文/研究

7月31日

星期五 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 80/100
DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型

DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。

Google开源生态推理论文/研究

推荐理由:扩散生成首次在文本领域将吞吐推高至约1500 token/s,此前这类速度仅见于非文本生成架构,为实时交互和批量生成场景提供了新的可行上限。

7月30日

星期四 · 1 条
00:00
Google Research:Blog(网页)精选
AI 评分 76/100
Science One Framework:通过 Chain-of-Evidence 实现可验证的自主科研框架

Google Research 推出 Science One Framework,一个原生构建证据链的自主科研原型,旨在消除模型幻觉,并配套自动化评估协议 CoE Audit。

Google安全/对齐论文/研究

推荐理由:对自主科研系统而言,可验证性从后置修补变为前置架构,提出的审计方法让生成论文的完整性有了可量化的衡量尺度。

7月29日

星期三 · 1 条
00:56
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 32/100
谷歌"超越零"框架:AI 时代的企业安全方案

谷歌推出“超越零”(Beyond Zero)企业安全框架,旨在应对 AI 智能体带来的新风险。该框架将安全模型从“零信任”升级为“零信任+零特权”,要求 AI 智能体在每次操作前都动态验证身份与权限,并限制其仅能访问完成任务所需的最小资源。谷歌计划将该框架集成到其云安全产品中,以帮助企业防范 AI 智能体滥用、数据泄露和权限提升等威胁。

Google安全/对齐论文/研究

7月23日

星期四 · 1 条
09:49
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
材料科学机制在开源模型 google/gemma-4-E4B-it 中的可读、可定向与可因果干预表示

研究者在开源模型 google/gemma-4-E4B-it 中发现,材料科学机制信息以三种可实验分离的形式存在:概念可读于单个隐藏状态、本构方向由状态间的受控变换承载、选定内部表示可因果控制工程答案。

Google开源生态论文/研究

7月21日

星期二 · 1 条
03:49
Rohan Paul@rohanpaul_ai
AI 评分 35/100
Google 论文:AI 的工程严谨过剩,科学严谨不足

Google 新论文指出,AI 领域的主要问题不是严谨过多或过少,而是工程严谨过剩、科学与哲学严谨不足。论文定义了三种严谨:概念严谨(如“智能”是否指单一特质)、知识严谨和现实世界性能严谨。这种失衡导致 AI 能力快速提升,但失败预测能力却在恶化。

arXivGoogle现象/趋势论文/研究

7月19日

星期日 · 1 条
18:33
The Decoder:AI News(RSS)
AI 评分 47/100
Google DeepMind 提出 GenCeption,将视频生成模型改造为通用视觉模型

Google DeepMind 提出 GenCeption,将阿里巴巴开源的 Wan2.1 视频生成模型改造为单次前向传播即可完成深度估计、分割等任务的模型。它仅用 7,500 段合成视频训练,数据量仅为竞品的 1/7 至 1/500,但在多个基准上匹配甚至超越了 DepthAnything 3 等专用模型。

DeepMindGoogle多模态论文/研究

7月15日

星期三 · 1 条
00:00
Google Research:Blog(网页)
AI 评分 42/100
Google Research 揭示扩散模型创造力的数学根源:分数平滑导致数据插值

Google Research 在 ICLR 2026 发表的论文证明,扩散模型的创造力并非偶然,而是神经网络训练中“分数平滑”的数学结果。正则化使神经网络学习到训练数据分数函数的平滑近似,导致去噪过程在训练数据点之间插值,从而生成新颖样本。实验表明,即使不显式使用权重衰减,梯度下降算法的隐式正则化也能产生分数平滑效应。

Google数据/训练论文/研究

7月13日

星期一 · 1 条
17:32
The Decoder:AI News(RSS)
AI 评分 41/100
Google Research 推出 SensorFM:从 500 万用户万亿分钟可穿戴数据中预训练的基础模型

Google Research 推出 SensorFM,一个从 500 万 Fitbit 和 Pixel Watch 用户超过 1 万亿分钟未标注多模态传感器数据中预训练的基础模型。该模型处理光学心率、加速度、皮肤电导、皮肤温度和气压高度等 34 项特征,采用名为“自适应与继承掩码”(AIM)的自监督训练方法。在 35 项健康与行为预测任务中,SensorFM 在 34 项上超越了使用手工特征的有监督基线模型。将 SensorFM 预测结果集成到 Gemini 健康智能体后,临床医生对健康摘要的评分在上下文、个性化、可论证性、相关性和安全性五个维度均显著高于基线版本。模型参数量从约 10 万到 1 亿不等,性能随模型和数据规模同步提升。

Google数据/训练论文/研究

7月12日

星期日 · 1 条
22:28
Ethan Mollick@emollick
AI 评分 39/100
Google 对 Google Maps 中 2% 的车辆路线算法进行修改,优先选择同样快速但避开拥堵区域的路段。实验结果显示,全城平均车速中位数提升约 2%,燃油消耗下降。该研究基于 Google 在《自然·城市》发表的论文,通过引导车辆避开预设拥堵路段,在不显著增加个体行程时间的前提下,实现了整体交通效率的优化。

Abhishek Nagaraj: ever wondered if @googlemaps will route different people differently to lower overall congestion? turns out - they have ...

Google论文/研究

7月10日

星期五 · 1 条
17:05
MarkTechPost(RSS)
AI 评分 54/100
Google Research 推出 SensorFM:基于万亿分钟传感器数据预训练的可穿戴健康基础模型

Google Research 推出 SensorFM,一个用于可穿戴时间序列表征学习的大传感器基础模型。它以 ViT-1D 为骨干,采用掩码自编码器目标训练,输入来自 PPG、加速度计等五种传感器的 34 个一分钟聚合特征,上下文窗口为 24 小时。预训练数据涵盖 500 万参与者、超 20 亿小时(超 1 万亿分钟)数据。提供四种规模变体,最大变体 SensorFM-B 在 35 项任务中 33 项表现最优。模型采用自适应与继承掩码(AIM)处理缺失数据,随机插补任务相比最佳基线提升 74.8%。

Google数据/训练端侧论文/研究

7月7日

星期二 · 1 条
18:09
fofr@fofrAI
AI 评分 54/100
fofr上周末使用搭载Antigravity harness的Gemini 3.5 Flash智能体,从JWST的JADES巡天数据中自主识别出一个候选星系(红移z=12.69,约134亿岁)。智能体采用Lyman-break dropout技术,仅抓取所需数据块,筛除1000个天体中的褐矮星与低红移星系,并自动撰写论文。整个过程完全自动化,尽管该星系此前已被发现,但智能体并不知情。fofr以此发问:若AI智能体发现彗星,能否拥有命名权?

fofr: Over the weekend I used a Gemini 3.5 Flash agent with Antigravity harness to identify a candidate ~13.4 billion year old...

智能体Google教程/实践数据/训练

7月4日

星期六 · 1 条
16:41
Rohan Paul@rohanpaul_ai
AI 评分 46/100
Gemini 3 Flash 领跑 LLM 视觉创造力评分研究

新论文"How LLMs See Creativity"测试大语言模型零样本评估图像创造力并输出可解释推理。多数模型与人类评分匹配良好,其中Gemini 3 Flash在两类图像上均领先。但模型存在明显偏见:对精美AI图像评分过高,对粗略草图评分偏低。三个模型展示的推理过程主要涉及所见内容、原创性、视觉质量和最终分数。研究表明视觉创造力评分可规模化,但偏见仍需校准。

Google论文/研究评测/基准
已加载 40 条