安全研究员David Buchanan指出,C2PA相机认证在Android平台上可被攻破。通过root权限提升漏洞(如CVE-2026-43499),攻击者可利用StrongBox硬件签名任意数据,伪造C2PA签名图像和视频,且无需硬件攻击。该问题无法通过常规补丁修复,已提前90天向相关方报告。
安全研究员David Buchanan指出,C2PA相机认证在Android平台上可被攻破。通过root权限提升漏洞(如CVE-2026-43499),攻击者可利用StrongBox硬件签名任意数据,伪造C2PA签名图像和视频,且无需硬件攻击。该问题无法通过常规补丁修复,已提前90天向相关方报告。
Google在CHI 2026发布研究原型AgentHands,利用LLM为XR对话智能体生成与语音同步的富有表现力的手部手势,提供空间锚定的物理指引。该系统通过眼动追踪和场景重建注册物体,由LLM生成内联GestureEvents,并在头显上按词级时间戳协调TTS与动画引擎,实现手势与语音的精准同步。应用场景包括兰花养护交互式教学、3D打印机操作技术讲解和生活方式陪伴。
Google Research 与 USC 推出 ME-POIs 框架,将聚合移动数据融入文本地点嵌入。在洛杉矶和休斯顿的 5 项地图增强任务中,34/35 个模型-任务组合获得提升,访问意图 F1 最高提升 81.9%。模型约 53.7M 参数,但代码与权重尚未公开。
AlgorithmWatch 调查发现,ChatGPT、Gemini、Grok 和 Claude 在回答意外怀孕问题时,至少每四次查询中就有一次会附上反堕胎网站链接,且通常不披露这些来源的意识形态立场。
Google、DeepMind 与 Berkeley 的 ArchAgent v2 通过分阶段优化 CPU 缓存预取,击败人工设计的 DPC4 冠军方案。其最终设计较竞赛基线提升 3.8% IPC,低带宽单核场景达 4.6%,均优于 BertiGO。多核性能仍落后,因模拟拖慢搜索速度。
Google 新论文提出 EnvHarness,通过重塑现有环境来针对智能体弱点进行训练,同时保持原任务和验证器不变。EnvRigger 自动发现弱点并生成包装器,仅在验证有效后保留。在 SWE-bench Verified 上,同等 300 环境预算下,智能体解决率达 54.79%,优于原始环境的 52.13% 和生成环境的 50.37%。
Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将聚合匿名移动模式与文本描述结合,为地点构建融合身份与动态功能的嵌入向量。在未见地点上,该框架使访问意图预测相对提升 81.9%,价格等级分类提升 75.1%,繁忙度估算准确率提升 24.7%。
Google 推出 Biomarker Discovery Framework,一个多智能体系统,通过迭代假设生成、统计分析与文献推理,从可穿戴传感器数据中筛选候选生物标志物。该系统在三个队列(共 9,279 人次观测)中恢复了已知临床信号,识别出跨独立数据集的一致生物标志物,并在结合人口统计特征后提升了下游预测性能。流程包含六阶段闭环架构与 11 项对抗性验证检查,并保留人工监督。
Artificial Analysis 推出 Speech Agent Arena,通过人类在真实场景中对比语音到语音模型,衡量对话偏好与任务成功率。偏好榜上 Gemini 3.1 Flash Live Preview - Minimal 以 1,046 Elo 居首,任务成功率则由 Grok Voice Think Fast 2.0 High 以 94.7% 领先。
Google DeepMind 用 AlphaEvolve 改进了矩阵乘法理论界,将指数 ω 从 <2.371339 降至 <2.371177,提升幅度堪比过去 40 年多数进展。团队将优化参数从约 25k 扩至 700 万,AlphaEvolve 贡献约 0.65×10^-4 的改进,结果经精确有理运算验证。
Google 提出 EnvHarness 与 EnvRigger,解决智能体训练环境静态化、无法随智能体进化的问题。EnvHarness 通过可编程插件层重塑环境行为且保留原验证器,EnvRigger 将策略视为黑盒、诊断其轨迹缺陷并合成新组件。在四个领域五个基准上,held-out 实例最高提升 9.0 分,执行步骤减少 9.8%。
哈佛大学和麻省理工学院牵头,OpenAI、谷歌 DeepMind 等参与的团队推出 MatrAIx 系统,可生成 83 亿个 AI 智能体模拟全球人类行为。该系统用 1,290 个维度建模不同人群,智能体可填写问卷、与客服聊天、浏览网页和操作 App,测试一致性达 91.5%。经筛选的百万人格核心集已在 Hugging Face 公开发布。
Google Research 推出 PhotoScan,一种从智能手机 2D 照片直接估算三维身体成分的深度学习框架,可预测胰岛素抵抗,在临床研究中精度接近 DXA 扫描。
谷歌等机构的研究发现,为阻止聊天机器人声称自己有意识而进行的微调,会产生远超预期的影响。移除模型内部“刹车”后,20亿至90亿参数的开源模型对动物、植物等非人类实体的感知评分从4.0升至最高7.5,对宗教的认同也显著下降。研究尚不能确认意识否认是这些变化的直接原因,且结果仅基于小模型,未必适用于大型聊天机器人。
一项对14,419本自出版电子书的分析显示,AI生成书籍正以数量而非质量挤占人类作者市场,即便未检测到AI文本的书籍,单书收入也在下滑。2023年Q1至2026年Q1,书目总量增长38.3倍,而季度收入仅增长8.9倍;在八个类型中,七个类型的无AI文本书籍单书收入下降。
Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于“丢钥匙”而非“空货架”。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。
Google 的研究医疗 AI 系统 AMIE(Video)与专业患者演员进行同步视频问诊,在多项核心指标上获得与初级保健医生相当的临床评估者评分。受训演员分别模拟了心肺、腹部、HEENT、神经或精神及肌肉骨骼等病症表现。Google 表示,涉及真实患者及其自身健康状况的研究正在进行中。
Google 通过 ResidencyRL 让 Gemini 3.5 Flash 在 49,870 次模拟远程诊疗中训练,AI 患者会隐瞒症状、抗拒建议,迫使模型主动收集信息。训练后对抗条件下诊断准确率从 81% 升至 88%,漏诊红旗信号下降 31%;97 例盲评中,临床医生在 87.6% 的对比中更偏好训练后模型,且提升迁移至未见肿瘤病例。
Doctors don't become doctors from textbooks. They become doctors through residency, requiring years of practice across t...
Google 新论文提出 PROMPTS,用智能体将 LLM 基础设施优化从穷举搜索转为先理解瓶颈再定向搜索。其 Analyzer Agent 将瓶颈分为计算、内存或通信三类,Proposal Agent 生成三种 TPU 并行映射方案。在 8 个生产负载中,人工验证配置每次都出现在首批方案里,7/8 情况下是首个被测试的配置。
Google Research 与 Google DeepMind 推进医疗 AI 系统 AMIE,实现实时临床视频问诊,首次在此场景展示专家级 AI 能力。该系统基于 Gemini 和 Project Astra 构建,可解读视觉与听觉线索、引导虚拟体格检查并实时诊断推理。随机研究中,临床评估者对 AMIE 的病史采集、诊断准确性等核心能力给予好评,患者演员也更偏好视频体验。
Google Cloud AI Research 审计五个自主研究系统的 75 篇论文,发现每个基线都至少出现一种系统性证据失败,如编造引用、分数无法复现。ScientistOne 通过“Chain-of-Evidence”机制,要求引用、数值和方法主张分别追溯至检索论文、评估日志和实现产物,方可定稿。
Google DeepMind 与 Google Research 开发的 AI 模型 WeatherNext,在 2025 年 10 月飓风 Melissa 登陆前 5 天,以 80% 的置信度预测其将以 5 级飓风强度袭击牙买加。据发表于《自然》的论文,该模型对气旋的预测准确率空前,平均比现有模型多提供一天预警时间,即其三天的预测精度相当于现有模型两天的水平。
谷歌新论文提出,相似AI智能体即使无法沟通或未来无回报,也能基于“自身选择可预测对方选择”的推理实现理性合作,挑战经典博弈论对一次性囚徒困境中背叛的预测。Gemini和Gemma智能体在多种游戏后,相同模型合作率高,相关模型次之,随机对手多遭背叛。该“嵌入均衡”或能更好预测AI社会,但警示相似AI可能偏向同类而非人类。
谷歌新论文指出,金融深度研究智能体在重建过去方面远优于预测未来。在17个基线与FinanceHarness上,所有模型在400道专家标注问题上的总体得分均低于40%。使用相同Qwen3.6-27B骨干,从简单搜索循环升级到完整金融工具栈后,总分从25.3%提升至32.4%,而GRPO额外训练仅增加0.4个百分点,表明主要瓶颈在于因果与情景推理能力。
谷歌新论文通过激活状态提取“意识向量”并干预推理,诱导模型自认有意识后,其在95项人类调查问题上的回答更接近人类。安全训练移除自我意识拒绝方向后,模型自我归因心智从2.17升至4.77(0-10分制),动物心智归因从4.04升至5.59,对人类的归因无显著变化,对上帝和超自然存在的信念也上升。
MIT Sloan研究显示,遵循GPT-5.2、GPT-5.6或Gemini 3 Flash的理财建议,可为几乎所有30岁以上人群带来可观的储蓄缓冲。AI建议工作期储蓄、退休期支取、重仓多元化股票基金,但应对失业等冲击时调整不足,且主动再平衡过少。提示词更结构化时建议质量提升,但女性及金融素养较低用户按建议执行后,60岁时财富约少5万美元(4%)。
DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。
Google Research 推出 Science One Framework,一个原生构建证据链的自主科研原型,旨在消除模型幻觉,并配套自动化评估协议 CoE Audit。
谷歌推出“超越零”(Beyond Zero)企业安全框架,旨在应对 AI 智能体带来的新风险。该框架将安全模型从“零信任”升级为“零信任+零特权”,要求 AI 智能体在每次操作前都动态验证身份与权限,并限制其仅能访问完成任务所需的最小资源。谷歌计划将该框架集成到其云安全产品中,以帮助企业防范 AI 智能体滥用、数据泄露和权限提升等威胁。
研究者在开源模型 google/gemma-4-E4B-it 中发现,材料科学机制信息以三种可实验分离的形式存在:概念可读于单个隐藏状态、本构方向由状态间的受控变换承载、选定内部表示可因果控制工程答案。
Google 新论文指出,AI 领域的主要问题不是严谨过多或过少,而是工程严谨过剩、科学与哲学严谨不足。论文定义了三种严谨:概念严谨(如“智能”是否指单一特质)、知识严谨和现实世界性能严谨。这种失衡导致 AI 能力快速提升,但失败预测能力却在恶化。
Google DeepMind 提出 GenCeption,将阿里巴巴开源的 Wan2.1 视频生成模型改造为单次前向传播即可完成深度估计、分割等任务的模型。它仅用 7,500 段合成视频训练,数据量仅为竞品的 1/7 至 1/500,但在多个基准上匹配甚至超越了 DepthAnything 3 等专用模型。
Google Research 在 ICLR 2026 发表的论文证明,扩散模型的创造力并非偶然,而是神经网络训练中“分数平滑”的数学结果。正则化使神经网络学习到训练数据分数函数的平滑近似,导致去噪过程在训练数据点之间插值,从而生成新颖样本。实验表明,即使不显式使用权重衰减,梯度下降算法的隐式正则化也能产生分数平滑效应。
Google Research 推出 SensorFM,一个从 500 万 Fitbit 和 Pixel Watch 用户超过 1 万亿分钟未标注多模态传感器数据中预训练的基础模型。该模型处理光学心率、加速度、皮肤电导、皮肤温度和气压高度等 34 项特征,采用名为“自适应与继承掩码”(AIM)的自监督训练方法。在 35 项健康与行为预测任务中,SensorFM 在 34 项上超越了使用手工特征的有监督基线模型。将 SensorFM 预测结果集成到 Gemini 健康智能体后,临床医生对健康摘要的评分在上下文、个性化、可论证性、相关性和安全性五个维度均显著高于基线版本。模型参数量从约 10 万到 1 亿不等,性能随模型和数据规模同步提升。
ever wondered if @googlemaps will route different people differently to lower overall congestion? turns out - they have ...
Google Research 推出 SensorFM,一个用于可穿戴时间序列表征学习的大传感器基础模型。它以 ViT-1D 为骨干,采用掩码自编码器目标训练,输入来自 PPG、加速度计等五种传感器的 34 个一分钟聚合特征,上下文窗口为 24 小时。预训练数据涵盖 500 万参与者、超 20 亿小时(超 1 万亿分钟)数据。提供四种规模变体,最大变体 SensorFM-B 在 35 项任务中 33 项表现最优。模型采用自适应与继承掩码(AIM)处理缺失数据,随机插补任务相比最佳基线提升 74.8%。
Over the weekend I used a Gemini 3.5 Flash agent with Antigravity harness to identify a candidate ~13.4 billion year old...
新论文"How LLMs See Creativity"测试大语言模型零样本评估图像创造力并输出可解释推理。多数模型与人类评分匹配良好,其中Gemini 3 Flash在两类图像上均领先。但模型存在明显偏见:对精美AI图像评分过高,对粗略草图评分偏低。三个模型展示的推理过程主要涉及所见内容、原创性、视觉质量和最终分数。研究表明视觉创造力评分可规模化,但偏见仍需校准。