Topic · 主题全部主题 →

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

2,180条收录
296条精选

精选归档 · 第 12 页

221240 条 · 共 296

5月6日

星期三 · 1 条
02:56
Google AI Developers@googleaidevs精选
AI 评分 68/100
Gemini API 文件搜索工具推出三项新更新,助力多模态 RAG 系统开发We’re expanding the Gemini API File Search tool 🔍 with 3 new updates that enable developers to more easily build multimodal RAG systems with enhanced precision:• Multimodal Support: By leveraging our Gemini Embedding 2 model, File Search can now reason across image and text simultaneously.• Custom Metadata Filtering: Bring structure to unstructured data by tagging files with custom key-value labels. This pre-filters your data and boosts search speed.• Exact citations: File Search can now capture and return the exact source (down to the page number) for every piece of information indexed.See multimodal File Search in action with our example app in @GoogleAIStudio. Chat with your entire image and doc library, ask questions, and trace answers back to the source: http://goo.gle/4tKSz1kGemini API 文件搜索工具近日扩展三项功能更新,旨在帮助开发者更轻松地构建高精度多模态检索增强生成系统。更新包括:多模态支持,通过Gemini Embedding 2模型实现对图像和文本的同步推理;自定义元数据过滤,允许为文件添加键值标签以结构化非结构化数据,从而提升搜索速度;精确引用功能,能够捕获并返回每条索引信息的精确来源,如页码。开发者可通过Google AI Studio的示例应用体验这些功能,与图像和文档库交互,提问并追溯答案来源。

推荐理由:如果你在用 Gemini 搭 RAG 系统,这三项更新能直接改善搜索精度和可解释性,多模态搜索终于把图片和文档打通了,值得马上试试。

5月5日

星期二 · 5 条
20:56
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 78/100
Google Chrome 被曝未经用户同意悄然安装 4 GB AI 模型

据隐私倡导网站报道,Google Chrome 浏览器在未经任何提示或用户同意的情况下,于后台自动下载并安装了一个名为“Nano”、体积达 4 GB 的人工智能模型。该行为旨在增强本地AI功能,但完全隐蔽的安装过程占用了用户设备存储空间,且未提供任何选项或通知,引发了对其数据隐私风险及软件更新透明度的广泛担忧。此事件在Hacker News上获得高度关注,突显了公众对科技公司单方面安装行为的普遍不安。


推荐理由:浏览器里偷偷塞进4GB的AI模型,这件事揭开了一个很多人忽视的趋势,你的设备正在变成AI宿主,而且根本不需要征得同意。
05:48
Google Blog:AI(RSS)精选
AI 评分 71/100
通过 Gemini API 中的 Webhooks 减少长时任务的摩擦与延迟

Gemini API 引入了事件驱动的 Webhook 功能,这是一种基于推送的通知系统。它旨在消除低效的轮询需求,为长时运行的任务(如文件处理或复杂推理)提供更优的解决方案。当任务完成时,系统会自动将结果推送到用户指定的端点,从而显著降低延迟并减少资源消耗,提升开发效率与响应速度。


推荐理由:Gemini API 终于补上 Webhooks 这块拼图,长任务不用再轮询等待,对做自动化流程和 Agent 的开发者是实打实的效率提升。
02:58
Google Gemini@GeminiApp精选
AI 评分 67/100
创意速成:Nano Banana 2助力产品原型实现From idea to prototype, bring your specific product visions to life with the help of Nano Banana 2 in Gemini. 🪀从构想到原型,借助Gemini中的Nano Banana 2,将您独特的产品愿景变为现实。🪀

推荐理由:Google Gemini塞进一个Nano Banana 2创意工具,把想法转原型只需几句话,产品经理脑暴草案利器,算不上重磅但够实用。
00:54
Google Developers Blog(RSS)精选
AI 评分 66/100
在谷歌TPU上实现3倍加速:UCSD利用扩散式推测解码优化LLM推理

加州大学圣地亚哥分校的研究团队在谷歌TPU上成功部署了DFlash,一种基于块扩散的推测解码方法。该方法突破传统自回归草稿生成的序列性瓶颈,通过单次前向传播并行“绘制”整个候选令牌块,而非逐个预测。系统平均实现了3.13倍的推理加速,峰值性能接近EAGLE-3等现有方法的两倍。这一开源方案已集成至vLLM生态系统,通过利用“免费”的并行验证能力和针对复杂推理任务的高质量草稿预测,显著优化了TPU硬件的利用效率。


推荐理由:把扩散式的 speculative decoding 在 TPU 上跑出了 3 倍推理加速,峰值快到 EAGLE-3 的两倍,还直接集成了 vLLM,做推理优化的赶紧试一下。

5月2日

星期六 · 1 条

5月1日

星期五 · 4 条
02:13
Google Developers Blog(RSS)精选
AI 评分 62/100
基于Gemini Embedding 2构建:智能多模态RAG及其他应用

Google正式发布Gemini Embedding 2统一嵌入模型,该模型能将文本、图像、视频、音频和文档映射到同一语义空间。开发者可通过单请求处理交织多模态输入,显著提升智能RAG、视觉搜索等内容审核任务的性能。模型支持超100种语言,并提供任务特定前缀和马特廖什卡降维等特性,为构建复杂AI智能体提供高效精准的基础。


推荐理由:开发者做多模态RAG的苦日子结束了,Gemini Embedding 2把文本、图片、视频塞进同一个语义空间,还自带Matryoshka降维,直接省掉一堆胶水代码。
01:45
Google AI@GoogleAI精选
AI 评分 69/100
谷歌发布首个原生多模态嵌入模型Gemini Embedding 2Last week, we made Gemini Embedding 2, our first natively multimodal embedding model, available to the general public. Since then, developers have used it to build video analysis tools, visual shopping assistants, and more.But you might be wondering... what is an embedding model? 🤔 Let’s break it down!1. What is it? Think of an embedding model as a "universal translator." It takes text, images, video, and audio data and turns them into a long string of numbers, like a unique digital fingerprint.2. How does it work? Historically, search has been text only. Now, instead of just matching data by keyword, Gemini Embedding 2 maps multiple modalities in the same space based on meaning. It "feels" the connection between a video of a soccer goal and the words "game-winning shot" without needing tags.For example, "ocean" and "waves" are placed close together, but "ocean" and "toaster" are miles apart.3. How can you use it? Developers have been using it to incorporate smarter search functionality into their builds. This means creating tools where you can snap a photo of a product and type "find this in yellow," or search through thousands of hours of video by describing what happens in a scene.4. Ready to try it out for yourself? You can start using it today via the Gemini API or the Gemini Enterprise Agent Platform.谷歌上周正式向公众发布了其首个原生多模态嵌入模型Gemini Embedding 2。该模型如同"通用翻译器",能将文本、图像、视频和音频数据转化为独特的数字向量。其核心突破在于不再依赖关键词匹配,而是基于语义将不同模态的数据映射到同一空间,从而理解内容间的深层联系。开发者已利用该模型构建视频分析工具、视觉购物助手等应用,实现通过拍照或描述场景进行智能搜索的功能。模型现可通过Gemini API或Gemini Enterprise Agent平台使用。

推荐理由:Google 第一个原生多模态嵌入模型,把文本、图像、视频拉到同一个向量空间,做跨模态搜索的开发者可以不用再手动打标签了,但离「无感理解」还有距离。

4月30日

星期四 · 4 条
08:37
阿绎 AYi@AYi_AInotes精选
AI 评分 70/100
Google Gemini实现AI"交付时代"跨越,直接生成可下载办公文件Google的AI大模型终于有点像样的的更新更新,这波直接让不少靠AI生成文档的初创公司感受到巨大压力🤯👀Gemini现在可以在聊天里直接生成Docs、Sheets、Slides、PDF、Word、Excel等主流办公文件, 一句话prompt就能下载, 完全不用复制粘贴、不用手动排版、不用调格式。支持的范围非常实用:包括带LaTeX公式的学术文档、表格、图表等。 
最震撼的是官方演示——
上传两张手写的潦草笔记,说一句“转成带图表的统计学学习指南PDF”, 几秒钟后,一个标题、目录、公式、表格、视觉元素全都专业排版的完整文档就生成了,直接就能下载。而且这个功能免费给全球所有Gemini App用户开放,没有Pro门槛,没有地区限制,任何人现在打开手机就能用。以前的AI,本质上还是聊天机器人:它输出的是文字,你还得自己花时间加工成能交付的东西。 
从这波更新开始,AI输出的不再只是文字,而是可以直接交付的生产力资产——它从“陪你聊天的助手”,升级成了“直接替你干活的员工”。Google最狠的地方,其实不是模型技术本身,而是把过去二十年积累的Workspace生态,直接变成了Gemini的原生输出底座。 
别人还在卷“谁生成的文字更通顺”,Google直接卷“谁的输出能直接发给老板或客户”。 
那些靠AI生成PPT、PDF、表格吃饭的工具,今天起就从“必备”变成了“可选中间层”,商业模式不得不重新思考。 这才是真正的降维打击。我理解AI的下一个战场,已经从“谁更会聊天”,彻底转向“谁能直接产出可交付的成果”。 
而Google,借着Workspace的深度集成,先手拉开了一大截领先优势。对普通用户来说:以后写报告、做PPT、整理笔记,再也不用半夜改格式了,生产力直接起飞。 
对行业来说:这标志着AI从“对话时代”正式进入“交付时代”。Google Gemini迎来重磅更新,用户现可在聊天中通过一句话指令,直接生成并下载Docs、Sheets、Slides、PDF等主流办公文件,无需手动复制排版。该功能支持含LaTeX公式的学术文档、表格和图表,且免费向全球Gemini App用户开放。这标志着AI从输出文字的"对话时代",迈向了直接产出可交付生产力资产的"交付时代"。Google凭借与Workspace生态的深度集成,实现了降维打击,对依赖AI生成文档的初创公司构成巨大压力,并推动行业竞争焦点转向直接产出可用成果。

Sundar Pichai: You can now ask Gemini to create Docs, Sheets, Slides, PDFs, and more directly in your chat. No more copying, pasting, o...


推荐理由:Gemini原生生成文档这功能,不是简单的“能出Word”,而是把二十年Workspace生态变成AI的输出管道,那些靠格式转换吃饭的中间商要慌了。
06:20
Google Research:Blog(网页)精选
AI 评分 57/100
谷歌研究团队应用实证研究辅助工具的四个领域

自去年秋季推出实证研究辅助(ERA)工具以来,谷歌研究团队已将其应用于多个科学领域以解决实际问题。在流行病学中,它助力流感与新冠预测;在宇宙学里,协助分析星系数据以探究暗能量;在大气监测方面,提升了二氧化碳排放的追踪精度;在神经科学领域,则用于解析大脑活动数据。这些实践表明,ERA能帮助科学家生成专家级的实证软件,其成果超越了黑箱模型,可发现兼具可解释性与机制准确性的解决方案,从而有效加速科学发现进程。


推荐理由:Google 把自家 ERA 工具在流行病学、宇宙学、气候监测、神经科学四个方向的实战案例摊开讲,虽然不是新模型发布,但对做 AI for Science 的人来说,这是一份难得的「AI 科研助手到底能干嘛」的全景参考。
00:39
Google Developers Blog(RSS)精选
AI 评分 57/100
加速AI:通过GCSFS和Rapid Bucket将Google Colossus引入PyTorch

Google Cloud推出了一项高性能集成方案,通过fsspec接口将Rapid Storage直接连接至PyTorch,以消除AI训练瓶颈。该方案利用Google的Colossus架构和双向gRPC流技术,可提供高达15 TiB/s的聚合吞吐量,并显著降低延迟。开发者仅需更新存储桶类型而无需修改代码,即可将总训练时间缩短23%。


推荐理由:Google 把自家 Colossus 存储架构直接接进 PyTorch,号称零代码改动提速 23%,做大规模训练的团队值得评估一下,但对大多数人来说这更像 GCP 的护城河加固。

4月28日

星期二 · 1 条
19:06
Chubby♨️@kimmonismus精选
AI 评分 70/100
谷歌与五角大楼签署AI协议,允许其模型用于机密军事目的Google just signed a deal letting the Pentagon use its AI models for classified work and "any lawful government purpose." This comes despite over 600 employees urging CEO Sundar Pichai to reject the agreement, and marks a dramatic reversal from 2018 when Google pulled out of Project Maven after employee backlash.Google now joins xAI and OpenAI in having classified Pentagon AI deals, with terms that appear even more permissive than OpenAI's.The contract includes language saying Google's AI "is not intended for" mass surveillance or autonomous weapons without human oversight, but legal experts say this wording is not legally binding.Notably, the deal also requires Google to adjust its AI safety filters at the government's request. This all follows Anthropic's public refusal to drop its red lines on those exact use cases, which led to the Pentagon declaring Anthropic a supply chain risk, a designation Anthropic is currently fighting in court.谷歌已与五角大楼签署协议,允许其AI模型用于机密工作及"任何合法的政府目的",此举无视了超600名员工的反对,并逆转了其2018年因员工抗议退出Project Maven的立场。协议条款看似比OpenAI的同类合约更为宽松,虽声明AI"不拟用于"大规模监控或无人监督的自主武器,但法律专家指出该措辞缺乏约束力。协议还要求谷歌应政府要求调整AI安全过滤器。这与Anthropic因拒绝在类似用途上妥协而被五角大楼列为供应链风险形成对比。

推荐理由:Google 从 2018 年 Project Maven 退缩到今天主动签军方合同,这个 180 度转弯比合同本身更值得关注。做 AI 安全和政策的人该重新评估各家的底线到底在哪。

4月27日

星期一 · 1 条
15:21
Google DeepMind:Blog(RSS)精选
AI 评分 56/100
宣布我们与大韩民国的合作伙伴关系

Google DeepMind 与韩国政府建立合作伙伴关系,旨在利用前沿AI模型加速科学突破。此次合作将聚焦于将如Gemini、Claude、GPT-4等大型语言模型以及AlphaFold等科学AI工具,应用于关键研究领域,特别是生物技术和材料科学。目标是提升韩国的AI研发能力,计划在未来五年内培养超过1000名AI专家,并支持10个以上由AI驱动的大型科研项目。


推荐理由:韩国政府和 DeepMind 的合作意向,信号意义大于实质内容,目前没有具体项目披露,做 AI 地缘分析的可以留意,其他人可以先跳过。

4月25日

星期六 · 2 条
08:14
IT之家(RSS)精选
AI 评分 73/100
既合作又竞争,谷歌拟向 Anthropic 投资至高 400 亿美元

谷歌宣布向人工智能公司Anthropic投资100亿美元,对应估值达3500亿美元,未来若达成业绩目标可能追加投资至总计400亿美元。作为交易的一部分,Anthropic将获得谷歌云提供的5吉瓦算力支持。双方关系密切,Anthropic是谷歌云服务的重要客户,但竞争也日益凸显,两者均致力于开发接近人类的AI工具并争夺企业市场。此次投资进一步深化了双方既合作又竞争的复杂关系。

另有 1 家信源报道Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:谷歌对Anthropic的400亿投资表明AI竞赛已进入巨头站队和算力军备阶段,Claude Code的爆红是直接催化剂,但合作背后的竞争也愈发微妙。
06:42
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
谷歌计划向Anthropic投资高达400亿美元

谷歌计划向人工智能初创公司Anthropic投资高达400亿美元。此次大规模投资旨在深化谷歌在AI领域的布局,以应对与OpenAI等竞争对手的激烈市场争夺。该投资金额巨大,凸显了科技巨头对生成式AI技术未来前景的高度重视与资源投入。

另有 2 家信源报道X:Kim (@kimmonismus)Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:400亿美元的押注远超之前的任何 AI 投资,这是谷歌在 OpenAI 之后下的最大赌注,AI 军备竞赛的边界将被彻底改写。

4月23日

星期四 · 1 条
09:08
IT之家(RSS)精选
AI 评分 74/100
谷歌确认基于 Gemini AI 的苹果新版 Siri 今年亮相

谷歌云首席执行官在谷歌Cloud Next 26大会上确认,基于Gemini AI技术构建的新一代苹果Siri将于2026年发布。双方合作源于2026年1月签署的多年期协议,谷歌作为首选云服务商提供核心技术支持。该交易年价值约10亿美元,协议严格限制谷歌接触用户数据以保障隐私。技术层面,苹果正通过知识蒸馏将大型Gemini模型精简为可在iPhone等设备端运行的版本,旨在降低云端依赖并提升响应速度。


推荐理由:苹果终于把 Siri 大脑换成了 Gemini,每年 10 亿美金的合作不是小打小闹,这代 Siri 可能真的会变聪明。但落地得等一年,做端侧部署的可以盯一下苹果的蒸馏方案。