构建通用 AI 助手的愿景

Google DeepMind:Blog(RSS)·2025-05-20 17:45·466天前·Demis Hassabis
AI 导读

Google 计划将 Gemini 扩展为世界模型,使其能够通过模拟世界来制定计划和想象新体验,从而实现通用 AI 助手的愿景。

Google DeepMind:Blog(RSS)
精选

构建通用 AI 助手的愿景

2025-05-20 17:45· 466天前· Demis Hassabis
AI 导读

Google 计划将 Gemini 扩展为世界模型,使其能够通过模拟世界来制定计划和想象新体验,从而实现通用 AI 助手的愿景。

推荐理由

DeepMind官方阐述Gemini世界模型愿景,揭示通用AI助手演进新方向

正文 · AI 翻译

我们正在将 Gemini 扩展为一个世界模型,使其能够通过模拟世界的各个方面来制定计划并想象新的体验。

过去十年间,我们为现代人工智能时代奠定了大量基础,从开创所有大语言模型所依赖的 Transformer 架构,到开发能够像 AlphaGo 和 AlphaZero 一样学习和规划的智能体系统。

我们将这些技术应用于量子计算、数学、生命科学和算法发现领域,并取得了突破。同时,我们继续深化基础研究的广度与深度,致力于为通用人工智能(AGI)所需的下一项重大突破进行发明创造。

正因如此,我们正致力于将我们最优秀的多模态基础模型 Gemini 2.5 Pro 扩展为一个“世界模型”,使其能够像大脑一样,通过理解和模拟世界的各个方面来制定计划并想象新的体验。

我们朝着这个方向已经努力了一段时间,从开创性地训练智能体掌握围棋和星际争霸等复杂游戏,到构建能够根据单张图像提示生成可交互的 3D 模拟环境的 Genie 2。

我们已经可以看到这些能力正在显现的证据:Gemini 利用世界知识和推理来表征与模拟自然环境的能力;Veo 对直觉物理学的深刻理解;以及 Gemini Robotics 教导机器人抓取物体、遵循指令并即时调整的方式。

将 Gemini 打造成一个世界模型,是开发一种更通用、更有用的新型人工智能——通用 AI 助手——的关键一步。这是一种智能的 AI,能够理解你所处的上下文,并能代表你在任何设备上进行规划和采取行动。

将 Project Astra 的实时能力引入我们的产品

我们的最终愿景是将 Gemini 应用转变为一个通用 AI 助手,它将为我们执行日常任务、处理琐碎行政事务并呈现令人愉悦的新推荐——从而提升我们的生产力,丰富我们的生活。

这一切始于我们去年在研究原型项目 Astra 中首次探索的能力,例如视频理解、屏幕共享和记忆功能。

过去一年里,我们一直在将此类能力整合到 Gemini Live 中,让更多人今天就能体验。我们持续不懈地改进,并在前沿领域探索新的创新。例如,我们升级了语音输出,通过原生音频使其更加自然;改进了记忆功能;并增加了计算机控制能力。

我们现在正从受信任的测试者那里收集关于这些能力的反馈,并致力于将它们引入 Gemini Live、搜索中的新体验、面向开发者的 Live API,以及眼镜等新形态设备。

在这一过程的每一步,安全与责任都是我们工作的核心。我们最近开展了一项大型研究项目,探讨先进 AI 助手相关的伦理问题,这项工作持续为我们的研究、开发和部署提供指导。

构建能为你多任务处理的 AI

我们还通过 Project Mariner 探索智能体能力如何帮助人们进行多任务处理。这是一个研究原型,从浏览器入手,探索人机交互的未来。

自去年十二月推出 Project Mariner 以来,我们一直与一组受信任的测试者密切合作,收集反馈并改进其实验性能力。

Project Mariner 现在包含一个智能体系统,可以同时完成多达十项不同的任务。这些智能体可以帮助你查找信息、预订、购物、做研究等等——所有这些都能同时进行。

更新后的 Project Mariner 已面向美国的 Google AI Ultra 订阅用户开放。我们正在将其计算机使用能力引入 Gemini API,并计划在今年内将其更多能力带到 Google 产品中。在搜索和 Gemini 应用中,了解更多关于我们智能体能力的信息。

凭借这一点以及我们所有开创性的工作,我们正在构建更加个性化、主动且强大的 AI,以丰富我们的生活,加速科学进步的节奏,并开启一个发现与奇迹的新黄金时代。

来源:Google DeepMind:Blog(RSS)· deepmind.google