Google DeepMind:Blog(RSS)
精选
83AI 编辑部评分,满分 100

推出Gemini Omni多模态AI模型

2026-05-18 03:50· 91天前
AI 导读

谷歌推出原生多模态AI模型Gemini Omni,能够整合视频、图像、音频和文本等多种输入,生成高质量视频内容。其核心能力是通过自然语言对话进行视频编辑,并能保持角色一致性、物理规律与场景连贯性。首个模型Gemini Omni Flash已上线,未来将支持图像和音频输出。Gemini Omni结合了对物理世界的直觉理解与丰富的知识库,支持从写实到叙事的创意生成,并可通过多轮对话持续编辑视频,而不丢失原始场景上下文。

推荐理由

Gemini Omni 把视频生成从画面堆砌推到了物理世界叙事,多轮自然语言编辑和世界知识融合是真正的代际升级,做视频内容的该重新理解工具的定义了。

正文 · AI 翻译

Gemini Omni Flash 是一款能够从任意输入内容生成任意输出内容的模型——首先从视频开始。



去年,Nano Banana 将 Gemini 的智能引入了图像生成与编辑领域。自那以后,它已帮助数百万用户修复老照片、根据草图进行设计,并以前所未有的方式将想法可视化。从一开始,我们就把 Gemini 构建为原生多模态模型,而现在我们正迈出下一步。

我们正在推出 Gemini Omni,它将 Gemini 的推理能力与创作能力融为一体。Omni 是我们的新模型,能够从任意输入内容生成任意输出内容——首先从视频开始。借助 Omni,你可以将图像、音频、视频和文本作为输入组合在一起,并生成基于 Gemini 真实世界知识的高质量视频。你还可以通过对话轻松编辑视频。

今天,我们正在向 Gemini 应用、Google Flow 和 YouTube Shorts 推出 Omni 系列的首个模型:Gemini Omni Flash。未来,我们将支持图像和音频等输出模态。以下是 Omni 的一些独特之处:

通过对话编辑你的视频

Gemini Omni 为你提供了一种更简单的视频编辑方式——使用自然语言。每一条指令都基于上一条指令构建。你的角色保持一致性,物理效果保持稳定,场景也会记住之前发生的一切。

改变你周围的世界。修改特定事物,或者改变一切。你的视频成为起点,创造出你永远无法亲自拍摄的内容。

提示词:用气泡制作这座雕塑。

重新构想动作。拍摄一段视频,然后只需让 Omni 改变其中发生的事情。编辑动作,添加新角色或物体,或者将一个瞬间转变为意想不到的东西。

提示词:当人触摸镜子时,让镜子像液体一样美丽地泛起涟漪,并且人的手臂变成反光的镜面材质。

提示词:调暗房间里的灯光。在一个玻璃球内放置一个黑白棋盘格房间,玻璃球悬浮在手上方并跟随手部移动,球内包含同一只手托着玻璃球的递归呈现,从而形成无限递归的房间。摄像机缓慢靠近玻璃球,形成一个循环视频。

提示词:公寓的灯光随着音乐同步亮起。

通过多轮交互来精修你的视频。改变环境、角度、风格甚至具体细节,同时始终保留原始场景的脉络。滑动轮播图,看看每次编辑是如何层层递进的。

提示词:一位小提琴手演奏乐曲的视频。

提示词:将小提琴手转移到图片所示的环境中。

提示词:让小提琴隐形。

提示词:将摄像机角度切换到小提琴手的肩膀上方。

基于 Gemini 的世界知识,将创意变为现实。

Gemini Omni 不仅能构建看起来真实的场景,还能推理接下来应该发生什么。它将直观的物理理解与 Gemini 在历史、科学和文化背景方面的知识相结合,弥合了从照片级真实感到有意义的故事叙述之间的鸿沟。

创建物理效果更准确的视觉内容。Omni 对重力、动能和流体动力学等力的直观理解得到了改进,让你能够创建更逼真的场景。

提示词:一颗弹珠在链式反应风格的轨道上快速滚动,连续平滑镜头。

融合知识与创造力。Omni 利用 Gemini 的知识,以远超模式匹配的方式将语言、图像和意义连接起来。

提示词:视频展示字母表中的物品。桌上依次展示每个字母开头的奇特物品(例如 C 代表水豚,D 代表迪斯科球,L 代表熔岩灯)。全部 26 个字母必须由 26 个物品表示,并配有匹配的底部字幕条显示该字母。每次只显示一个物品和其底部字幕条。每个底部字幕条看起来必须像用黑色记号笔写在左下角的一张纸条上。快速切换,大约每 24 帧显示 9 帧一个物品。最后一帧是一张写着“THE END”的纸条。整个视频伴有平静舒缓的音乐。

将复杂想法可视化。Omni 可以根据简短的提示词创建引人入胜的解说视频,生成分解更复杂概念的视觉内容。

提示词:关于蛋白质折叠的黏土动画解说,所有东西都由黏土制成,没有手,定格动画,准确。

从任意输入组合创建视频。

引用任何内容。Omni 能将任何参考内容——图像、文本、视频或音频——转化为一个统一的、连贯的输出。虽然音频输入最初仅支持语音参考,但我们很快将推出其他类型的音频输入。

提示词:基于 image_0.png 制作动态科幻电影风格视频。元素发光效果类似于 video_0.mp4,并与 audio_0.wav 的音乐节拍同步。

提示词:参考 video-0 中的极端镜头运动、视角和畸变效果,为 image-0 中的角色创建一个正面全身行走循环动画,在行走过程中快速切换多种视觉风格,从写实电影风格开始。保持环境不变,仅改变风格。硬切背景时始终以天空为中心。持续行走、持续音频,风格切换与音频节拍完美同步。电影感,16:9 画幅。

提示词:当我触碰每一片蕨叶时,添加与之同步的竖琴声。将所有叶片结构改为类似半透明 3D 生物发光植物的形态,周围有生物发光的萤火虫飞舞,在我演奏时它们会做出反应,与声音同步。添加微妙的散景景深动态光照,光线在房间墙壁上反射,保持房间结构不变。

从你已有的内容开始。借助输入参考,你可以使用角色、场景或画作的图像,以符合你构想的方式进行创作。

提示词:想象当我行走时,世界逐渐转变为复古未来主义风格(颗粒感且情绪化,如同 image-1)。使用该音频作为复古未来主义的背景音乐。时长 10 秒。

提示词:将其转化为写实影像,仅将画作作为动作的参考指导,最终视频中不要显示画作。

提示词:将输入视频中的姿态和动作应用到这张图像中提供的角色上。将图像参考中的风格应用到新视频中。

应用风格、动作或效果。通过使用输入参考来定义视觉语言,或者直接用自然语言描述。Omni 融合输入参考,以创建一个连贯的片段。

提示词:进行编辑,保持其他一切不变。添加从滑板中发出的动态运动效果。

提示词:将提供的视频中鲸鱼游动的动态,应用到提供的流体反光材质图像上。不要显示鲸鱼或水;而是让这种反光流动材质在游动过程中形成类似鲸鱼的形状。用水面白色光滑材质形状替换水。

使用你自己的数字形象创建视频

我们致力于负责任地开发人工智能,并制定了明确的政策来保护用户免受伤害,同时规范我们 AI 工具的使用。首先,你可以通过使用“形象”功能,用你自己的声音创建视频,该功能会生成一个你的数字版本,让你能够制作出看起来和听起来都像你的视频。除了形象功能之外,在通过编辑视频来更改音频和语音方面,我们仍在进行测试,并进一步了解如何负责任地将这项能力带给用户。

所有使用 Omni 创建的视频都包含我们不可察觉的 SynthID 数字水印。你可以通过 Gemini 应用、Chrome 中的 Gemini 以及 Google 搜索,轻松验证视频是否由 Gemini Omni 生成。你可以在我们的博客文章中了解更多关于我们如何扩展内容透明度和验证工具的信息,这些工具旨在帮助你了解网络上的内容是如何被创建和编辑的。

立即试用 Gemini Omni

今天,我们推出了 Omni 系列的首个模型——Gemini Omni Flash。Gemini Omni Flash 即日起通过 Gemini 应用和 Google Flow 向全球所有 Google AI Plus、Pro 和 Ultra 订阅用户开放。从本周开始,它也将免费向 YouTube Shorts 和 YouTube Create 应用的用户推出。

未来几周,我们还将通过 API 向开发者和企业客户推出。

合集

I/O 2026

以下是我们在 Google I/O 2026 上宣布的所有内容概览。

来源:Google DeepMind:Blog(RSS) · deepmind.google

事件后续 · 20查看事件全部 →

推出Gemini Omni多模态AI模型

Google DeepMind:Blog(RSS)·2026-05-18 03:50·91天前
AI 导读

谷歌推出原生多模态AI模型Gemini Omni,能够整合视频、图像、音频和文本等多种输入,生成高质量视频内容。其核心能力是通过自然语言对话进行视频编辑,并能保持角色一致性、物理规律与场景连贯性。首个模型Gemini Omni Flash已上线,未来将支持图像和音频输出。Gemini Omni结合了对物理世界的直觉理解与丰富的知识库,支持从写实到叙事的创意生成,并可通过多轮对话持续编辑视频,而不丢失原始场景上下文。

正文 · AI 翻译

Gemini Omni Flash 是一款能够从任意输入内容生成任意输出内容的模型——首先从视频开始。



去年,Nano Banana 将 Gemini 的智能引入了图像生成与编辑领域。自那以后,它已帮助数百万用户修复老照片、根据草图进行设计,并以前所未有的方式将想法可视化。从一开始,我们就把 Gemini 构建为原生多模态模型,而现在我们正迈出下一步。

我们正在推出 Gemini Omni,它将 Gemini 的推理能力与创作能力融为一体。Omni 是我们的新模型,能够从任意输入内容生成任意输出内容——首先从视频开始。借助 Omni,你可以将图像、音频、视频和文本作为输入组合在一起,并生成基于 Gemini 真实世界知识的高质量视频。你还可以通过对话轻松编辑视频。

今天,我们正在向 Gemini 应用、Google Flow 和 YouTube Shorts 推出 Omni 系列的首个模型:Gemini Omni Flash。未来,我们将支持图像和音频等输出模态。以下是 Omni 的一些独特之处:

通过对话编辑你的视频

Gemini Omni 为你提供了一种更简单的视频编辑方式——使用自然语言。每一条指令都基于上一条指令构建。你的角色保持一致性,物理效果保持稳定,场景也会记住之前发生的一切。

改变你周围的世界。修改特定事物,或者改变一切。你的视频成为起点,创造出你永远无法亲自拍摄的内容。

提示词:用气泡制作这座雕塑。

重新构想动作。拍摄一段视频,然后只需让 Omni 改变其中发生的事情。编辑动作,添加新角色或物体,或者将一个瞬间转变为意想不到的东西。

提示词:当人触摸镜子时,让镜子像液体一样美丽地泛起涟漪,并且人的手臂变成反光的镜面材质。

提示词:调暗房间里的灯光。在一个玻璃球内放置一个黑白棋盘格房间,玻璃球悬浮在手上方并跟随手部移动,球内包含同一只手托着玻璃球的递归呈现,从而形成无限递归的房间。摄像机缓慢靠近玻璃球,形成一个循环视频。

提示词:公寓的灯光随着音乐同步亮起。

通过多轮交互来精修你的视频。改变环境、角度、风格甚至具体细节,同时始终保留原始场景的脉络。滑动轮播图,看看每次编辑是如何层层递进的。

提示词:一位小提琴手演奏乐曲的视频。

提示词:将小提琴手转移到图片所示的环境中。

提示词:让小提琴隐形。

提示词:将摄像机角度切换到小提琴手的肩膀上方。

基于 Gemini 的世界知识,将创意变为现实。

Gemini Omni 不仅能构建看起来真实的场景,还能推理接下来应该发生什么。它将直观的物理理解与 Gemini 在历史、科学和文化背景方面的知识相结合,弥合了从照片级真实感到有意义的故事叙述之间的鸿沟。

创建物理效果更准确的视觉内容。Omni 对重力、动能和流体动力学等力的直观理解得到了改进,让你能够创建更逼真的场景。

提示词:一颗弹珠在链式反应风格的轨道上快速滚动,连续平滑镜头。

融合知识与创造力。Omni 利用 Gemini 的知识,以远超模式匹配的方式将语言、图像和意义连接起来。

提示词:视频展示字母表中的物品。桌上依次展示每个字母开头的奇特物品(例如 C 代表水豚,D 代表迪斯科球,L 代表熔岩灯)。全部 26 个字母必须由 26 个物品表示,并配有匹配的底部字幕条显示该字母。每次只显示一个物品和其底部字幕条。每个底部字幕条看起来必须像用黑色记号笔写在左下角的一张纸条上。快速切换,大约每 24 帧显示 9 帧一个物品。最后一帧是一张写着“THE END”的纸条。整个视频伴有平静舒缓的音乐。

将复杂想法可视化。Omni 可以根据简短的提示词创建引人入胜的解说视频,生成分解更复杂概念的视觉内容。

提示词:关于蛋白质折叠的黏土动画解说,所有东西都由黏土制成,没有手,定格动画,准确。

从任意输入组合创建视频。

引用任何内容。Omni 能将任何参考内容——图像、文本、视频或音频——转化为一个统一的、连贯的输出。虽然音频输入最初仅支持语音参考,但我们很快将推出其他类型的音频输入。

提示词:基于 image_0.png 制作动态科幻电影风格视频。元素发光效果类似于 video_0.mp4,并与 audio_0.wav 的音乐节拍同步。

提示词:参考 video-0 中的极端镜头运动、视角和畸变效果,为 image-0 中的角色创建一个正面全身行走循环动画,在行走过程中快速切换多种视觉风格,从写实电影风格开始。保持环境不变,仅改变风格。硬切背景时始终以天空为中心。持续行走、持续音频,风格切换与音频节拍完美同步。电影感,16:9 画幅。

提示词:当我触碰每一片蕨叶时,添加与之同步的竖琴声。将所有叶片结构改为类似半透明 3D 生物发光植物的形态,周围有生物发光的萤火虫飞舞,在我演奏时它们会做出反应,与声音同步。添加微妙的散景景深动态光照,光线在房间墙壁上反射,保持房间结构不变。

从你已有的内容开始。借助输入参考,你可以使用角色、场景或画作的图像,以符合你构想的方式进行创作。

提示词:想象当我行走时,世界逐渐转变为复古未来主义风格(颗粒感且情绪化,如同 image-1)。使用该音频作为复古未来主义的背景音乐。时长 10 秒。

提示词:将其转化为写实影像,仅将画作作为动作的参考指导,最终视频中不要显示画作。

提示词:将输入视频中的姿态和动作应用到这张图像中提供的角色上。将图像参考中的风格应用到新视频中。

应用风格、动作或效果。通过使用输入参考来定义视觉语言,或者直接用自然语言描述。Omni 融合输入参考,以创建一个连贯的片段。

提示词:进行编辑,保持其他一切不变。添加从滑板中发出的动态运动效果。

提示词:将提供的视频中鲸鱼游动的动态,应用到提供的流体反光材质图像上。不要显示鲸鱼或水;而是让这种反光流动材质在游动过程中形成类似鲸鱼的形状。用水面白色光滑材质形状替换水。

使用你自己的数字形象创建视频

我们致力于负责任地开发人工智能,并制定了明确的政策来保护用户免受伤害,同时规范我们 AI 工具的使用。首先,你可以通过使用“形象”功能,用你自己的声音创建视频,该功能会生成一个你的数字版本,让你能够制作出看起来和听起来都像你的视频。除了形象功能之外,在通过编辑视频来更改音频和语音方面,我们仍在进行测试,并进一步了解如何负责任地将这项能力带给用户。

所有使用 Omni 创建的视频都包含我们不可察觉的 SynthID 数字水印。你可以通过 Gemini 应用、Chrome 中的 Gemini 以及 Google 搜索,轻松验证视频是否由 Gemini Omni 生成。你可以在我们的博客文章中了解更多关于我们如何扩展内容透明度和验证工具的信息,这些工具旨在帮助你了解网络上的内容是如何被创建和编辑的。

立即试用 Gemini Omni

今天,我们推出了 Omni 系列的首个模型——Gemini Omni Flash。Gemini Omni Flash 即日起通过 Gemini 应用和 Google Flow 向全球所有 Google AI Plus、Pro 和 Ultra 订阅用户开放。从本周开始,它也将免费向 YouTube Shorts 和 YouTube Create 应用的用户推出。

未来几周,我们还将通过 API 向开发者和企业客户推出。

合集

I/O 2026

以下是我们在 Google I/O 2026 上宣布的所有内容概览。

来源:Google DeepMind:Blog(RSS)· deepmind.google

事件后续 · 20查看事件全部 →