Gemini Omni 1.1 Flash 发布,为开发者提供更强生成式视频控制

Google DeepMind:Blog(RSS)·2026-08-28 00:11·9分钟前
AI 导读

Google 推出 Gemini Omni 1.1 Flash,为开发者提供更强的生成式视频控制能力。新模型支持场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量累计延长至 40 秒)、指定首尾帧生成平滑过渡,以及 4K 高清输出。

Google DeepMind:Blog(RSS)
精选
70AI 编辑部评分,满分 100

Gemini Omni 1.1 Flash 发布,为开发者提供更强生成式视频控制

2026-08-28 00:11· 9分钟前
AI 导读

Google 推出 Gemini Omni 1.1 Flash,为开发者提供更强的生成式视频控制能力。新模型支持场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量累计延长至 40 秒)、指定首尾帧生成平滑过渡,以及 4K 高清输出。

推荐理由

360p 预览的成本降到 720p 的三分之一并提速最多 60%,让视频生成的前期探索可以低成本多版本比较,改变的是创意工具迭代的节奏。

正文 · AI 翻译

Omni 现在可提供工作室级视频制作能力,包括场景延展、首尾帧插值、清晰的 4K 画质增强、更快的原型制作,以及更多功能。


Anish Nangia

Alisa Fortin


Image 1: Text "Gemini Omni 1.1 Flash Available via APIs" surrounded by various images of people and a squirrel

我们正式推出 Gemini Omni 1.1 Flash,这是一款面向开发者的生产就绪更新,为生成式视频提供更强的控制能力。现在您可以延展场景、指定起始帧和结束帧以实现平滑过渡,并生成高分辨率 4K 输出。立即通过 Google AI Studio 或 Gemini Enterprise Agent Platform 访问该模型,开始构建。

  • “Gemini Omni 1.1 Flash”为开发者提供了对生成式视频项目更强的控制能力。
  • 将场景延展至最长 40 秒,并提升视觉一致性与叙事流畅度。
  • 设置起始帧和结束帧,打造平滑、专业的镜头运动与转场效果。
  • 使用 360p 预览,在创作过程中更快迭代并节省成本。
  • 将最终项目提升至 4K 分辨率,呈现精致、专业的视觉效果。

Google 刚刚发布了 Gemini Omni 1.1 Flash,为开发者提供了更强大的 AI 视频创建与编辑工具。它可以延展视频片段、控制镜头运动,并制作高质量的 4K 画面。开发者还可以快速生成低分辨率草稿,以更低成本、更快速度测试创意。对于任何正在构建创意视频软件的人来说,这都是向前迈出的一大步。

探索其他风格:

今天,我们推出 Gemini Omni 1.1 Flash,这是一套全新的创意控制与生成式视频能力,旨在支持开发者。Gemini Omni 将真实世界推理引入生成式创作,而今天的更新使 Omni 1.1 达到生产就绪水平,可通过 Google AI Studio 中的 Gemini API 用于专业场景。

无论您是在构建生成式视频工作流、创意工具,还是媒体编辑软件,这些更新都能让生成式视频更可控、迭代更快,并打磨至适合真实部署的水准。以下是新增功能的概览:

延展场景,讲述更长的故事

场景延展功能允许您基于现有视频,从其结束位置无缝继续生成画面。

借助 Omni 1.1,模型现在可以分析长达 10 秒的先前上下文——相比此前仅参考最后一秒的模型,这是一次巨大飞跃。其结果是视觉一致性和叙事连贯性显著提升,让你能够构建更长的故事,或开辟新的创作方向。你可以按 10 秒的增量扩展视频,累计总时长最长可达 40 秒。

提示词 1:镜头轻微平移,现在我们看到她正在与一位卷发男子交谈,我们看到男子的背影,他说“我也看到了”,戏剧性配乐响起。

提示词 2:镜头缓缓拉远,被遗忘的布满灰尘的地下墓穴,戏剧性配乐。

提示词 3:镜头缓缓拉远,一座巨大的图书馆,书架和书籍在布满尘埃的虚空中失重漂浮,戏剧性配乐。

提示词 1:继续视频。执行电影级的轨道变焦镜头。摄像机向前推进的同时同步拉远变焦,将角色震惊呆滞的面部表情锁定在完全相同的尺寸。背景中由石柱构成的长廊在强烈的光学透视畸变下戏剧性地拉伸、加深。简洁的建筑结构,连续不间断的镜头。

提示词 2:继续视频。摄像机执行一次快速的机械式瞬间变焦,直接切入角色睁大的双眼。风格化的电影级镜头控制。

提示词 3:继续视频。时间完全冻结成一个静止的瞬间:角色及其被风吹起的衣摆。摄像机围绕冻结的角色进行平滑、高速的 360 度环绕旋转,在柱廊间展现出戏剧性的 3D 深度和视差。完美无瑕的连贯性。

提示词 1:穿蓝色毛衣的男子回答:“你父亲也坐那条船出海了吗?”

提示词 2:摄像机以一个连续的运动向后拉远,他继续讲述他的故事:“他过去常说,这个港口有灵魂。而那些船是我们生命的一部分。”音乐渐强。

提示词 1:他直视镜头,谈论最后一章将以什么作为结局!

提示词 2:然后他站起来,绕过桌子走向摄像机,说“你会怎么选?”

以下是通过 Gemini API 扩展场景的方法:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
    previous_interaction_id=previous_video_interaction.id,
    input=[
        {"type": "text", "text": "Continue the scene."}
    ],
    response_format={
        "resolution": "360p",
    },
)

指定首帧和末帧

通过指定镜头的起始帧和结束帧,实现平滑的转场和运镜效果。Omni 1.1 可在两个关键帧之间生成连续视频,非常适合复杂的环绕运镜、变焦转场或无缝循环片段。

提示词 1:一位身着米色西装、时尚帅气的鼓手在宏伟的大厅中演奏红色架子鼓,镜头从低角度特写开始,随后快速横摇至侧面,展现出一位年长的萨克斯手,正与一位身着白衣、在柔和紫色舞台灯光下旋转的芭蕾舞者一同演奏。全程一个连续镜头,无跳切。

提示词 2:镜头推近电视屏幕,我们看到开头出现的同一位女性以及同一个场景。视频无缝衔接。全程一个连续镜头,无跳切。

以 360p 分辨率更高效地草拟视频

生成 360p 分辨率的轻量预览,速度最高可提升 60%*,成本仅为 Omni 1.1 标准 720p 分辨率的三分之一。这对于快速原型制作、分镜迭代以及开发者平台中的快速渲染非常有用。

*基于 360p 与 720p 分辨率的系统吞吐量对比,生成速度最高可提升 60%。

提示词:微观视角下的虹彩海洋硅藻,展现出精致如玻璃般的二氧化硅外壳,具有令人惊叹的自然对称之美。色彩从深沉的火山琥珀色、暖铜色,到鲜艳的绿松石色和紫色,仿若大地与海洋的丰富色调。微小而精巧的结构在干净的深色背景中柔和发光。高保真科学成像,细节锐利,质感自然,显微摄影。全程保持显微镜镜头效果。

最高提升至 4K 分辨率

使用 Omni 1.1 生成精良的高分辨率 1080p 或 4K 输出,可直接用于专业制作。

提示词 1:鱼群游动,跟拍镜头

提示词 2:一只小花栗鼠从屏幕左侧的树林中窜出,好奇地嗅了嗅空气,然后从右侧窜出画面。

提示词 3:电影级微距特写,一株纤细枝条上生机勃勃的金橙色日本枫叶,在柔和而有韵律的秋风中轻轻沙沙作响、摇曳生姿。阳光透过半透明的叶片洒落,营造出温暖发光的效果。浅景深,梦幻般的散景背景,超精细纹理,照片级真实感,4k。

在多模态输入中添加视频参考

在构思场景时,可参考最长三秒的视频,从而基于视频参考保持视觉上下文和角色一致性。

提示词:使用上传的三段舞者视频,并将其替换为所提供的角色。让他们按照参考视频中的各自舞蹈动作,在所提供的图片中那个宽敞开阔的空间里一起表演。

狗狗角色 dog.png 应表演 dance3.mp4 中的古典舞。章鱼角色 octo.png 应表演 dance1.mp4 中的嘻哈舞,而熊角色 bear.png 应表演 dance2.mp4 中的霹雳舞。最终结果应为无场景切换的连续单镜头。

激发灵感的构建方向

以下是一些想法,展示开发者如何将这些新能力应用到自定义工具和创意工作流中。

在这个应用中,你可以拖入首帧和尾帧,通过预设或提示词框生成它们之间的过渡,因为 Omni 的全上下文推理能力,你能获得看起来真实自然的镜头运动。

这个应用让镜头在房间之间移动。它做弧线运动、推进、拉远。它在一天中最完美的时刻,以理想化的状态展示这栋住宅。它不会添加任何现实中不存在的家具或细节。

创作者通常要生成好几段视频才能找到满意的那一个。Draft Room 让这种探索变得低成本且有条理:以 360p 分辨率生成 3-4 个草稿变体,每次只改变一个变量,并排对比它们。

看看客户如何将 Omni Flash 投入生产

我们的客户已经通过 Agent Platform API 使用 Gemini Omni Flash 驱动真实世界的生产应用。请观看他们创作的视频,并了解他们如何在下方使用该模型。

Adobe 已将 Gemini Omni Flash 集成到 Adobe Firefly 中。观看这段视频,了解其视频编辑能力。

“Gemini Omni Flash 是 Figma Weave 中可用的最强视频模型之一,其画布帮助创意团队在每一次生成的基础上继续构建——附加参考素材、分支不同版本、塑造独特作品。借助扩展功能、更丰富的参考素材和 4K 分辨率,Gemini Omni Flash 让团队超越单纯的视频生成,真正实现视频导演级掌控。”——Itay Schiff,Figma Weave 创意总监。

“在 GMI Cloud,我们为创作者提供对全球最强大模型的集中访问。Gemini Omni Flash 的突出之处在于其准确性:细节经得起推敲。对于制作教育和解说类内容的客户而言,准确性至关重要,这种可靠性比任何单一功能都更重要。Omni 让 AI 视频对之前无法依赖它的用户群体变得切实可用。”——Louisa Guo,GMI Cloud 营销副总裁。

“Omni Flash 自然而然地融入了人们使用 Runway 的现有方式:从提示词、图片或视频开始,然后在此基础上生成或编辑。这是我们的用户在创意之间快速切换的又一种方式。”——Jamie Umpherson,Runway 首席创意官。

立即使用 Gemini Omni 1.1 Flash 进行开发

Image 2: A table with pricing numbers for the Gemini Omni 1.1 Flash model.

Gemini Omni 1.1 Flash 定价表。

Omni 1.1 正在 Google 开发者生态系统中逐步推出:

  • 在 Google AI Studio 中开始构建:直接在 Google AI Studio 中试用 Omni 1.1。
  • 在 Gemini Enterprise Agent Platform 上部署:企业开发者可以在 Gemini Enterprise Agent Platform 上部署 Omni 1.1。
  • 探索开发者文档:查阅官方文档、cookbook 和提示词指南,了解如何将场景扩展、视频参考和超分辨率功能集成到你的应用中。

从今天起,全球所有 Google AI Plus、Pro 和 Ultra 订阅用户也可以在 Google Flow 中使用 Omni 1.1。场景扩展功能现已面向全球所有 Google AI Plus、Pro 和 Ultra 订阅用户在 Gemini 应用中提供。

来源:Google DeepMind:Blog(RSS)· deepmind.google