Gemini Omni 1.1 Flash 发布:新增场景扩展、4K 升级等生成视频控制能力

Hacker News 热门(buzzing.cc 中文翻译)·2026-08-28 04:06·8小时前·saretup
AI 导读

Google 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向专业用途的生成视频能力。新功能包括场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量延长至累计 40 秒)、首尾帧插值、360p 快速草稿(比 720p 快至多 60%、成本为其三分之一)以及最高 4K 分辨率升级。

Hacker News 热门(buzzing.cc 中文翻译)
同事件
70AI 编辑部评分,满分 100

Gemini Omni 1.1 Flash 发布:新增场景扩展、4K 升级等生成视频控制能力

2026-08-28 04:06· 8小时前· saretup
AI 导读

Google 推出 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向专业用途的生成视频能力。新功能包括场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量延长至累计 40 秒)、首尾帧插值、360p 快速草稿(比 720p 快至多 60%、成本为其三分之一)以及最高 4K 分辨率升级。

正文 · AI 翻译

Gemini Omni 1.1 Flash 让你以更强的掌控力进行构建

Omni 现在可提供工作室级视频制作能力,包括场景延展、首尾帧插值、清晰的 4K 超分辨率、更快的原型迭代等。


Anish Nangia

Alisa Fortin


Text "Gemini Omni 1.1 Flash Available via APIs" surrounded by various images of people and a squirrel

今天,我们推出 Gemini Omni 1.1 Flash——一套全新的创意控制与生成式视频能力,旨在为开发者提供支持。Gemini Omni 将真实世界推理带入了生成式创作,而今天的更新让 Omni 1.1 通过 Google AI Studio 中的 Gemini API 达到专业级生产就绪状态。无论你是在构建生成式视频工作流、创意工具,还是媒体编辑软件,这些更新都能让生成式视频更可控、迭代更快,并为真实部署打磨出更精致的效果。以下是新增内容一览:

延展场景,讲述更长的故事

场景延展功能允许你基于现有视频,从其结束位置无缝继续生成画面。

借助 Omni 1.1,模型现在可以分析最多 10 秒的先前上下文——相比此前仅参考最后一秒的模型,这是一次巨大飞跃。其结果是视觉一致性和叙事遵循度显著提升,让你能够构建更长的故事,或分支进入新的创意方向。你可以按 10 秒增量延展视频,累计总长度最多可达 40 秒。

提示词 1:镜头轻微横移,现在我们看到她正在与一位卷发男子交谈,我们看到男子的背影,他说“我也看到了”,戏剧性配乐

提示词 2:镜头缓缓拉远,被遗忘的布满灰尘的地下墓穴,戏剧性配乐。提示词 3:镜头缓缓拉远,一座巨大的图书馆,书架与书籍在尘埃弥漫的虚空中失重漂浮,戏剧性配乐。

提示词 1:继续视频。执行电影级光学推拉变焦镜头。摄影机向前推进的同时同步拉远变焦,保持角色僵住震惊的面部在画面中大小完全不变。背景中由石柱构成的长廊在强烈的光学透视畸变下戏剧性地拉伸与加深。简洁的建筑,连续不间断的镜头。

提示词 2:继续播放视频。镜头执行一次快速的机械式急推变焦,直接对准角色睁大的双眼。风格化的电影级镜头控制。

提示词 3:继续播放视频。时间完全凝固成一个静止瞬间:角色及其被风吹起的大衣。镜头围绕冻结的角色进行平滑、高速的 360 度环绕旋转,在柱廊间展现戏剧性的 3D 纵深与视差效果。衔接天衣无缝。

提示词 1:穿蓝色毛衣的男子回答:“你父亲当年也坐船出海吗?”

提示词 2:镜头以一个连续运动向后拉远,他继续讲述自己的故事:“他过去常说,这座港湾有灵魂。而那些船,是我们生命的一部分。”音乐随之渐强。

提示词 1:他直视镜头,讲述最后一章将以怎样的结局收尾!

提示词 2:随后他站起身,绕过桌子走到镜头前,说:“你会怎么选?”

以下是通过 Gemini API 扩展场景的方法:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
    previous_interaction_id=previous_video_interaction.id,
    input=[
        {"type": "text", "text": "Continue the scene."}
    ],
    response_format={
        "resolution": "360p",
    },
)

指定首帧和末帧

通过指定一个镜头的起始帧和结束帧,实现平滑的转场和镜头运动。Omni 1.1 可在两个关键帧之间生成连续视频,非常适合复杂的镜头环绕、变焦转场或无缝循环片段。

提示词 1:一个低角度特写镜头,一位身着米色西装的时尚鼓手在宏伟的大厅中演奏红色架子鼓,镜头随即快速横摇至一侧,显露出一位年长的萨克斯手,正与一位身着白色服装、在柔和的紫色舞台灯光下旋转的芭蕾舞者一同演奏。一个连续镜头,无跳切。

提示词 2:镜头推近电视屏幕,我们看到与开头相同的女人和相同的场景。无缝视频。一个连续镜头,无跳切。

以 360p 分辨率更高效地草拟视频

以 360p 分辨率生成轻量级预览,速度最高可提升 60%*,成本仅为 Omni 1.1 标准 720p 分辨率的三分之一。这对于快速原型制作、分镜迭代以及在开发者平台上快速渲染非常有帮助。

*基于 360p 与 720p 分辨率的系统吞吐量对比,生成速度最高可提升 60%。

提示词:虹彩海洋硅藻的微观视图,展示其精致如玻璃般的硅质外壳,呈现出令人惊叹的自然对称之美。色彩从深沉的火山琥珀色、温暖的铜色,延伸到鲜艳的碧绿色与紫罗兰色,仿若大地与海洋的丰富调色板。微小而精巧的结构在干净的深色背景中柔和发光。高保真科学成像、锐利细节、有机纹理、显微摄影。整个视频全程保持显微镜镜头效果。

提升至最高 4K 分辨率

借助 Omni 1.1,生成精致的高分辨率 1080p 或 4K 输出,可直接用于专业制作。

提示词 1:鱼群游动,跟拍镜头

提示词 2:一只小花栗鼠从画面左侧的树林中窜出,好奇地嗅了嗅空气,然后从画面右侧跑出画框

提示词 3:电影级微距特写镜头,拍摄细嫩枝条上鲜艳的金橙色日本枫叶,在柔和而有韵律的秋风中轻轻沙沙作响、摇曳摆动。阳光透过半透明的叶片洒落,营造出温暖发光的效果。浅景深、梦幻般的散景背景、超精细纹理、照片级真实感、4K。

在多模态输入中添加视频参考

在构思场景时,可参考最长三秒的视频片段,从而基于视频参考保持视觉上下文与角色一致性。

提示词:使用上传的三段舞者视频,将其中舞者替换为所提供的角色。让这些角色按照参考视频中的各自舞蹈动作进行表演,全部一起出现在所提供图片中的宽敞开阔空间里。

狗狗角色 dog.png 应表演 dance3.mp4 中的古典舞。章鱼角色 octo.png 应表演 dance1.mp4 中的嘻哈舞,而熊角色 bear.png 应表演 dance2.mp4 中的霹雳舞。最终结果应为一条连续镜头,不得有任何场景切换。

激发灵感的构建方向

以下是一些示例,展示开发者如何将这些新能力应用到自定义工具与创意工作流中。

在这款应用中,你可以放入首帧和末帧,借助预设或提示词框生成它们之间的过渡画面,因为 Omni 的全上下文推理能力,你能获得看起来非常真实的镜头运动。

这款应用会引导镜头在房间中穿梭。它时而弧线运动,时而推近,时而拉远。它展现的是理想状态下的住宅,处于一天中最完美的时刻。它不会添加任何现实中不存在的家具或细节。

创作者通常要生成好几段视频才能找到满意的那一个。Draft Room 让这种探索变得低成本且有条理:以 360p 分辨率生成 3-4 个草稿变体,每次只改动一个变量,并排对比它们。

看看客户如何将 Omni Flash 投入生产环境

我们的客户已经在通过 Agent Platform API 使用 Gemini Omni Flash 驱动真实的行业生产。请观看他们创作的视频,并了解他们如何使用该模型。

Adobe 已将 Gemini Omni Flash 集成到 Adobe Firefly 中。观看这段视频,了解其视频编辑能力。

“Gemini Omni Flash 是 Figma Weave 中可用的最强视频模型之一,画布功能帮助创意团队在每次生成的基础上继续构建——附加参考资料、分支不同版本、塑造独特作品。借助扩展功能、更丰富的参考资料和 4K 分辨率,Gemini Omni Flash 让团队超越单纯的视频生成,真正实现导演级掌控。”——Itay Schiff,Figma Weave 创意总监。

“在 GMI Cloud,我们为创作者提供全球最强大模型的集中访问入口。Gemini Omni Flash 的突出之处在于其准确性:细节经得起推敲。对于创作教育和解说类内容的客户来说,准确性至关重要,这种可靠性比任何单一功能都更重要。Omni 让此前无法依赖 AI 视频的细分领域真正实现了 AI 视频的可用性。”——Louisa Guo,GMI Cloud 营销副总裁。

“Omni Flash 自然地融入了人们使用 Runway 的现有方式:从提示词、图片或视频开始,然后在此基础上生成或编辑。这是我们的用户在创意之间快速切换的又一种方式。”——Jamie Umpherson,Runway 首席创意官。

立即使用 Gemini Omni 1.1 Flash 进行构建

Gemini Omni 1.1 Flash 的定价表。

A table with pricing numbers for the Gemini Omni 1.1 Flash model.

Omni 1.1 正在 Google 开发者生态系统中全面推出:

  • 在 Google AI Studio 中开始构建:直接在 Google AI Studio 中试用 Omni 1.1。
  • 在 Gemini Enterprise Agent Platform 上构建:企业可以通过 Agent Platform API 直接使用 Omni 1.1 进行构建。
  • 探索开发者文档:查阅官方文档、cookbook 和提示词指南,了解如何将场景扩展、视频参考和超分辨率功能集成到你的应用程序中。

从今天起,全球所有 Google AI Plus、Pro 和 Ultra 订阅用户也可以在 Google Flow 中使用 Omni 1.1。场景扩展功能现已面向全球所有 Google AI Plus、Pro 和 Ultra 订阅用户在 Gemini 应用中提供。