Gemini Omni 1.1 Flash 是 Google 面向视频生成与编辑推出的高速多模态模型。它最值得关注的地方,并不是宣称每一帧都胜过竞争对手,而是把 AI 视频制作变成一个更容易控制的循环:先用低成本版本快速试做,再利用更长的上下文延续镜头、用首尾画面规定运动结果,最后将获批内容渲染为更高分辨率的交付版本。4533
Gemini Omni 1.1 Flash 能做什么
该模型支持输入文字、图片和视频,并生成视频输出。Google API 文档显示,单次输出时长为 3 至 10 秒,帧率为 24 fps,支持 360p、720p、1080p 和 4K 等分辨率选项。用于编辑和延展的视频输入,在 API 文档中最长可达 10 秒。1
因此,Omni 1.1 Flash 对剪辑师、动态设计师、广告代理商和产品团队的意义,可能大于对单纯“输入一句提示词、生成一段视频”的普通用户。团队可以从已经审核过的视觉素材出发,把模型嵌入可重复的制作流程,而不是把它当成一次性的创意实验。
对专业制作最重要的四项变化
1. 场景延展能够参考更多前置内容
在延展现有视频时,Gemini Omni 1.1 Flash 可以分析此前最多 10 秒的视频内容。此前的 Omni 相关材料描述的参考范围要窄得多;新的方式让模型能够获得更多关于主体、光线、镜头运动和动作过程的信息,再生成后续画面。511
延展以每次 10 秒为一个阶段,累计片段长度最高可达 40 秒。但单次生成仍限制在 3 至 10 秒,因此它更准确的理解是“分阶段续写”,而不是通过一次提示词生成不受限制的长镜头。124
对制作团队而言,这一区别很重要。导演可以先审核一个短镜头,再从获批位置继续生成,也可以从该位置分支尝试不同版本,同时把流程维持在易于管理的镜头长度内。更长的上下文或许有助于减少连续性漂移,但并不意味着人物、道具、光线或运动一定能做到完美一致。
2. 首帧和尾帧控制可以直接规定运动方向
模型支持根据两张指定图片生成中间视频:一张作为起始画面,另一张作为结束画面。Google 的 API 更新日志将其描述为图像转视频流程中的插帧功能。33
这为团队明确镜头的视觉终点提供了更直接的方法。例如,剪辑师可以提供产品的开场构图和最终展示位置,再让模型生成两者之间的运动过程。类似流程也可以尝试用于镜头运动衔接、循环动画和转场,但每种结果的质量与稳定性仍需要结合实际镜头进行测试。
它的实际优势在于控制力。纯提示词生成要求模型同时推断镜头应该如何开始、如何结束;而首尾帧控制可以先锁定这两个创意决定,再让模型补足中间的运动。
3. 360p 提供更便宜的迭代阶段
Google 表示,360p 预览的生成速度最高可比标准 720p 快 60%,成本约为 720p 的三分之一。5
这为分镜和审核建立了一条实用的成本阶梯:
- 先生成多个 360p 版本,测试提示词、节奏、构图和运动。
- 选出最有潜力的版本,进一步调整参考素材或首尾帧。
- 将审核通过的版本渲染为更高分辨率。
- 在生成环节之外完成合成、调色、声音、版权审查和质量控制。
Google 的价格文档列出,360p 视频输出速率为每秒 1,931 个令牌,720p 为每秒 5,792 个令牌。按照每百万视频输出令牌 17.50 美元的公开价格计算,360p 约为每秒 0.034 美元,720p 约为每秒 0.101 美元;这还不包括输入和文本输出费用。4143
所以,最终账单并不是简单的“每条视频固定收费”。输入媒体、文本响应、分辨率、时长以及所使用的平台,都可能影响实际金额。
4. 高分辨率交付可以接在同一流程后端
API 在支持 360p 和 720p 的同时,也提供 1080p 和 4K 选项。Google 的发布材料将包括 4K 在内的高分辨率模式定位为:先以较低成本进行创意试验,再为选中的内容完成最终输出。134
对于需要区分创意迭代与交付渲染的团队,这种设计很有价值。它也能避免一种常见的流程浪费:在分镜或运动尚未通过审核前,就把高分辨率生成额度花在尚未确定的创意上。
参考视频如何改变制作流程
Omni 1.1 Flash 面向多模态输入设计,因此团队可以把文字指令与视觉参考结合起来。根据任务不同,参考素材可以是风格帧、产品图片、已有素材片段,或一段用于示范运动方式的短视频。14
与只依赖文字描述相比,参考素材驱动的流程通常更容易审核,因为创意简报中包含可直接查看的视觉锚点。开始生成前,团队可以先确定哪些元素必须保持不变,例如产品设计、Logo 呈现方式、角色外观或开场构图;同时明确哪些部分可以交给模型生成。
但参考视频不能替代授权,也不能自动解决完整的连续性管理问题。团队仍需确认是否拥有所提供素材的使用权,检查生成结果是否正确保留受保护的品牌元素,并判断输出是否符合项目的编辑和法律要求。
价格与使用渠道
Google Gemini API 的价格页面显示,Gemini Omni 1.1 Flash 的输入价格为每百万令牌 1.50 美元,文本输出为每百万令牌 9 美元,视频输出为每百万令牌 17.50 美元。Google 按 720p 视频每秒 5,792 个令牌计费,因此在排除其他适用费用后,视频输出部分约为每生成一秒 0.10 美元。41
API 更新日志显示,gemini-omni-1.1-flash 已作为正式版模型向付费 Gemini API 开发者开放。3341
不过,不同 Google 产品的可用状态并不完全相同。Google 面向消费者的公告显示,Gemini Omni 可通过 Gemini 应用和 Google Flow,向 Google AI Plus、Pro 和 Ultra 订阅用户提供;而 Google Enterprise Agent Platform 的更新说明则将 Gemini Omni 1.1 Flash 列为 Public Preview(公开预览)。团队在确定生产管线前,应核实当前模型 ID、所在地区、配额、计费状态和具体产品的开放范围。202232
它是否已集成 Adobe Firefly 或 Figma?
现有证据不足以确认一个清晰、正式的 Figma 直接集成公告,因此不应把这一说法视为已验证事实。更稳妥的做法,是区分 Google 自有开发者与创意产品中的已确认模型访问渠道,以及第三方报道中的集成说法或客户使用案例。
对专业采购方来说,真正重要的并不是某个品牌是否出现在发布报道里,而是模型能否进入团队实际使用的审核、资产管理、剪辑和审批流程,并提供稳定的 API 与可预期的账单。
Gemini Omni 1.1 Flash 与 OpenAI Sora 对比
Gemini Omni 1.1 Flash 和 OpenAI Sora 不应只用一个 headline 功能来比较。现有材料能够支持的较窄结论是:Google 正通过场景延展、首尾帧控制、多模态参考、快速草稿和 API 迭代,更积极地争夺专业 AI 视频市场。433
根据所提供的来源,目前没有足够独立且具有代表性的证据证明 Omni 1.1 Flash 在画面真实感、物理效果或连续性方面稳定优于 Sora。来源也没有提供一套统一基准,使两个系统能够被直接视为可互换方案。
更严谨的比较应使用相同的提示词、参考素材、镜头长度、输出分辨率和验收标准,并测量:
- 人物、产品、光线和镜头运动的连续性;
- 首尾帧转场的成功率;
- 草稿分辨率与交付分辨率下的渲染延迟;
- 每个“获批视频秒数”的成本,而不只是每次生成尝试的成本;
- 音频和对白需求;
- 安全、版权和数据处理政策;
- 模型与团队现有剪辑、审核工具的整合难度。
一套可落地的制作流程
较为稳妥的 Omni 1.1 Flash 工作流可以是:
- 准备已经获批的风格帧、产品图片、已有素材片段或运动参考。
- 生成多个 360p 草稿,测试方向、构图、节奏和运动效果。
- 选出最合适的版本;在适用时,明确镜头必须采用的开场帧和结束帧。
- 以 10 秒为阶段延展选定镜头,每次生成后检查连续性。
- 当交付要求确实需要时,将获批序列渲染为 1080p 或 4K。
- 使用传统制作工具完成合成、调色、声音、字幕、版权审查和质量控制。
Omni 1.1 Flash 可以降低创意试错成本,也能减少制作衔接镜头所需的手工工作。但它不会取代决定视频是否连贯、是否合法可用、是否符合技术规范以及能否公开发布的编辑判断。