生成后的视频还可以通过自然语言继续修改,例如调整场景、人物、物体或整体风格,实现类似“对话式剪辑”。
谷歌表示,Omni 在 运动、物理效果和物体交互方面进行了优化,因此生成的视频在动作连贯性和真实感上更接近真实世界。
虽然目前重点是视频输出,但谷歌透露未来版本还将支持 从多模态输入直接生成图片或文本等内容。
在 Gemini Omni 之前,谷歌的视频生成主要依赖 Veo。
两者最大的差异在于定位和架构。
Veo
Gemini Omni
换句话说,Omni 的设计目标是 把此前分散在不同工具中的能力整合为一个统一模型。
这意味着用户可以在同一次生成中同时提供:
AI 会综合理解这些信息再生成或修改视频内容。
Gemini Omni Flash 是 Omni 系列第一个上线的生产级模型。
它支持在同一个提示中输入:
系统随后生成 真实感更强的视频内容,并允许用户通过对话继续修改生成结果。
谷歌展示的一些典型使用方式包括:
由于模型强化了对 物理运动和物体交互的理解,生成的视频在动作逻辑和连续性方面比早期模型更加稳定。
谷歌在 **2026年5月19日(I/O 2026 keynote 当天)**开始推出 Gemini Omni Flash。
首批上线的平台包括:
在 Gemini 生态中,Omni 功能与谷歌的 AI 订阅体系绑定。
目前支持的订阅层级包括:
不同等级主要区别在于 使用额度和计算资源限制。
谷歌还在 I/O 2026 同步推出 每月 100 美元的 AI Ultra 订阅计划,面向开发者和专业创作者,提供更高算力和更大的使用配额。
随着生成式视频能力增强,谷歌同时强调 AI 内容透明度与防伪机制。
核心技术是 SynthID。
SynthID 是一种 不可见数字水印技术,可以嵌入到 AI 生成内容中,包括:
这些水印 肉眼无法察觉,但可以被软件检测到,用于验证内容是否由 AI 生成。
在 I/O 2026 上,谷歌宣布多项扩展。
新的检测功能将进入:
用户未来可以直接在浏览体验中判断图片是否为 AI 生成或被 AI 修改。
谷歌还宣布多家公司开始采用 SynthID,包括:
目标是推动 AI 内容标识成为全行业标准。
谷歌提供了 SynthID Detector 检测门户。
用户可以上传媒体文件,系统会扫描其中是否包含 SynthID 水印,从而判断其是否由 AI 生成。
这对 媒体机构、研究人员和事实核查团队尤其重要。
Gemini Omni 代表着 AI 模型架构的一次重要变化。
过去,生成式 AI 往往是分开的系统:
而谷歌现在正在推动 统一多模态模型:
一个系统即可理解并生成不同类型的内容。
当前阶段,Omni 主要专注于 从多模态输入生成视频。
但更长远的目标是构建一个能够 “任意输入 → 任意输出” 的 AI 系统——既理解世界,也能生成各种媒体形式。
与此同时,谷歌通过 SynthID 等技术尝试建立 AI 内容溯源与识别机制,以应对深度伪造和生成式媒体带来的挑战。