谷歌于 2026 年 5 月 19 日推出 Gemini Omni Flash,这是一个多模态 AI 模型,能将文本、图片、音频和视频混合输入,生成带有同步音频的 10 秒水印视频,并支持通过来回对话进行编辑,无需每次都从头开始 [2][5][8]。 徕卡公开表示,像 Omni 这样的生成式 AI 工具与品牌专注于真实光学影像捕捉的核心理念相冲突,因此不太可能出现在徕卡 M 相机上,但它认为这对于像小米 17T Pro 这样的智能手机来说是个完美搭配 [2][32]。

Create a landscape editorial hero image for this Studio Global article: What is Google's Gemini Omni Flash AI video editing model, how does it work and who can access it, what is Leica's position on generative AI. Article summary: Here is a full breakdown covering all four parts of your question.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Gemini Omni is a new family of AI models meant to ‘create anything’. Google is announcing a major new family of generative AI models that it calls Gemini Omni. The company is pos" source context "Gemini Omni is a new family of AI models meant to 'create anything'" Reference image 2: visual subject "# Gemini Omni is a new family of AI models meant to ‘create anything’. Google is announcing a major new family of generative AI models that it calls Gemini Omni. The
谷歌近期发布了一款新的 AI 模型,它不仅能创作视频,还能让你像和真人剪辑师聊天一样,通过对话完成剪辑。这款名为 Gemini Omni Flash 的模型于 2026 年 5 月 19 日在 Google I/O 大会上首次亮相,是全新 Gemini Omni 家族中第一个对公众开放的模型,标志着谷歌在生成式媒体领域的思路发生重大转变 。它不再是一个独立的工具,而是将谷歌的视频生成能力直接融入了其核心的 Gemini 推理系统之中
。
其核心卖点是“万物皆可输入,视频即可输出” 。与以往需要绞尽脑汁编写单个提示词的模型不同,Omni Flash 能记住已经创作的内容。你可以要求它更换角色的夹克、调整光线或重写一个场景,它会保留视频片段其余部分的布局和一致性
。这种多轮对话式编辑是其脱颖而出的关键特性,让其与市面上的单次生成视频工具有本质区别
。
Gemini Omni Flash 并非简单的图像拼接工具。它的底层架构是一个基于 Transformer 的模型,能对文本、图片、音频和视频的任意组合进行推理,从而生成单一、连贯的输出 。谷歌认为,这赋予了模型一种“世界知识基础”的智能,即它会运用物理、动力学、历史和文化背景规则,来确保生成的场景逼真
。
它结合了 Gemini 的推理引擎与 Veo、Nano Banana 和 Genie 等久经考验的生成式媒体模型 。最终的系统能同时接收文本提示、参考图片、音频样本和现有视频片段,并将其编织成一个带同步音频的 10 秒新视频片段
。
Omni Flash 生成的每个视频都通过谷歌的 SynthID 技术打上了隐形水印,以帮助识别和追踪 AI 生成内容的来源 。虽然 10 秒的时长是一个限制,但谷歌表示这是针对首次发布的设计选择,而非模型的固有制约
。
需要注意的是,虽然你可以生成带同步音频的视频,但目前该模型不允许你独立编辑生成视频中的语音或音频——这是谷歌有意保留的能力 。
谷歌在发布当天就在全球范围内推广了 Gemini Omni Flash,通过免费和付费层级向用户开放 。
开发者和企业 API 访问权限尚未开放。谷歌表示,将遵循此前 Gemini 模型发布的模式,在“未来几周内”通过 Gemini API 和 Vertex AI 逐步推出 。
就在谷歌发布新模型几周后,一种截然不同的产品哲学登上了舞台。2026 年 5 月底,在维也纳举行的小米 17T Pro 发布会上,这款同时搭载徕卡调校相机和 Gemini Omni 能力的手机,让徕卡明确了自己对生成式 AI 的立场 。
徕卡相机公司移动业务部副总裁 Marius Eschweiler 表示,公司的核心理念是创造能复制现实的、真实的影像 。他将这种理念与 Omni 等工具进行了直接对比,称:“你很可能不会在徕卡 M 相机上看到它”,并强调了品牌对光学工艺和捕捉瞬间纯粹性的承诺
。
然而,徕卡并未完全否定这项技术。公司领导层承认,生成式 AI 在智能手机上非常合乎逻辑。在一个计算摄影已成标配的生态系统中,由 AI 驱动的创作和编辑更像是一种用户体验的自然演进,而非对传统的背离 。这一立场创造了一个清晰的双重策略:专用徕卡相机继续作为捕捉光线的纯粹主义工具,而手机则成了 AI 辅助创作的画布。
谷歌异常直接地表明,Flash 模型只是第一步。谷歌 CEO Sundar Pichai 和 DeepMind CTO Koray Kavukcuoglu 都将 Omni 描述为一个模型家族,其设计初衷是最终能“从任何输入中创建任何东西” 。
具体来说,这意味着近期有两大发展方向:
从更高层面看,谷歌将 Omni 视为迈向完整“世界模型”的一步——这种系统不仅生成媒体,还能跨所有模态理解、模拟和与环境交互 。就目前而言,其首要任务是扩展 Omni 可以生成的格式,并将 API 接口交到开发者的手中。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
谷歌于 2026 年 5 月 19 日推出 Gemini Omni Flash,这是一个多模态 AI 模型,能将文本、图片、音频和视频混合输入,生成带有同步音频的 10 秒水印视频,并支持通过来回对话进行编辑,无需每次都从头开始 [2][5][8]。
谷歌于 2026 年 5 月 19 日推出 Gemini Omni Flash,这是一个多模态 AI 模型,能将文本、图片、音频和视频混合输入,生成带有同步音频的 10 秒水印视频,并支持通过来回对话进行编辑,无需每次都从头开始 [2][5][8]。 徕卡公开表示,像 Omni 这样的生成式 AI 工具与品牌专注于真实光学影像捕捉的核心理念相冲突,因此不太可能出现在徕卡 M 相机上,但它认为这对于像小米 17T Pro 这样的智能手机来说是个完美搭配 [2][32]。
谷歌已确认 Omni 路线图不仅限于视频,未来将扩展到图片和文本生成,并且更强大的 Pro 和 Ultra 版本模型正在开发中 [1][8][23]。