在2026年5月19日的Google I/O大会上,Google发布了Gemini Omni——一个全新的多模态生成模型系列。它并非由多个独立工具拼凑而成,而是一个从零开始构建的单一原生系统 。Google将Omni描述为“我们迈向‘用任何输入创造任何内容’模型的第一步——从视频开始” 。
该系列的首个模型Gemini Omni Flash于2026年5月20日正式推出 。它接受文本、图像、音频和视频作为输入,并生成可编辑的视频。其一大亮点是支持“对话式编辑”,每一次指令都会继承之前的上下文,让调整过程如同聊天般自然 。
Gemini Omni Flash通过三个主要渠道提供服务 :
面向开发者的API预计将在发布后的几周内上线 。
根据早期报道,Omni Flash可以生成长达10秒、带原生音频的1080p视频片段 。由于该模型融入了对物理世界和真实物体行为的理解,它能确保画面在不同镜头间的视觉一致性——角色外观保持一致、光影匹配,甚至可以通过对话来调整摄像机角度 。
所有由该模型生成的内容都带有SynthID水印 。此外,它还提供了一项“虚拟化身”功能,允许用户将自己的面部和声音插入到生成的视频片段中 。
当你和朋友发短信讨论去哪里吃饭时,Magic Cue现在会建议使用Gemini来寻找餐厅,并在一个浮动窗口中直接显示结果,让你无需离开聊天界面就能获取信息 。
同时,作为Gemini应用中的一项测试功能,Gemini现在可以在后台帮你处理一些日常琐事,比如订购日常用品或预订车辆,并让你始终掌握控制权 。
更广泛的6月Android Drop更新还包括Google Photos的“衣柜”功能(于2026年6月第二周在美国、印度和巴西开始推送),以及将于6月底登陆Android版Chrome的Gemini集成功能 。
2026年6月的Pixel Drop已于6月2日至3日左右开始推送至支持的Pixel设备,各项功能将在后续几周内根据运营商和具体设备型号陆续部署 。Screen Reactions预计于今年夏天在Pixel上推出 ,而Gemini Omni Flash目前已经面向订阅用户和YouTube Shorts用户开放使用 。