以下整理 Gemini Omni 的核心功能、與 Veo 的差異、Omni Flash 的能力、目前可使用的平台,以及 Google 同步擴展的 SynthID AI 內容辨識系統。
Gemini Omni 被 Google 描述為一個 多模態生成模型家族,目標是讓 AI 能從幾乎任何輸入組合生成媒體內容。
在首波推出時,功能主要集中在 AI 影片生成:
例如,使用者可以:
Google 表示,Gemini Omni 的設計重點之一是提升 物理與動作理解能力,例如物體移動、重力、動能與互動關係,使生成影片更自然與一致。
目前 Omni 的輸出主要是影片,但 Google 已表示未來版本將逐步支援 直接生成圖片與文字 等更多內容形式。
在 Omni 之前,Google 的主要影片生成模型是 Veo。
兩者最大差別在於架構與定位。
Veo:
Gemini Omni:
換句話說,Omni 的目標是把原本分散在不同工具中的能力整合到 單一 AI 模型,包括影片生成(Veo)與其他媒體生成技術。
這讓 AI 能跨模態理解內容,例如同時解析對話、畫面與參考素材,再生成或修改影片。
Gemini Omni Flash 是 Omni 系列第一個正式推出的模型。
它支援在同一個提示(prompt)中使用多種輸入:
AI 會依據這些資料生成 逼真的影片輸出,並允許使用者透過自然語言持續修改結果。
Google 示範的應用場景包括:
由於模型更理解 物體運動與互動關係,生成影片在動作與物理一致性上比早期模型更自然。
Google 在 **2026 年 5 月 19 日(I/O keynote 當天)**開始推出 Gemini Omni Flash。
初期整合的平台包括:
在 Gemini 生態系中,Omni 的使用與 Google 的 AI 訂閱方案相關。
支援的方案包括:
不同方案主要差別在於 使用量限制與進階功能。
Google 也在 I/O 2026 推出新的 AI Ultra 訂閱方案(每月 100 美元),主要面向開發者與高階創作者,提供更高運算與使用額度。
隨著生成式媒體能力提升,Google 同時強調 內容透明度與防濫用機制。
核心技術是 SynthID。
SynthID 是一種 不可見數位浮水印系統,可嵌入 AI 生成內容中,包括:
這些標記 人眼無法察覺,但可被軟體偵測,讓系統判斷內容是否由 AI 生成。
在 I/O 2026,Google 宣布多項擴展。
Google 正把 SynthID 檢測能力加入:
未來使用者在瀏覽網路圖片時,可以直接判斷內容是否由 AI 生成或修改。
Google 也宣布多家 AI 公司加入 SynthID 生態系,包括:
這些公司將在其 AI 生成系統中加入 SynthID 浮水印,以建立 跨平台的 AI 內容辨識標準。
Google 也提供 SynthID Detector 驗證入口。
使用者可以上傳圖片、影片或音訊,系統會掃描是否包含 SynthID 浮水印,協助媒體與研究人員確認內容來源。
Gemini Omni 代表 AI 模型發展的一個新方向。
過去生成式 AI 往往分成不同模型:
Google 現在的策略是建立 統一的多模態模型,讓 AI 能同時理解並生成多種媒體格式。
目前 Omni 先從影片生成開始,但長期目標是打造一個能 「任何輸入生成任何輸出」 的 AI 系統。
同時,Google 也嘗試透過 SynthID 浮水印與檢測工具,在生成式 AI 爆發的同時建立內容透明與來源驗證機制,以應對深偽(deepfake)與 AI 內容辨識問題。