這款模型的核心賣點是「任何輸入,影片輸出」。與以往需要絞盡腦汁、一次性寫出完美指令的模型不同,Omni Flash 能夠記住它已經創作的內容。你可以要求它更換角色的外套、調整光線,或是重寫某個場景,它都會保留影片其餘部分的布局與一致性 。這種 多輪、對話式的編輯方式,正是它與前一代單次生成式工具最大的差異化特色 。
Gemini Omni Flash 並非簡單的圖片拼接工具。其底層架構是一個基於 Transformer 的模型,能夠對文字、圖片、音訊和影片的任意組合進行推理,進而產生單一、連貫的輸出結果 。Google 主張,這賦予了模型一種「奠基於真實世界的智慧」,意即它會應用物理、動力學、歷史和文化脈絡的規則,讓生成的場景保持合理與逼真 。
它結合了 Gemini 的推理引擎,以及 Veo、Nano Banana 和 Genie 等成熟的生成式媒體模型 。最終呈現的系統,能夠同時接收一段文字提示、一張參考圖片、一個音訊樣本和一段現有的影片片段,並將它們交織成一段長達 10 秒鐘、並帶有同步音效的連貫短片 。
值得一提的是,Omni Flash 生成的每段影片,都會透過 Google 的 SynthID 技術嵌入隱形數位浮水印,以利於識別 AI 生成內容的來源 。雖然有 10 秒鐘的長度限制是個硬指標,但 Google 已說明這是初始版本的設計選擇,而非模型本身的技術限制 。
此外,還有一點務必留意:雖然你可以生成帶同步音訊的影片,但目前還無法獨立編輯影片中人物的對白或音效——Google 刻意先保留了這項功能 。
Google 在發表當天就向全球推出了 Gemini Omni Flash,並且橫跨免費與付費方案 。
至於開發者和企業端的 API 存取,目前尚未開放。Google 表示將在「未來幾週內」透過 Gemini API 和 Vertex AI 陸續推出,這也遵循了過去 Gemini 模型發布的慣例 。
就在 Google 發表會幾週後,另一種截然不同的哲學立場站上了舞台。2026 年 5 月底,在維也納舉行的 Xiaomi 17T Pro 發表會上——一款同時擁有徠卡調校相機與 Gemini Omni 功能的手機——徠卡對生成式 AI 的立場表達得非常明確 。
徠卡相機公司行動事業部副總裁 Marius Eschweiler 表示,徠卡的理念始終圍繞在創造真實、重現現實的影像 。他直接對比了像 Omni 這類工具,並語帶保留地說:「你最有可能的,是不會在徠卡 M 系列相機上看到它。」這句話再次強調了該品牌對光學工藝與捕捉瞬間純粹性的堅持 。
然而,徠卡並未全盤否定這項科技。品牌高層承認,生成式 AI 在智慧型手機上完全合理。在一個計算攝影已成為標準的生態系裡,由 AI 驅動的創作與編輯,感覺起來更像是使用者體驗的自然演進,而非與傳統斷裂 。這項立場創造了一種清晰的雙軌策略:徠卡專屬的傳統相機,依然是攝影純粹主義者捕捉光影的工具;而手機,則成了 AI 輔助創作的畫布。
Google 難得如此直接地表明,Flash 模型僅僅只是第一步。Google 執行長 Sundar Pichai 和 DeepMind 技術長 Koray Kavukcuoglu 雙雙將 Omni 描述為一個模型系列,其終極目標是「從任何形式的輸入,創造出任何形式的內容」。
具體來說,這意味著近期會有兩個主要發展方向:
從更高層次來看,Google 將 Omni 視為邁向完整「世界模型」的一步——這類系統不再只是生成媒體,而是能夠理解、模擬並與各種模態的環境進行互動 。而就目前而言,當務之急是擴展 Omni 能生成的格式,並讓 API 盡快交到開發者手中。