Google 於 2026 年 5 月 19 日推出 Gemini Omni Flash,這是一款能夠混合文字、圖片、音訊與影片指令,生成 10 秒鐘帶有 SynthID 隱形浮水印的 AI 影片,並支援透過來回對話「逐步編輯」的多模態模型 [1][2][5]。 徠卡高層公開表示,像 Gemini Omni 這類生成式 AI 工具,與徠卡傳統相機「捕捉真實影像」的品牌理念相衝突,但他們認為這類技術在智慧型手機上,卻是再合理不過的演進方向 [2][32]。

Create a landscape editorial hero image for this Studio Global article: What is Google's Gemini Omni Flash AI video editing model, how does it work and who can access it, what is Leica's position on generative AI. Article summary: Here is a full breakdown covering all four parts of your question.. Topic tags: general, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "# Gemini Omni is a new family of AI models meant to ‘create anything’. Google is announcing a major new family of generative AI models that it calls Gemini Omni. The company is pos" source context "Gemini Omni is a new family of AI models meant to 'create anything'" Reference image 2: visual subject "# Gemini Omni is a new family of AI models meant to ‘create anything’. Google is announcing a major new family of generative AI models that it calls Gemini Omni. The
Google 近期發表了一款新的 AI 模型,它不只是生成影片,更能讓你像是在跟真人剪接師對話一樣編輯影片。名為 Gemini Omni Flash 的模型於 2026 年 5 月 19 日在 Google I/O 大會上亮相,是全新 Gemini Omni 系列中第一款對外公開的模型,也代表著 Google 對於生成式媒體的思考方式發生重大轉變 。它並非一項獨立工具,而是將 Google 的影片生成能力,直接整合到其核心的 Gemini 推理系統中
。
這款模型的核心賣點是「任何輸入,影片輸出」。與以往需要絞盡腦汁、一次性寫出完美指令的模型不同,Omni Flash 能夠記住它已經創作的內容。你可以要求它更換角色的外套、調整光線,或是重寫某個場景,它都會保留影片其餘部分的布局與一致性
。這種 多輪、對話式的編輯方式,正是它與前一代單次生成式工具最大的差異化特色
。
Gemini Omni Flash 並非簡單的圖片拼接工具。其底層架構是一個基於 Transformer 的模型,能夠對文字、圖片、音訊和影片的任意組合進行推理,進而產生單一、連貫的輸出結果 。Google 主張,這賦予了模型一種「奠基於真實世界的智慧」,意即它會應用物理、動力學、歷史和文化脈絡的規則,讓生成的場景保持合理與逼真
。
它結合了 Gemini 的推理引擎,以及 Veo、Nano Banana 和 Genie 等成熟的生成式媒體模型 。最終呈現的系統,能夠同時接收一段文字提示、一張參考圖片、一個音訊樣本和一段現有的影片片段,並將它們交織成一段長達 10 秒鐘、並帶有同步音效的連貫短片
。
值得一提的是,Omni Flash 生成的每段影片,都會透過 Google 的 SynthID 技術嵌入隱形數位浮水印,以利於識別 AI 生成內容的來源 。雖然有 10 秒鐘的長度限制是個硬指標,但 Google 已說明這是初始版本的設計選擇,而非模型本身的技術限制
。
此外,還有一點務必留意:雖然你可以生成帶同步音訊的影片,但目前還無法獨立編輯影片中人物的對白或音效——Google 刻意先保留了這項功能 。
Google 在發表當天就向全球推出了 Gemini Omni Flash,並且橫跨免費與付費方案 。
至於開發者和企業端的 API 存取,目前尚未開放。Google 表示將在「未來幾週內」透過 Gemini API 和 Vertex AI 陸續推出,這也遵循了過去 Gemini 模型發布的慣例 。
就在 Google 發表會幾週後,另一種截然不同的哲學立場站上了舞台。2026 年 5 月底,在維也納舉行的 Xiaomi 17T Pro 發表會上——一款同時擁有徠卡調校相機與 Gemini Omni 功能的手機——徠卡對生成式 AI 的立場表達得非常明確 。
徠卡相機公司行動事業部副總裁 Marius Eschweiler 表示,徠卡的理念始終圍繞在創造真實、重現現實的影像 。他直接對比了像 Omni 這類工具,並語帶保留地說:「你最有可能的,是不會在徠卡 M 系列相機上看到它。」這句話再次強調了該品牌對光學工藝與捕捉瞬間純粹性的堅持
。
然而,徠卡並未全盤否定這項科技。品牌高層承認,生成式 AI 在智慧型手機上完全合理。在一個計算攝影已成為標準的生態系裡,由 AI 驅動的創作與編輯,感覺起來更像是使用者體驗的自然演進,而非與傳統斷裂 。這項立場創造了一種清晰的雙軌策略:徠卡專屬的傳統相機,依然是攝影純粹主義者捕捉光影的工具;而手機,則成了 AI 輔助創作的畫布。
Google 難得如此直接地表明,Flash 模型僅僅只是第一步。Google 執行長 Sundar Pichai 和 DeepMind 技術長 Koray Kavukcuoglu 雙雙將 Omni 描述為一個模型系列,其終極目標是「從任何形式的輸入,創造出任何形式的內容」。
具體來說,這意味著近期會有兩個主要發展方向:
從更高層次來看,Google 將 Omni 視為邁向完整「世界模型」的一步——這類系統不再只是生成媒體,而是能夠理解、模擬並與各種模態的環境進行互動 。而就目前而言,當務之急是擴展 Omni 能生成的格式,並讓 API 盡快交到開發者手中。
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google 於 2026 年 5 月 19 日推出 Gemini Omni Flash,這是一款能夠混合文字、圖片、音訊與影片指令,生成 10 秒鐘帶有 SynthID 隱形浮水印的 AI 影片,並支援透過來回對話「逐步編輯」的多模態模型 [1][2][5]。
Google 於 2026 年 5 月 19 日推出 Gemini Omni Flash,這是一款能夠混合文字、圖片、音訊與影片指令,生成 10 秒鐘帶有 SynthID 隱形浮水印的 AI 影片,並支援透過來回對話「逐步編輯」的多模態模型 [1][2][5]。 徠卡高層公開表示,像 Gemini Omni 這類生成式 AI 工具,與徠卡傳統相機「捕捉真實影像」的品牌理念相衝突,但他們認為這類技術在智慧型手機上,卻是再合理不過的演進方向 [2][32]。
Google 已確認 Omni 系列藍圖將不侷限於影片,未來會擴展至圖片與文字生成,並將推出運算能力更強大的 Omni Pro 與 Omni Ultra 版本 [1][3][11]。