OpenAI 正在為 ChatGPT 推出代號 GPT Bidi 1 的新一代雙向語音模型,能同時聽與說,不像現有模式必須等對方講完才能回應。 GPT Bidi 1 首次在語音端引入三種智能與速度等級:High(深度推理)、Medium(平衡)、Instant(即時),用戶可依任務需求切換。
研究答案

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is OpenAI's GPT-Bidi-1 bidirectional voice model for ChatGPT, including how it was discovere. Article summary: OpenAI's **GPT-Bidi-1** is a next-generation bidirectional voice model for ChatGPT, discovered via code and UI references in the ChatGPT web and mobile apps. It represents the largest voice-mode upgrade ever for ChatGPT,. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
OpenAI 正準備為 ChatGPT 推出有史以來最大規模的語音模式升級:一款內部代號為 GPT-Bidi-1 的雙向音訊模型。與過去所有 ChatGPT 語音模式不同——這些模式都必須等使用者說完才能回應——GPT-Bidi-1 可以同時聽與說,能吸收打斷、即時修正錯誤,並在不停頓音軌的情況下動態調整回覆內容。
本文將完整說明 GPT-Bidi-1 如何被發現、它與傳統輪流語音模式的差異、所引入的三種智能等級、ChatGPT 介面的視覺變化,以及其開發的競爭背景。該模型尚未獲得 OpenAI 官方正式宣布,因此所有細節皆來自程式碼線索、UI 參考資料、使用者回報及媒體分析。
發現的源頭始於開發者 M1Astra,他首先在 ChatGPT 的應用程式碼中發現了 gpt-bidi-1 的參考字串,並在 X 平台上分享此發現。追蹤網站 TestingCatalog 隨後確認了這個模型名稱,同時還發現了描述為「下一代語音」和「智能的重大躍進」的公告文字。
接著,在網頁版與行動版 ChatGPT 客戶端中都找到了相關的程式碼和 UI 元素。從 2026 年 6 月下旬開始,少數使用者已能進行有限測試。 到了 2026 年 6 月 22 日至 24 日期間,多份使用者回報與示範影片開始出現,實際展示了該模型的雙向運作方式。
注意:OpenAI 尚未發布官方公告。模型的最終名稱、確切的等級運作方式以及正式推出日期,目前仍未獲得該公司證實。
現有的 ChatGPT 語音模式——標準語音與進階語音模式——採用的是輪流的對話模式。模型必須等使用者說完才能回應。GPT-Bidi-1 的雙向(BiDi)架構則讓模型能同時處理兩條音訊串流:使用者的聲音以及它自己的聲音。
根據示範中所報導的關鍵行為差異:
OpenAI 的內部目標是縮小 ChatGPT 語音技術(落後於已達 GPT-5.5 等級推理能力的文字模型)的差距,讓即時對話的智慧表現與文字能力保持一致。
GPT-Bidi-1 是第一款在語音端導入三種可選擇的智能與速度等級的 OpenAI 語音模型:
| 等級 | 說明 |
|---|---|
| 高(High) | 最大推理深度,回應較慢——適用於複雜分析任務 |
| 中(Medium) | 智慧與速度之間的平衡取捨 |
| 即時(Instant) | 最快的回應速度,推理能力較低——適合輕鬆或時間敏感的互動 |
這個等級系統讓使用者能根據任務需求,調整互動深度與延遲之間的取捨,類似 ChatGPT 文字模型所提供的不同推理等級。 例如,快速查詢天氣時可使用「即時」模式,而進行深度腦力激盪時則可切換到「高」模式。
當選取 GPT-Bidi-1 時,語音氣泡/波形指示器會變成黃色,而非目前的預設顏色。 該模型在設定的模型選擇器中,會以一個新的 「Bidi(最新)」 選項呈現,與現有的標準語音和進階語音模式並列,而非取代它們。
gpt-bidi-1 的程式碼參考資料。競爭背景:這次的雙向語音功能,是直接回應來自 Google(具備打斷功能的 Gemini Live)、Anthropic 以及新創公司的即時語音代理等競爭對手的技術進展。OpenAI 正積極將其文字智慧(已支援 GPT-5.5 等級推理能力)的優勢,擴展到語音互動領域。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
OpenAI 正在為 ChatGPT 推出代號 GPT Bidi 1 的新一代雙向語音模型,能同時聽與說,不像現有模式必須等對方講完才能回應。
OpenAI 正在為 ChatGPT 推出代號 GPT Bidi 1 的新一代雙向語音模型,能同時聽與說,不像現有模式必須等對方講完才能回應。 GPT Bidi 1 首次在語音端引入三種智能與速度等級:High(深度推理)、Medium(平衡)、Instant(即時),用戶可依任務需求切換。
使用 GPT Bidi 1 時,ChatGPT 的語音氣泡會變成黃色,並在設定中與標準語音、高級語音模式並列為「Bidi(最新)」選項。