OpenAI 的 API 公告日期是 2026 年 9 月 10 日,而非 9 月 11 日。 GPT‑Live‑1 是已正式推出的全雙工語音層,可同時聆聽與說話,而不是等待每一輪對話結束才處理。[3] 相較於語音轉文字、語言模型、文字轉語音的串接式架構,整合式設計旨在減少交接延遲,以及對語氣、時機與對話節奏的流失。[3]
發布者圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT Live 1 full duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11.. Topic tags: general web, openai, chatgpt, prompt engineering, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidenc
OpenAI 的 API 公告實際發布於 2026 年 9 月 10 日,不是 9 月 11 日。該公司宣布將 GPT‑Live‑1 以正式可用(generally available)的方式納入 API,定位為可讓語音代理更接近自然交談的「全雙工」語音層。3
傳統語音代理多採串接式架構:先將語音轉成文字(speech-to-text,STT),交給語言/推理模型產生文字回覆,再以文字轉語音(text-to-speech,TTS)念出來。每次元件交接都可能增加延遲,也較容易失去說話時機、上下文線索與自然對話的節奏。3
GPT‑Live‑1 則把聆聽與說話整合到同一個語音模型中。它可以一邊聽使用者說話、一邊說話,而非把對話切成明確、輪流完成的回合。3
這項設計帶來的重點包括:
OpenAI 指出,GPT‑Live‑1 提供系統提示詞(system prompt)控制,可調整語氣、說話速度與對話風格。官方也列出電話部署、背景雜音與靜音處理、長時間連線穩定性、逐字稿與回覆文字、英數字辨識,以及關鍵字偏置(keyword biasing)等功能或支援方向。3
GPT‑Live‑1 語音連線的價格為 每分鐘 0.05 美元,並採按秒計費,不會直接進位到完整分鐘。2
不過,這個價格只涵蓋語音層;後端模型的推理用量及工具使用費,仍會另外計算。因此,一次語音互動的總成本,會是 GPT‑Live‑1 語音費加上所選後端模型與工具的費用。2
現有資料不足以證實所謂受管理的「Presence」企業存取細節,也不足以支持「新增或擴充特定口音、方言與語言」的具體說法。
OpenAI 表示,在 Full Duplex Bench 評測中,GPT‑Live‑1 相較 GPT‑Realtime‑2.1 提升 30 個百分點;而 GPT‑Live‑1 搭配 GPT‑6 Astra、使用中等推理強度時,在 Tau3 排名第一。3
但提供的來源並未獨立列出 1.41 秒對 0.798 秒的延遲數字,也未列出 Tau3 的 86.2% 與 45.7% 通過率。因此,這些精確數值目前不能視為已由所提供證據驗證。
OpenAI 引述 Yelp 表示,將 GPT‑Live‑1 導入 Yelp Host 與 Hatch 後,相較原有語音架構,對話輪替與準確性都有改善;在訂位與餐點訂購來電情境中,接聽處理率明顯提升,來電者也更常以完整、自然的句子表達需求。3
語言學習服務 Speak 則表示,模型能讓學習者在導師回覆前保有更多思考時間,與過去逐回合系統相比,插話情況減少近 80%。3
另有一家醫療保健公司的共同創辦人兼技術長指出,以 GPT‑Live‑1 取代串接式實作後,程式碼庫簡化約 80%,刪除了 23,000 行程式碼,並使即時病患對話更自然。3
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
OpenAI 的 API 公告日期是 2026 年 9 月 10 日,而非 9 月 11 日。
OpenAI 的 API 公告日期是 2026 年 9 月 10 日,而非 9 月 11 日。 GPT‑Live‑1 是已正式推出的全雙工語音層,可同時聆聽與說話,而不是等待每一輪對話結束才處理。[3]
相較於語音轉文字、語言模型、文字轉語音的串接式架構,整合式設計旨在減少交接延遲,以及對語氣、時機與對話節奏的流失。[3]