OpenAI 於 2026 年 9 月 10 日正式在 API 推出 GPT Live 1。模型可同步聆聽及說話,而推理和工具操作可交由另一個後端模型或代理處理。[1][16] 相較要等用戶講完才回應的傳統語音流程,GPT Live 1 主打處理停頓、打斷、簡短附和及話題轉向,令對話輪替更自然。[1][9][15] 語音層收費為每分鐘 0.05 美元,按秒計費;後端模型和工具另行收費。現有資料支持 OpenAI 的概括基準及早期部署說法,但未核實所有具體延遲和通過率數字。[1][16][18]
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT-Live-1 full-duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11. It introduced GPT‑Live‑1 as a generally available, full‑duplex voice layer: a model intended to make voice agents more natural by listening and spe. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
OpenAI 在 2026 年 9 月 10 日宣布,GPT-Live-1 已在 API 正式推出,日期並非 9 月 11 日。開發者現可用它建立「全雙工」語音代理:系統可以一邊聽用戶說話,一邊作出語音回應,而毋須將每次交談硬切成「你講完、我先答」的回合。1
16
傳統語音代理通常是逐層串接:先把語音轉文字(speech-to-text),再由語言模型生成答案,最後以文字轉語音(text-to-speech)讀出。GPT-Live-1 則被定位為統一處理即時對話的語音層。1
實際體驗上的重點是「輪替」。OpenAI 表示,GPT-Live-1 能同時聆聽和說話,跟到停頓、語速變化及中途插話,並即時判斷應該回答,抑或繼續聽。用戶一句「嗯」、「明白」之類的簡短附和(backchannel),理論上不會再那麼容易被系統當成完整提問或意外打斷。1
9
15
GPT-Live-1 並非一定要獨自完成所有任務。語音對話可以持續進行,同時由後端模型或代理處理較深入的推理、資料檢索、工作流程執行或工具呼叫。
OpenAI 提供兩種委派方式:可透過 Responses delegation 使用 OpenAI 模型,亦可用 client delegation 接駁開發團隊自家的後端。因此,團隊可以自行選擇背後負責推理的系統。1
16
換言之,架構可以拆成兩層:
OpenAI 的產品資料亦提到,GPT-Live-1 有較強的指令跟隨能力、可用自訂聲音,並支援電話系統(telephony)整合。13
GPT-Live-1 的語音工作階段收費為 每分鐘 0.05 美元,以秒計費,不會每次向上捨入至完整一分鐘。16
18
不過,這只是語音層的價格,未必等於整個語音代理的最終成本。後端模型的用量、工具呼叫等均會另外收費;部署時要同時計入通話時間,以及系統在背後所做的推理和工具工作。16
18
OpenAI 表示,GPT-Live-1 在其 Full Duplex Bench 測試中,比 GPT-Realtime-2.1 高 30 個百分點;而 GPT-Live-1 配合 GPT-6 Astra、使用中等推理強度時,在 Tau3 排名第一。1
但目前提供的資料未有獨立列出原提問所述的輪替延遲具體數字,亦未能核實 Tau3 的精確通過率比較。因此,這些精確數字不應在此視為已獲驗證的資料。
OpenAI 列出幾個已投入生產環境的例子,但要留意,以下均屬公司自行報告的成果,不能當成所有部署都必然達到的保證:
現有材料未能證實經一個名為「Presence」的託管產品提供企業存取,也未能確認這次 API 推出是否擴展了特定口音、方言或語言支援。若用於採購或正式部署,這些項目應直接查閱 OpenAI 最新文件再作確認。
GPT-Live-1 的核心轉變在於架構:它把可同步聽講的全雙工語音層帶到 API,讓代理可在較自然的互動中維持對話,同時把較慢、較複雜的推理和工具工作交給另一個系統處理。每分鐘 0.05 美元、按秒計費,令語音時間的預算較容易估算;但整體帳單仍視乎所選的後端模型和工具。1
16
18
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
OpenAI 於 2026 年 9 月 10 日正式在 API 推出 GPT Live 1。模型可同步聆聽及說話,而推理和工具操作可交由另一個後端模型或代理處理。[1][16]
OpenAI 於 2026 年 9 月 10 日正式在 API 推出 GPT Live 1。模型可同步聆聽及說話,而推理和工具操作可交由另一個後端模型或代理處理。[1][16] 相較要等用戶講完才回應的傳統語音流程,GPT Live 1 主打處理停頓、打斷、簡短附和及話題轉向,令對話輪替更自然。[1][9][15]
語音層收費為每分鐘 0.05 美元,按秒計費;後端模型和工具另行收費。現有資料支持 OpenAI 的概括基準及早期部署說法,但未核實所有具體延遲和通過率數字。[1][16][18]