GPT Live 1 於 2026 年 9 月 10 日在 API 上線,前端語音層定價為每分鐘 0.05 美元;推理模型、工具與電話服務等費用另計。[3][5] 全雙工設計可一面接收使用者聲音、一面產生語音,更著重處理插話、停頓、簡短附和與背景聲等真實對話節奏。[3] OpenAI 表示,它在 Full Duplex Bench 比 GPT Realtime 2.1 高出 30 個百分點;搭配 GPT 6 Astra 的中等推理強度時,於 Tau3 排名第一。[3]
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
語音代理最常見的挫折,往往不是「聽不懂」,而是「不會聊天」:使用者還在想,系統就搶著接話;使用者只說一聲「嗯」,系統卻把它當成新問題。OpenAI 推出的 GPT-Live-1,瞄準的正是這類互動節奏問題。
GPT-Live-1 是提供給開發者的全雙工(full-duplex)語音模型,2026 年 9 月 10 日在 API 開放使用。前端語音層的價格為每分鐘 0.05 美元;連接於後方的推理模型、工具呼叫、電話系統與其他基礎設施,則需另外計費。3
5
傳統語音代理通常是串接式流程:先由語音轉文字(STT)辨識說話內容,再交給語言模型產生文字回答,最後透過文字轉語音(TTS)念出來。這種架構可行,但每一段交接都要自行協調停頓、改口、插話與說話時機。3
GPT-Live-1 的定位則是單一語音模型,同時處理輸入與輸出的音訊。它能在說話時繼續聆聽,因而可對使用者插話或簡短附和做出較自然的反應,而不是把每段聲音、沉默或旁人的談話都判定為必須重新開始的一輪對話。3
這對電話客服、訂位、預約等情境尤其重要。使用者可能會猶豫、自我修正,或在系統說話途中插入一句補充;好的體驗不是一味快速回答,而是能判斷對方是否真的講完。OpenAI 將 GPT-Live-1 定位為主打自然、富表情,且能順暢處理插話的語音對話模型。2
3
GPT-Live-1 不必獨自處理所有商業邏輯。開發團隊可讓它維持即時語音互動,再將深度推理、工具呼叫或實際操作委派給另一個後端模型與代理框架。3
這代表團隊可以依任務分流:
換言之,GPT-Live-1 管理「怎麼自然地說話與聽話」,後端則提供「怎麼推理、查資料與採取行動」。因此,每分鐘 0.05 美元不是整個語音代理的全部成本;後端推理、工具與電信服務都可能增加總支出。3
5
OpenAI 表示,開發者可透過系統提示詞設定語氣、語速與對話風格。GPT-Live-1 也能提供逐字稿與回覆文字,支援英數字串辨識、關鍵字偏向(keyword biasing),並提供輪次偵測功能,供仍需要明確對話邊界的產品使用。3
模型設計目標包含長時間工作階段與電話型代理,適用於客服、餐廳訂位等流程。OpenAI 指出,它能處理沉默與背景噪音,而不會把每個內部判斷都說出口。3
不過,現有資料並未列出確定的支援語言清單,也沒有充分說明開發者對特定口音或方言可使用哪些細部控制。若這些項目是上線門檻,仍應以最新 API 文件為準。
OpenAI 表示,GPT-Live-1 在評估輪替說話、停頓、插話、附和與背景語音等互動行為的 Full Duplex Bench 上,比 GPT-Realtime-2.1 提升 30 個百分點。3
若搭配 GPT-6 Astra,並設定為中等推理強度,OpenAI 也表示該組合在 Tau3 拿下第一。Tau3 是端到端語音代理基準測試,其客服項目涵蓋航空、零售與電信業的語音任務。3
部分二手報導列出精確的輪替延遲與 Tau3 分數,但目前提供的 OpenAI 一手資料摘錄沒有這些具體數字。因此,較審慎的結論是:OpenAI 宣稱其互動行為有顯著改善,且 GPT-Live-1 搭配 Astra 的組合取得 Tau3 領先成績;實際部署不應直接預設能複製特定基準分數。3
7
OpenAI 列出幾個早期導入案例:
這些案例的共同點是:使用者不會完全依照「你講完、我再講」的理想輪次互動。全雙工的價值,就在於系統能承受這些自然但凌亂的對話細節。
GPT-Live-1 的前端語音層費率是每分鐘 0.05 美元。開發者可自由選擇後端模型與代理框架,但這些選擇會影響整體營運成本,因為它們不包含在語音層費率內。3
5
OpenAI 也提到,可透過 OpenAI Presence 建立以 GPT-Live-1 驅動即時語音互動的工作流程。不過,現有資料未交代 Presence 的企業適用資格、商業條款、託管方式或存取流程,不能僅依 API 公告推定其細節。3
對評估導入的團隊而言,真正的問題不只是「每分鐘多少錢」,而是更順暢的交談能否提升完成率、降低轉人工比例或改善客戶體驗;接著再選擇能在可靠性、延遲與成本之間取得平衡的後端模型與工具路徑。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
GPT Live 1 於 2026 年 9 月 10 日在 API 上線,前端語音層定價為每分鐘 0.05 美元;推理模型、工具與電話服務等費用另計。[3][5]
GPT Live 1 於 2026 年 9 月 10 日在 API 上線,前端語音層定價為每分鐘 0.05 美元;推理模型、工具與電話服務等費用另計。[3][5] 全雙工設計可一面接收使用者聲音、一面產生語音,更著重處理插話、停頓、簡短附和與背景聲等真實對話節奏。[3]
OpenAI 表示,它在 Full Duplex Bench 比 GPT Realtime 2.1 高出 30 個百分點;搭配 GPT 6 Astra 的中等推理強度時,於 Tau3 排名第一。[3]