GPT‑Live‑1 於 2026 年 9 月 10 日開放 API,每分鐘 0.05 美元,收費只涵蓋前端即時語音層。[3][5] 所謂全雙工,即模型講緊時仍可聽用戶講嘢,目標係更自然處理停頓、插嘴、簡短附和同背景聲,而唔係將每下聲音都當成新指令。[3] 較複雜嘅推理、工具調用同業務操作,可交畀另一個後端模型處理;所以實際成本仲要計後端推理、工具、電話服務等開支。[3][5]
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
OpenAI 嘅 GPT‑Live‑1 係畀開發者接入 API 嘅即時語音模型,主打「全雙工」(full duplex)對話:系統唔使等用戶完全講完先開始反應,亦可以喺自己講緊嘢時繼續聽。佢喺 2026 年 9 月 10 日推出 API,前端語音層定價為每分鐘 0.05 美元;不過,後端推理模型、工具調用、電話系統及其他基建都會另計。 3
5
對做電話客服、訂位、預約或者語言學習產品嘅團隊而言,最大賣點未必純粹係「快」,而係系統可唔可以判斷用戶仲諗緊、只係講句「嗯」、定係真係想打斷回答。
好多語音代理會用串接式流程:先由語音轉文字(speech-to-text)聽寫,再由文字模型生成答案,最後由文字轉語音(text-to-speech)讀出。呢種設計可以有效運作,但每一層都要交接;停頓、轉口風、插嘴同所謂「搶話」處理,都要由應用程式協調。 3
GPT‑Live‑1 則被定位為單一語音模型,會處理輸入同輸出嘅音訊。全雙工設計令佢可以一邊生成語音、一邊繼續聽,目標係更恰當地回應打斷或簡短附和,而唔會將每一下聲音、沉默或旁邊嘅談話,都誤判成必須即刻另開一輪回答。 3
換句話講,重點係對話節奏控制:
OpenAI 將 GPT‑Live‑1 列為用於自然、表達力較強語音對話嘅主打模型,並強調順暢處理打斷嘅能力。 2
3
GPT‑Live‑1 唔代表要自己處理所有商業邏輯。佢可以維持即時語音互動,同時將較深入嘅推理、工具調用或實際操作,委派畀開發者揀選嘅後端模型同 agent 架構。 3
實際上,團隊可以按工作難度分流:
因此,整套系統可理解成兩部分:GPT‑Live‑1 負責「同人傾得自然」,後端負責推理、讀取公司資料同執行動作。要留意嘅係,每分鐘 0.05 美元並唔係完整語音代理嘅總成本;後端模型、工具、電訊服務等都可能增加開支。 3
5
OpenAI 表示,開發者可透過 system prompt 引導模型嘅語氣、語速同對話風格。GPT‑Live‑1 亦會提供逐字稿同回應文字,支援英數字理解、關鍵字偏向(keyword biasing),並提供 turn detection,畀仍然需要明確劃分輪次嘅產品使用。 3
模型目標場景包括長時間對話同電話代理,例如客戶服務、訂座及預約流程。OpenAI 表示,佢可處理沉默同背景噪音,而唔會將每一步內部處理都講出口,較適合真實電話環境。 3
至於支援語言清單、指定口音或方言嘅細緻控制,現有資料未有提供權威而完整嘅規格。團隊如果有粵語、繁簡轉換、特定口音或跨語言部署要求,應先查核最新 API 文件同自行測試,唔好只憑發布介紹作部署假設。
OpenAI 表示,GPT‑Live‑1 喺 Full Duplex Bench 比 GPT‑Realtime‑2.1 高 30 個百分點。呢項評測聚焦互動式語音行為,例如輪流講嘢、停頓、打斷、附和語(backchannel)同背景說話。 3
另外,當 GPT‑Live‑1 配搭 GPT‑6 Astra、並設定為中等推理強度時,OpenAI 表示該組合喺端到端語音代理評測 Tau3 排名第一。Tau3 嘅客戶服務部分涵蓋航空、零售及電訊類嘅口語任務。 3
有二手報道列出精確嘅輪替延遲同 Tau3 分數,但現時提供嘅 OpenAI 一手資料未載有呢啲精確數字。較穩妥嘅解讀係:OpenAI 報告咗明顯嘅互動表現進步,同埋 GPT‑Live‑1 加 Astra 組合嘅 Tau3 第一名結果;呢啲並唔代表每個實際部署都必然做到同一分數。 3
7
OpenAI 提及幾個早期案例:
呢啲個案反映,全雙工最有價值嘅情況,通常係用戶會猶豫、自我修正、講到一半附和,或者想插嘴但唔想由頭再講一次嘅場景。
GPT‑Live‑1 前端語音層收費為每分鐘 0.05 美元。開發者可以自選後端模型同 agent 架構,但後端推理、工具使用及相關服務會獨立計費。 3
5
OpenAI 亦提到可透過 OpenAI Presence,以 GPT‑Live‑1 建立即時語音工作流程。不過,現有資料未說明 Presence 嘅企業資格、商業條款、託管方式或取得途徑,唔應單憑 API 公告就假定相關安排。 3
對評估團隊嚟講,真正要問嘅唔係只得「每分鐘幾錢」,而係:更自然嘅輪替與少啲誤打斷,喺自己嘅客服、銷售或預約流程值幾多;再配合邊個後端模型同工具路徑,先可以喺可靠性同總成本之間取得平衡。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
GPT‑Live‑1 於 2026 年 9 月 10 日開放 API,每分鐘 0.05 美元,收費只涵蓋前端即時語音層。[3][5]
GPT‑Live‑1 於 2026 年 9 月 10 日開放 API,每分鐘 0.05 美元,收費只涵蓋前端即時語音層。[3][5] 所謂全雙工,即模型講緊時仍可聽用戶講嘢,目標係更自然處理停頓、插嘴、簡短附和同背景聲,而唔係將每下聲音都當成新指令。[3]
較複雜嘅推理、工具調用同業務操作,可交畀另一個後端模型處理;所以實際成本仲要計後端推理、工具、電話服務等開支。[3][5]