GPT Live 1 于 2026 年 9 月 10 日通过 API 提供,前端语音层价格为每分钟 0.05 美元;后端推理模型、工具调用和电话等成本另计。[3][5] 它可在生成语音时继续监听,旨在更自然地处理插话、简短附和、停顿和背景声音,而不是把每个声音都当作新的对话轮次。[3] OpenAI 称,GPT Live 1 在 Full Duplex Bench 上较 GPT Realtime 2.1 提高 30 个百分点;与中等推理强度的 GPT 6 Astra 搭配时,在 Tau3 上排名第一。[3]
发布者使用 GPT-5.6 Terra 编辑图片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
对于要做电话客服、预约助手或语音陪练的团队而言,难点往往不只是“把话说出来”,而是让系统知道何时该继续听、何时该停下来,以及用户插话时该如何反应。OpenAI 的 GPT-Live-1 正是为这类实时语音交互而设计的开发者模型。
GPT-Live-1 已于 2026 年 9 月 10 日在 API 中上线。其前端语音层价格为每分钟 0.05 美元;但这并不等于完整语音智能体的总成本,开发者选用的后端推理模型、工具、电话服务及其他基础设施仍会单独计费。3
5
不少语音智能体采用串联式架构:先由语音转文字(STT)把来电者的话转写,再交给语言模型生成文本,最后由文字转语音(TTS)朗读出来。这个方案可以有效工作,但每一环都是一次交接,应用需要自行协调停顿、改口、抢话和对话轮次等细节。3
GPT-Live-1 的定位则是单一的实时语音模型,能够同时处理输入与输出音频。所谓“全双工”,可以简单理解为:系统说话时仍能继续听。这让它可以在用户打断、简短回应“嗯”“对”或周围有背景谈话时,尝试判断这些声音的对话含义,而非机械地将每一次声音、静默都视为必须开启的新一轮对话。3
关键不只是更快出声,而是更好的“对话节奏控制”:识别用户是在思考、确实要插话,还是仅仅作出不需要改写回答的简短附和。OpenAI 将 GPT-Live-1 定位为其面向自然、富表现力语音对话的主力模型,并强调其顺畅的打断处理能力。2
3
GPT-Live-1 不要求单独承担全部业务逻辑。它可以负责维持实时语音互动,同时把复杂推理、工具调用或具体操作委派给开发者选定的后端模型与智能体框架。3
这带来较灵活的系统设计:
因此,完整方案可以拆成两层:GPT-Live-1 负责实时语音对话,后端负责推理、企业数据访问和执行动作。代价是每分钟 0.05 美元只是语音层报价,实际运营成本还要叠加后端推理、工具和通信服务等费用。3
5
OpenAI 表示,开发者可通过系统提示词引导模型的语气、语速和对话风格。GPT-Live-1 还会提供转写文本与回复文本,支持字母数字内容理解、关键词偏置,并提供轮次检测能力,供仍需要明确对话边界的产品使用。3
该模型面向较长的会话和电话型智能体,包括客服、餐厅订位等场景。OpenAI 称,它能够处理静默和背景噪声,而不会把每一步内部处理都念出来;这一点对真实电话环境尤其重要。3
至于特定口音、方言的精细控制,以及完整的支持语言列表,现有材料并未给出可作为部署承诺的明确说明。若这些能力是上线要求,应以最新 API 文档为准。
OpenAI 称,在衡量互动语音行为的 Full Duplex Bench 中,GPT-Live-1 比 GPT-Realtime-2.1 高 30 个百分点。这项评测关注轮次交接、停顿、打断、简短附和和背景语音等互动能力。3
OpenAI 还称,当 GPT-Live-1 与设为中等推理强度的 GPT-6 Astra 配合时,在 Tau3 端到端语音智能体基准中排名第一。Tau3 的客服部分涵盖航空、零售和电信等行业的语音任务。3
部分二手报道提供了轮次交接延迟和 Tau3 分数的精确数值,但所给主要来源摘录并未列出这些具体数字。更稳妥的解读是:OpenAI 报告了显著的互动行为提升,以及 GPT-Live-1 与 Astra 组合在 Tau3 上的第一名结果;实际部署效果不应直接等同于某个固定的基准分数。3
7
OpenAI 列举了若干早期语音智能体应用:
这些案例说明,全双工最有价值的场景通常是用户会犹豫、改口、插话,或在系统说话中间作出简短回应,但并不希望整段交互从头开始的场景。
GPT-Live-1 的前端语音层为每分钟 0.05 美元。开发者可以自由选择后端模型和智能体框架,但后端推理、工具使用以及相关服务会独立影响总成本。3
5
OpenAI 还提到,开发者可借助 OpenAI Presence 在 GPT-Live-1 之上构建语音工作流,由该模型支持实时语音交互。不过,现有材料没有说明 Presence 的企业准入条件、商业条款、托管方式或获取流程,因此不宜仅根据 API 公告推断这些细节。3
对评估团队来说,真正的问题不只是“每分钟多少钱”,而是:更顺畅的轮次交接能给业务流程带来多少价值?又该选择怎样的后端模型与工具路径,才能在可靠性、响应速度与整体成本之间取得平衡?
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
GPT Live 1 于 2026 年 9 月 10 日通过 API 提供,前端语音层价格为每分钟 0.05 美元;后端推理模型、工具调用和电话等成本另计。[3][5]
GPT Live 1 于 2026 年 9 月 10 日通过 API 提供,前端语音层价格为每分钟 0.05 美元;后端推理模型、工具调用和电话等成本另计。[3][5] 它可在生成语音时继续监听,旨在更自然地处理插话、简短附和、停顿和背景声音,而不是把每个声音都当作新的对话轮次。[3]
OpenAI 称,GPT Live 1 在 Full Duplex Bench 上较 GPT Realtime 2.1 提高 30 个百分点;与中等推理强度的 GPT 6 Astra 搭配时,在 Tau3 上排名第一。[3]