GPT Live 1 于 2026 年 9 月 10 日在 OpenAI API 中正式通用可用,而非 9 月 11 日;其核心能力是同时聆听和说话的全双工对话。[1][16] 它旨在更自然地处理停顿、打断、简短应答和话题转向;复杂推理、检索及工具调用可委派给 OpenAI 模型或开发者自建后端。[1][16] 语音层价格为每分钟 0.05 美元,按秒计费且不进位;后端模型和工具的用量另行收费。[16][18]
发布者使用 GPT-5.6 Terra 编辑图片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT-Live-1 full-duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11. It introduced GPT‑Live‑1 as a generally available, full‑duplex voice layer: a model intended to make voice agents more natural by listening and spe. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
OpenAI 于 2026 年 9 月 10 日宣布,GPT-Live-1 已在 API 中以通用可用(GA)形式推出,并非 9 月 11 日。开发者现在可以用它构建更接近自然交谈的语音应用和业务工作流。1
16
传统语音代理通常采用串联式流程:先由语音转文字(STT)识别用户说话内容,语言模型生成文本回复,最后由文字转语音(TTS)将回复念出来。这种架构往往把对话切成清晰、固定的轮次。
GPT-Live-1 的定位则是实时交谈中的统一语音层。OpenAI 表示,它可以一边聆听、一边说话,并能够根据停顿、语速变化和对话走势,实时判断是该回应,还是应继续听下去。1
15
这对实际体验的意义在于:用户中途插话、短暂的“嗯”“对”、思考时的停顿,不必天然被当成识别或流程错误。OpenAI 将这类简短回应称为“反馈性应答”(backchannel),并称该模型可随对话方向的改变作出调整。1
9
GPT-Live-1 并不要求自己完成所有任务。它主要负责实时语音交互的节奏——听、说以及何时轮到谁说话;更耗时或更复杂的工作,则可交由后端模型或代理完成,例如:
OpenAI 提供两种委派方式:可通过 Responses delegation 使用 OpenAI 模型,也可通过 client delegation 连接开发者自己的后端。因此,团队可以自行选择支撑语音体验的推理系统。1
16
在 OpenAI 的产品说明中,GPT-6 Astra 被列为适合较难搜索和推理任务的一个选项;API 开发者也可以接入自己的后端。4
16
换句话说,完整语音代理通常由两层构成:
因此,代理的最终能力、响应方式和成本,取决于这两层的组合,而不只取决于语音模型本身。16
18
OpenAI 还提到,此次 API 发布带来更强的指令遵循能力、自定义语音和电话系统支持。13
GPT-Live-1 的语音会话价格是 每分钟 0.05 美元,按秒计费,不会向上取整到完整分钟。16
18
例如,这一价格覆盖的是实时语音层本身,而不是一个生产级语音代理的一切开销。后端模型推理和工具使用仍会单独计费,因此评估预算时,需要同时计算:
OpenAI 表示,相较 GPT-Realtime-2.1,GPT-Live-1 在其 Full Duplex Bench 测试中提升了 30 个百分点;同时,将 GPT-Live-1 与中等推理强度的 GPT-6 Astra 配对后,在 Tau3 上排名第一。1
不过,所提供的资料没有独立证实原问题中提到的精确轮次切换延迟数字,以及 Tau3 的具体通过率对比。因此,这些具体数值不应被视为已在本文资料范围内得到核实。
OpenAI 列举了数个早期生产环境案例,但这些结果均为相关公司自行报告,应理解为部署实例,而非适用于所有场景的效果保证。
当前提供的证据不足以证实名为“Presence”的托管企业产品接入说法,也不足以确认本次 API 发布具体扩大了哪些口音、方言或语言支持范围。若这些因素会影响采购或落地决策,应以 OpenAI 最新官方文档为准。
GPT-Live-1 的重点不只是让语音“更快”,而是改变语音代理的分工方式:前端语音层可以持续听和说、处理真实对话里的停顿与打断;与此同时,后端系统仍可进行较慢的推理或调用工具。
其语音层以每分钟 0.05 美元、按秒计费的方式提供,成本结构相对直观;但完整代理的实际费用,仍取决于所选后端模型与工具链。1
16
18
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
GPT Live 1 于 2026 年 9 月 10 日在 OpenAI API 中正式通用可用,而非 9 月 11 日;其核心能力是同时聆听和说话的全双工对话。[1][16]
GPT Live 1 于 2026 年 9 月 10 日在 OpenAI API 中正式通用可用,而非 9 月 11 日;其核心能力是同时聆听和说话的全双工对话。[1][16] 它旨在更自然地处理停顿、打断、简短应答和话题转向;复杂推理、检索及工具调用可委派给 OpenAI 模型或开发者自建后端。[1][16]
语音层价格为每分钟 0.05 美元,按秒计费且不进位;后端模型和工具的用量另行收费。[16][18]