公告发布日期是 2026 年 9 月 10 日,而非 9 月 11 日。[3] GPT‑Live‑1 是已全面开放使用的全双工语音层,能在聆听用户说话的同时进行语音输出。[3] 与“语音转文字—语言模型—文字转语音”的串联式方案相比,它将听与说整合进同一语音模型,减少交接带来的延迟和对话节奏损失。[3]
发布者图片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT Live 1 full duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11.. Topic tags: general web, openai, chatgpt, prompt engineering, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidenc
OpenAI 的这项 API 公告日期为 2026 年 9 月 10 日,不是 9 月 11 日。该公司宣布推出已全面开放使用的 GPT‑Live‑1:一个面向语音应用和业务工作流的全双工语音层,目标是让语音代理更接近自然对话,而不是机械地按回合一问一答。3
传统语音代理通常由三段式流程构成:语音转文字(STT)→ 语言/推理模型 → 文字转语音(TTS)。每一环交接都可能增加延迟,也可能丢失说话时机、上下文或对话节奏等信息。
GPT‑Live‑1 将听和说统一在一个语音模型中。它可以一边听用户说话,一边进行语音输出,因此能够在对话发生的当下回应插话和简短应答;需要更深入推理或调用工具时,则由配套的后端模型在后台完成。3
开发者可将这部分后端工作交给 OpenAI 的模型,例如 GPT‑6 Astra,也可以使用第三方模型,从而按任务自行权衡推理能力、响应速度和成本。3
OpenAI 重点提到,开发者可通过系统提示词控制语气、语速和对话风格。GPT‑Live‑1 还面向电话部署提供支持,并覆盖背景噪声与静默处理、更长会话的可靠性、转写文本与回复文本、字母数字识别以及关键词偏置等能力。3
换句话说,它并非只是一套“声音更自然”的朗读接口,而是把实时聆听、说话时机和对话状态纳入同一语音层;较复杂的判断和执行仍可交给后端模型与工具。
GPT‑Live‑1 的语音会话价格为 每分钟 0.05 美元,按秒计费,不会直接向上取整到整分钟。2
不过,这个价格只涵盖语音层。会话中使用的后端模型以及工具调用会单独计费,因此实际成本应理解为:语音会话费用 + 所选后端模型费用 + 工具使用费用。2
现有材料不足以证实所谓托管“Presence”企业访问细节,也不足以证实关于新增口音、方言和语言支持的具体说法。
OpenAI 表示,在 Full Duplex Bench 测试中,GPT‑Live‑1 相比 GPT‑Realtime‑2.1 提升了 30 个百分点;当 GPT‑Live‑1 与采用中等推理强度的 GPT‑6 Astra 搭配时,在 Tau3 上排名第一。3
不过,所给材料并未独立展示“1.41 秒降至 0.798 秒”的延迟数据,也未展示“86.2% 对 45.7%”的 Tau3 通过率。因此,这两组具体数字不应据此视为已获得独立验证。
OpenAI 列举的早期采用者反馈包括:Yelp 称,将 GPT‑Live‑1 整合至 Yelp Host 和 Hatch 后,轮次衔接和准确性优于此前的语音架构;在订座和餐饮点单电话场景中,接听处理率有所改善,来电者也会说出更完整、更自然的话语。3
语言学习应用 Speak 表示,与以往按回合交互的系统相比,该模型给学习者留下更多思考时间,几乎将导师过早打断学习者的情况减少了 80%。一家医疗公司的联合创始人兼 CTO 则称,替换原有串联式实现后,代码库缩减了 80%,减少了 23,000 行代码,并让与患者的实时对话更自然。3
GPT‑Live‑1 的关键不只是让回答“更快播出来”,而是尝试解决语音交互中最容易显得生硬的问题:人还没讲完就被抢话、插话后系统无法及时调整,以及等待系统逐段处理所带来的停顿。其全双工设计把这些实时互动放在语音层处理,同时保留后端模型完成复杂任务的空间。3
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
公告发布日期是 2026 年 9 月 10 日,而非 9 月 11 日。[3]
公告发布日期是 2026 年 9 月 10 日,而非 9 月 11 日。[3] GPT‑Live‑1 是已全面开放使用的全双工语音层,能在聆听用户说话的同时进行语音输出。[3]
与“语音转文字—语言模型—文字转语音”的串联式方案相比,它将听与说整合进同一语音模型,减少交接带来的延迟和对话节奏损失。[3]