発表日は9月11日ではなく、2026年9月10日。GPT‑Live‑1はAPI向けの全二重音声モデルとして投入された。[3] 音声認識→言語モデル→音声合成という分離型パイプラインと異なり、聞くことと話すことを単一の音声モデルで同時に扱う。[3] 利用者の割り込みや相づちにその場で反応でき、より高度な推論やツール実行はバックエンドモデルに委任できる。[3]
公開者GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT Live 1 full duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11.. Topic tags: general web, openai, chatgpt, prompt engineering, ai. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidenc
まず日付を訂正すると、OpenAIがGPT‑Live‑1のAPI提供を発表したのは2026年9月11日ではなく9月10日です。GPT‑Live‑1は、音声エージェントが人間の会話に近いテンポで応答できるよう設計された、一般提供の全二重(full-duplex)音声レイヤーです。利用者の発話を聞きながら話すことができ、従来のように「相手が話し終えるまで待つ」前提の対話からの転換を目指しています。3
従来の音声エージェントでは一般に、次の処理を連結します。
この方式では、処理の受け渡しごとに遅延が生じやすく、会話の間、タイミング、文脈やリズムが損なわれる場合があります。GPT‑Live‑1は、聞く・話す機能を一つの音声モデルに統合し、こうした分断を減らすアプローチです。3
GPT‑Live‑1は、利用者からの割り込みや相づちが入った際に、それを会話の最中に処理できます。一方で、より深い推論や外部ツールの利用は、ペアとなるバックエンドに任せる構成です。3
開発者は、OpenAIのGPT‑6 Astraのようなバックエンドモデル、またはサードパーティー製モデルを選べます。用途に応じ、推論能力、応答速度、コストのバランスを設計できるという位置付けです。3
OpenAIは開発者向け機能として、次の点も挙げています。3
GPT‑Live‑1の音声セッションは、1分当たり0.05米ドルです。課金は分単位への切り上げではなく秒単位で行われます。2
ただし、この料金は音声レイヤー分です。バックエンドで使用するモデルの利用料やツール実行の料金は別途かかるため、実際の総コストは、選択するモデルとツール構成によって変わります。2
なお、提示された根拠資料では、管理型「Presence」に関するエンタープライズ向けアクセスの詳細や、アクセント・方言・対応言語が大幅に広がったという具体的な主張は確認できません。
OpenAIによると、GPT‑Live‑1はGPT‑Realtime‑2.1比で「Full Duplex Bench」が30ポイント改善しました。また、GPT‑6 Astraを推論努力「medium」で組み合わせた構成は、Tau3で首位になったとしています。3
一方、1.41秒から0.798秒への遅延改善、Tau3の86.2%対45.7%といった個別の数値は、今回提示された根拠資料内では独自に確認できません。そのため、これらの詳細値は未検証として扱うべきです。
早期導入企業の例として、YelpはYelp HostとHatchへの統合後、以前の音声アーキテクチャーに比べて発話の順番の扱いと精度が向上したと説明しています。予約や料理注文の電話では、対応率に意味のある改善が見られ、利用者もより長く自然な発話をするようになったとしています。3
語学学習サービスのSpeakは、学習者が講師役AIの応答前に考える時間をより確保できるようになり、従来のターン制システムと比べて割り込みを約80%減らせたと報告しました。3
また、あるヘルスケア企業の共同創業者兼CTOは、カスケード型の実装を置き換えたことでコードベースを80%簡素化し、2万3,000行のコードを削除できたと述べています。これにより、患者とのリアルタイム会話をより自然にできたとしています。3
全二重の設計は、単に「音声を速く返す」ためのものではありません。会話中の重なり、ためらい、相づち、途中での訂正といった、人同士の対話で自然に起きる要素を扱うための基盤として、GPT‑Live‑1は位置付けられています。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
発表日は9月11日ではなく、2026年9月10日。GPT‑Live‑1はAPI向けの全二重音声モデルとして投入された。[3]
発表日は9月11日ではなく、2026年9月10日。GPT‑Live‑1はAPI向けの全二重音声モデルとして投入された。[3] 音声認識→言語モデル→音声合成という分離型パイプラインと異なり、聞くことと話すことを単一の音声モデルで同時に扱う。[3]
利用者の割り込みや相づちにその場で反応でき、より高度な推論やツール実行はバックエンドモデルに委任できる。[3]