GPT Live 1は、発話中も相手の音声を聞き続けられるフルデュプレックス型の開発者向け音声モデル。2026年9月10日にAPIで提供開始され、音声フロントエンドは1分0.05ドル。 音声認識・テキストLLM・音声合成を個別につなぐ従来構成とは異なり、割り込み、相づち、間、周囲の雑音を会話の流れとして扱うことを狙う。
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
OpenAIのGPT-Live-1は、録音された発話を順番に処理するような音声対話ではなく、人と人が話す場面に近いリアルタイムのやり取りを目指す、開発者向け音声モデルです。2026年9月10日からAPIで利用でき、音声フロントエンドの料金は1分あたり0.05ドルです。ただし、背後で使う推論モデル、ツール、電話基盤などの料金は別に発生します。3
5
従来の音声エージェントは、一般に「音声認識(STT)→テキストLLM→音声合成(TTS)」という連鎖で構築されます。この方式でも実用的なサービスは作れますが、各段階で受け渡しが起こるため、間の取り方、考え直し、割り込み(バージイン)を別々の部品で調整しなければなりません。3
GPT-Live-1は、入力される音声と出力する音声を単一の音声モデルで扱う設計と位置付けられています。フルデュプレックスとは、AIが話している最中にも相手の音声を聞き続けられることです。これにより、利用者の割り込みや短い相づちに応答しつつ、物音、沈黙、近くの会話のすべてを「新たな発話ターン」として処理する必要がないようにすることを狙います。3
重要なのは、単に音声を速く生成することではありません。利用者がまだ考えているのか、説明を遮ろうとしているのか、「はい」が次の質問ではなく聞いている合図なのかを、会話の文脈で扱う点にあります。OpenAIはGPT-Live-1を、自然で表現力のある音声会話と、滑らかな割り込み処理のための主要モデルと説明しています。2
3
GPT-Live-1は、業務ロジックや複雑な推論をすべて単独で担う必要はありません。リアルタイムの会話を維持しながら、より深い推論、ツール呼び出し、業務アクションを、開発者が選択した別のバックエンドモデルやエージェント基盤へ委任できます。3
設計上は、たとえば次のような使い分けが可能です。
つまり、GPT-Live-1はライブの音声対話を担当し、推論、社内データの参照、実行処理はバックエンドが担う二層構成です。そのため、1分0.05ドルという表示価格だけが音声エージェント全体の費用になるわけではありません。バックエンド推論、ツール、電話サービスなどが総コストに加わります。3
5
OpenAIによると、開発者はシステムプロンプトを通じて、モデルの口調、話す速さ、会話スタイルを指示できます。GPT-Live-1は文字起こしと応答テキストも提供し、英数字の理解、キーワードバイアス、明示的なターン区切りが必要なプロダクト向けのターン検出にも対応します。3
長時間セッションや電話ベースのエージェントも想定されており、用途としてはカスタマーサポートや予約対応が挙げられます。OpenAIは、沈黙や背景雑音がある現実の通話環境でも、内部の処理を逐一読み上げることなく対応できるとしています。3
一方、提示された資料だけでは、対応言語の確定的な一覧や、特定のアクセント・方言を細かく制御するための仕様は確認できません。これらを導入要件にする場合は、最新のAPIドキュメントで確認する必要があります。
OpenAIは、ターン交代、間、割り込み、相づち、背景音声など、双方向の音声会話の振る舞いを評価する「Full Duplex Bench」で、GPT-Live-1がGPT-Realtime-2.1を30ポイント上回ったと報告しています。3
また、推論強度をmediumに設定したGPT-6 Astraと組み合わせた場合、エンドツーエンドの音声エージェント能力を測る「Tau3」で首位になったとしています。Tau3の顧客サービス領域では、航空、小売、通信における音声タスクが対象です。3
ターン交代の遅延時間やTau3スコアの厳密な数値を報じる二次情報もありますが、ここで確認できる一次資料にはその値が示されていません。根拠として確実に言えるのは、OpenAIが対話挙動の大幅な改善と、GPT-Live-1とAstraの組み合わせによるTau3首位を報告していることであり、すべての導入環境で特定のベンチマーク値が再現されることを意味するものではありません。3
7
OpenAIは、以下の音声エージェント導入例を紹介しています。
こうした事例が示すのは、利用者がためらう、言い直す、途中で相づちを打つ、あるいは最初からやり直す意図なしに会話へ割り込むような場面で、フルデュプレックスの価値が大きくなるということです。
GPT-Live-1の料金は、音声フロントエンドレイヤーが1分0.05ドルです。開発者は任意のバックエンドモデルやエージェントフレームワークと組み合わせられますが、それらは音声レイヤーとは別に課金されるため、選ぶ構成が総運用コストを左右します。3
5
OpenAIは、GPT-Live-1を使った音声ワークフローの別の構築方法としてOpenAI Presenceにも言及しています。もっとも、提供資料にはPresenceの企業向け利用条件、商用条件、ホスティング形態、利用開始の手続きは示されていません。API発表だけから、こうした条件を推測することはできません。3
導入を検討するチームにとっての論点は、分単価だけではありません。スムーズなターン交代が業務にどれほどの価値を生むか、そして求める信頼性を満たしつつ、どのバックエンドモデルとツール構成なら総コストを抑えられるか――そこまで含めて評価する必要があります。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
GPT Live 1は、発話中も相手の音声を聞き続けられるフルデュプレックス型の開発者向け音声モデル。2026年9月10日にAPIで提供開始され、音声フロントエンドは1分0.05ドル。
GPT Live 1は、発話中も相手の音声を聞き続けられるフルデュプレックス型の開発者向け音声モデル。2026年9月10日にAPIで提供開始され、音声フロントエンドは1分0.05ドル。 音声認識・テキストLLM・音声合成を個別につなぐ従来構成とは異なり、割り込み、相づち、間、周囲の雑音を会話の流れとして扱うことを狙う。
OpenAIはGPT Realtime 2.1比でFull Duplex Benchが30ポイント向上したと報告。GPT 6 Astraと組み合わせた構成はTau3で首位とした。