OpenAIによれば、推論コストの低下により音声モデルの経済性が成立したため、無料ユーザーにも提供可能になったという A。ローンチ時点では、バックエンドにGPT-5.5を使用して推論処理を行う OH。
フルデュプレックス機能は、AI音声の「感触」を3つの具体的な点で変える。OpenAIはローンチ説明会でその動作をデモした。
モデルは会話の途中で遮られると話を止めて聞く態勢に入り、ユーザーに重ねて話し続けることはない。また、ユーザーが考え込んで途中で間を置いた場合、それを検知して割り込まず待つ AT。OpenAIのプロダクトリーダー、Atty Eleti氏は説明会で「これはフルデュプレックスモデルです」と述べている T。
GPT-Liveは難しい質問に遭遇すると、推論処理をOpenAIの最新テキストモデル(GPT-5.5など)に並列で委任する。その間もGPT-Live自体はユーザーとの会話を継続する AT。研究リーダーのKundan Kumar氏は次のように説明している。「GPT-Liveが難しい質問に対して熟考する必要がある場合、推論や複雑なタスクをGPT-5.5に並列委任し、GPT-Liveはユーザーとの会話を続けます」 LT。これにより、ユーザーは音声モデルが重い処理を終えるのを待つ必要がなく、調査結果から口頭での回答への移行がほぼ瞬時に行われる T。
GPT-Liveは会話に画面上のビジュアル要素(画像、図表などのAI生成コンテンツ)を追加することができ、純粋な音声チャットを超えたマルチモーダル体験を提供する HAT。The Vergeは、このモデルが天気、株価、スポーツに関する会話にAI生成画像を補完すると報じている T。
総合すると、これらの機能により、会話は人間同士の自然な対話により近づく。Business Insiderはこのアシスタントを「あなたが話しかぶせることを望んでいる」と表現し B、The Vergeは「黙ることが上手くなった」とヘッドラインに掲げた T。
プレスブリーフィングやメディア報道で名前が挙がった主要な人物は以下の2名である。
ローンチ時点での制限事項として、GPT-Liveは現在ビデオ機能を伴う音声をサポートしていない T。
GPT-Liveの発表は、AI業界全体で異常に忙しい1週間の最中に行われた。
OpenAI自身のエコシステム:
競合他社と関連ニュース: