OpenAI a rendu GPT Live 1 généralement disponible dans son API le 10 septembre 2026. Au lieu d’attendre la fin stricte d’une prise de parole, GPT Live 1 est conçu pour gérer en direct les silences, interruptions, acquiescements et changements de direction dans l’échange.
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did OpenAI announce on September 11, 2026, about launching the GPT-Live-1 full-duplex voice model in its API, including how it differs. Article summary: OpenAI’s API announcement was dated September 10, 2026—not September 11. It introduced GPT‑Live‑1 as a generally available, full‑duplex voice layer: a model intended to make voice agents more natural by listening and spe. Topic tags: general, general web, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
OpenAI a annoncé la disponibilité générale de GPT-Live-1 dans son API le 10 septembre 2026, et non le 11 septembre. Cette sortie donne aux développeurs une couche vocale pour créer des agents capables d’écouter et de parler en même temps, plutôt que de faire avancer l’échange par tours de parole rigides et successifs. 1
16
De nombreux agents vocaux reposent sur une chaîne en trois étapes : la parole est d’abord transcrite en texte, un modèle de langage prépare une réponse, puis un système de synthèse vocale la prononce. GPT-Live-1 est présenté comme une couche vocale unifiée pour gérer la partie conversationnelle en temps réel. 1
La différence concrète concerne la prise de parole. Selon OpenAI, GPT-Live-1 peut écouter tout en parlant, suivre les pauses et les changements de rythme, puis décider s’il doit répondre ou continuer d’écouter. L’objectif est que les interruptions et les brefs signes d’acquiescement — parfois appelés backchannels — soient traités comme des éléments normaux d’une conversation, et non comme des erreurs. 1
9
15
Cela ne signifie pas que le modèle vocal doit accomplir seul toutes les tâches. Une conversation GPT-Live-1 peut se poursuivre pendant qu’un modèle ou agent backend effectue un raisonnement plus approfondi ou utilise des outils. OpenAI prévoit la délégation via Responses avec un modèle OpenAI, ainsi que la délégation côté client vers le propre backend du développeur. Les équipes peuvent donc choisir le système de raisonnement qui soutient leur expérience vocale. 1
16
GPT-Live-1 joue le rôle d’interface conversationnelle : il écoute, parle et gère le rythme de l’échange. Le backend peut, lui, prendre en charge le raisonnement complexe, la recherche d’informations, l’exécution de workflows ou les appels d’outils. Dans les notes produit d’OpenAI, GPT-6 Astra est cité comme une option pour les tâches de recherche et de raisonnement plus difficiles ; les développeurs API peuvent également relier leur propre backend grâce à la délégation côté client. 4
16
Pour les développeurs, cette séparation implique que :
OpenAI met aussi en avant un meilleur suivi des instructions, des voix personnalisées et la prise en charge de la téléphonie. 13
Les sessions vocales GPT-Live-1 coûtent 0,05 $ par minute. La facturation se fait à la seconde, sans arrondi à la minute supérieure. 16
18
Ce prix couvre la session vocale, pas nécessairement le coût total d’un agent vocal. L’utilisation du modèle backend et des outils est facturée séparément. Pour établir un budget de production, il faut donc tenir compte à la fois de la durée des conversations et du travail délégué en arrière-plan. 16
18
OpenAI indique que GPT-Live-1 a progressé de 30 points de pourcentage sur son test Full Duplex Bench par rapport à GPT-Realtime-2.1. L’entreprise précise également que GPT-Live-1 associé à GPT-6 Astra, avec un niveau de raisonnement moyen, est arrivé premier sur Tau3. 1
En revanche, les éléments fournis ne corroborent pas indépendamment les chiffres précis évoqués dans la question initiale concernant la latence de prise de parole ou la comparaison exacte des taux de réussite sur Tau3. Ces valeurs ne doivent donc pas être considérées comme vérifiées ici.
OpenAI présente plusieurs déploiements en production comme illustrations de l’intérêt d’une gestion plus naturelle des tours de parole :
Il s’agit de résultats rapportés par les entreprises concernées, et non d’évaluations indépendantes : ils doivent être lus comme des exemples de déploiement, pas comme des garanties de performance universelles.
Les sources disponibles ne confirment pas l’existence d’un accès entreprise via un produit géré appelé « Presence ». Elles ne permettent pas non plus d’établir une extension précise de la couverture des accents, dialectes ou langues à l’occasion de cette sortie API. Ces éléments devront être vérifiés directement dans la documentation OpenAI à jour avant toute décision d’achat ou d’implémentation.
Le changement majeur apporté par GPT-Live-1 est architectural : l’API propose une couche vocale full-duplex, capable de maintenir un échange naturel pendant qu’un autre système exécute un raisonnement plus lent ou appelle des outils. À 0,05 $ par minute pour la couche vocale, avec une facturation à la seconde, le prix du temps de conversation est simple à estimer. Le coût complet d’un agent dépendra toutefois toujours du modèle backend et des outils retenus. 1
16
18
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
OpenAI a rendu GPT Live 1 généralement disponible dans son API le 10 septembre 2026.
OpenAI a rendu GPT Live 1 généralement disponible dans son API le 10 septembre 2026. Au lieu d’attendre la fin stricte d’une prise de parole, GPT Live 1 est conçu pour gérer en direct les silences, interruptions, acquiescements et changements de direction dans l’échange.
Le tarif de la couche vocale est de 0,05 $ par minute, facturée à la seconde. Les modèles backend et les outils sont facturés séparément.