GPT Live 1 est le modèle d’API d’OpenAI conçu pour des conversations vocales full duplex. Contrairement à une chaîne classique reconnaissance vocale → modèle de texte → synthèse vocale, il est conçu pour gérer l’écoute, la parole, les interruptions et les signes d’acquiescement dans un même échange en direct.
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is OpenAI’s GPT-Live-1 voice model, when was it released in the API and at what price, how does its full-duplex single-model architectu. Article summary: GPT‑Live‑1 is OpenAI’s flagship API voice model for natural, expressive, full‑duplex conversations: it can listen and generate speech concurrently, with smooth interruption handling. It entered the API on September 10, 2. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GPT-Live-1 est un modèle vocal destiné aux développeurs qui veulent construire des agents moins mécaniques au téléphone ou dans une application. Disponible dans l’API depuis le 10 septembre 2026, il coûte 0,05 $ par minute pour la couche vocale de premier plan. Le modèle de raisonnement, les outils et l’infrastructure reliés derrière restent à payer en plus. 3
5
Beaucoup d’agents vocaux reposent sur une chaîne en trois étapes : la reconnaissance vocale transforme l’audio en texte, un modèle de langage produit une réponse, puis la synthèse vocale la lit. Cette architecture peut être efficace, mais elle impose des passages de relais. L’application doit alors coordonner les silences, les hésitations, les changements d’intention et les interruptions entre plusieurs composants. 3
GPT-Live-1 est présenté comme un modèle vocal unique qui traite l’audio entrant et sortant. Son fonctionnement full-duplex lui permet de continuer à écouter pendant qu’il parle. L’objectif est qu’il puisse réagir à une interruption ou à un bref acquiescement sans interpréter systématiquement chaque bruit, silence ou voix en arrière-plan comme un nouveau tour de parole obligatoire. 3
L’enjeu ne se limite donc pas à produire de l’audio plus vite. Il s’agit de mieux tenir une conversation : repérer qu’une personne réfléchit encore, qu’elle coupe la parole, ou qu’un simple « oui » sert seulement à montrer qu’elle suit. OpenAI présente GPT-Live-1 comme son modèle de référence pour des échanges vocaux naturels et expressifs, avec une gestion fluide des interruptions. 2
3
GPT-Live-1 n’a pas vocation à assurer seul toute la logique métier. Il peut maintenir l’échange vocal en temps réel tout en déléguant le raisonnement approfondi, les appels d’outils ou les actions à un modèle backend et à un framework d’agents choisis séparément. 3
Cette séparation laisse plusieurs options aux équipes :
L’architecture se compose ainsi de deux couches : GPT-Live-1 pilote l’interaction vocale, tandis que le backend apporte le raisonnement, les données métier et les actions. Conséquence importante : le tarif vocal annoncé ne représente pas le coût complet d’un agent. L’inférence backend, les outils, la téléphonie et les services associés peuvent s’y ajouter. 3
5
Selon OpenAI, les développeurs peuvent orienter le ton, le rythme et le style conversationnel avec le prompt système. GPT-Live-1 fournit aussi des transcriptions et le texte des réponses ; il prend en charge la compréhension de séquences alphanumériques, le biaisage par mots-clés et la détection de tours de parole pour les produits qui ont toujours besoin de frontières explicites entre les interventions. 3
Le modèle vise notamment les longues sessions et les agents téléphoniques, par exemple pour le support client ou les réservations. OpenAI affirme qu’il peut composer avec les silences et le bruit ambiant sans verbaliser chaque étape interne, un comportement utile dans des appels réels et des environnements peu contrôlés. 3
La documentation fournie ne permet pas d’établir une liste définitive des langues prises en charge, ni de détailler les commandes disponibles pour des accents ou dialectes précis. Ces éléments doivent être vérifiés dans la documentation actuelle de l’API avant d’être considérés comme des exigences de déploiement.
OpenAI rapporte une amélioration de 30 points de pourcentage de GPT-Live-1 par rapport à GPT-Realtime-2.1 sur Full Duplex Bench, une évaluation centrée sur les comportements interactifs : alternance des prises de parole, pauses, interruptions, acquiescements et parole en arrière-plan. 3
Associé à GPT-6 Astra avec un effort de raisonnement moyen, GPT-Live-1 arrive également premier sur Tau3, selon OpenAI. Ce benchmark mesure des tâches de bout en bout pour les agents vocaux ; son volet service client couvre des scénarios parlés dans l’aérien, le commerce de détail et les télécommunications. 3
Des sources secondaires avancent des chiffres précis sur la latence de prise de parole et les scores Tau3. Les éléments de source primaire fournis ici ne donnent toutefois pas ces valeurs détaillées. La conclusion la plus solide est donc celle d’un gain important rapporté par OpenAI sur les interactions en conversation et d’une première place sur Tau3 pour la configuration GPT-Live-1 avec Astra, sans présumer qu’un déploiement donné reproduira un score précis. 3
7
OpenAI cite plusieurs premiers déploiements :
Ces exemples illustrent les situations où le full-duplex a le plus d’intérêt : lorsque l’appelant hésite, se corrige, manifeste son accord au milieu d’une phrase ou interrompt l’agent sans vouloir recommencer toute l’interaction.
GPT-Live-1 est facturé 0,05 $ par minute pour la couche vocale de premier plan. Les développeurs peuvent l’associer au modèle backend et au framework d’agents de leur choix, mais ces décisions modifient le coût global puisqu’elles sont facturées séparément de la voix. 3
5
OpenAI mentionne aussi OpenAI Presence comme une autre manière de créer des workflows vocaux reposant sur GPT-Live-1 pour l’interaction en temps réel. Les éléments fournis ne précisent ni les conditions d’éligibilité en entreprise, ni les conditions commerciales, le modèle d’hébergement ou les modalités d’accès à Presence. Ces informations ne doivent donc pas être déduites de la seule annonce API. 3
Pour évaluer le modèle, la vraie question dépasse ainsi le prix à la minute : quel bénéfice apporte une conversation plus fluide au cas d’usage visé, et quelle combinaison de modèle backend et d’outils garantit le niveau de fiabilité nécessaire à un coût total acceptable ?
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
GPT Live 1 est le modèle d’API d’OpenAI conçu pour des conversations vocales full duplex.
GPT Live 1 est le modèle d’API d’OpenAI conçu pour des conversations vocales full duplex. Contrairement à une chaîne classique reconnaissance vocale → modèle de texte → synthèse vocale, il est conçu pour gérer l’écoute, la parole, les interruptions et les signes d’acquiescement dans un même échange en direct.
OpenAI indique un gain de 30 points sur Full Duplex Bench face à GPT Realtime 2.1 et une première place sur Tau3 lorsque GPT Live 1 est associé à GPT 6 Astra.