GPT-Live-1 : l'API vocale est là, 0,05 $/min en prix d'appel

OpenAI ouvre enfin son modèle vocal full-duplex aux développeurs — j'ai branché mon standard SIP dessus.

Onde audio full-duplex de l'API GPT-Live-1 d'OpenAI reliée à un téléphone

En juillet, je refermais mon test de GPT-Live sur une frustration : la conversation vocale la plus naturelle du marché restait enfermée dans ChatGPT, sans API. Deux mois plus tard, c'est réglé. Le 10 septembre, OpenAI a poussé GPT-Live-1 dans l'API : 0,05 $ la minute, facturé à la seconde et sans arrondi, avec WebRTC, WebSocket et — le morceau que j'attendais — un support téléphonie/SIP natif. J'y ai passé mes soirées depuis jeudi, trunk SIP branché sur un vrai numéro. Verdict : le full-duplex tient ses promesses, mais le tarif affiché n'est que le rez-de-chaussée de la facture.

GPT-Live-1 dans l'API : ce qui change depuis juillet

Rappel pour ceux qui prennent le train en marche. Cet été, j'écrivais que GPT-Live tenait la conversation dans ChatGPT, mais pas encore l'API. Le modèle écoutait et parlait en même temps — le fameux full-duplex — pendant que gpt-realtime, seul accessible aux développeurs, continuait de fonctionner au talkie-walkie. Depuis le 10 septembre, GPT-Live-1 s'ouvre à tout compte API payant (pas de tier gratuit), avec trois portes d'entrée : WebRTC pour le navigateur, WebSocket côté serveur, SIP pour le téléphone.

Douze voix accompagnent le lancement — Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta et Cinder — avec des profils personnalisables : ton, débit et accent se règlent par l'API. Côté chiffres, OpenAI revendique 30 points de mieux que GPT-Realtime-2.1 sur Full Duplex Bench, et la première place du benchmark Tau3 quand GPT-Live-1 est couplé à GPT-6 Astra en effort de raisonnement medium. Chiffres maison, à prendre comme tels. Mais à l'oreille, l'écart avec l'ancien Realtime saute aux tympans dès le premier appel.

Une voix devant, un cerveau derrière : l'architecture à délégation

GPT-Live-1 ne raisonne pas, ou très peu. Choix d'architecture assumé : la couche vocale gère le timing de parole, les interruptions et la prosodie, puis délègue le fond — raisonnement, récupération de données, appels d'outils — à un modèle backend. La doc développeur propose deux modes : la délégation Responses, où GPT-Live appelle directement le modèle que vous avez configuré, et la délégation client, où votre serveur garde la main sur l'exécution et décide de ce qui remonte à la voix.

J'ai commencé par la délégation client, par réflexe de contrôle. Mauvaise idée pour un premier jet : mal synchronisé, mon agent répondait deux fois. La voix meublait pendant que mon backend renvoyait sa propre réponse, et les deux se marchaient dessus. Trois heures à chercher le bug chez moi avant d'admettre que le problème était dans ma boucle, pas dans l'API. Repassé en délégation Responses avec GPT-5.6 Luna en backend : tout s'est calé en vingt minutes. Si vos agents temps réel rament, les réflexes décrits dans mon papier sur la latence des agents GPT-5.6 s'appliquent ici tels quels : streaming systématique, outils rapides, et un backend dimensionné à la question posée.

Combien coûte GPT-Live-1 par appel ? La facture à trois étages

Le 0,05 $/min est un prix plancher, et il faut le lire comme tel. Il couvre uniquement la couche voix. L'étage deux, ce sont les tokens du modèle backend : quasi rien avec Luna (0,20 $ le million de tokens en entrée, 1,20 $ en sortie depuis la baisse de juillet), nettement plus si chaque question part vers Astra en raisonnement lourd. L'étage trois, c'est tout le reste : trunk SIP, outils, base de connaissances, écriture dans le CRM. L'analyse d'eesel résume le piège : « 0,05 $/min est le plancher », et la facturation à la minute paie le temps de parole, pas le résultat — un appel qui traîne coûte plus cher qu'un appel résolu.

Mon calcul sur un appel support de 4 minutes : 0,20 $ de voix, moins d'un centime de tokens avec Luna, 0,04 à 0,08 $ de télécom selon l'opérateur. Environ 0,27 $ l'appel, soit 0,07 $/min chargé. À 1 000 appels par mois, comptez 250 à 300 $, hors CRM et hors les cas où Astra s'en mêle. En face, Grok Voice Think Fast 2.0, testé ici à 0,08 $/min, intègre le raisonnement dans son tarif : sur des appels complexes, l'écart avec OpenAI fond vite. Le modulaire d'OpenAI ne gagne que si vous routez intelligemment.

Le test SIP sur mon standard : barge-in, accents et silences d'Astra

Samedi, j'ai ressorti le trunk SIP du prototype monté pour le tuto standard téléphonique Vapi + n8n et je l'ai pointé vers GPT-Live-1. Premier appel depuis mon portable : le barge-in fonctionne comme promis. Je coupe la parole en pleine phrase, le modèle s'arrête net et enchaîne sur ma relance sans répéter son couplet. Le jour et la nuit avec les pipelines STT-LLM-TTS, où chaque interruption déclenchait un blanc de deux secondes.

Deux réserves après une cinquantaine d'appels de test. Un : sur les douze voix, toutes ne se valent pas en français — à mon oreille, deux ou trois gardent un accent américain marqué. Testez avant de choisir : le paramètre accent aide, il ne fait pas de miracle. Deux : quand le backend part en réflexion longue (Astra sur une question de garantie tordue), la voix meuble — « je vérifie ça pour vous » — et au-delà de cinq ou six secondes, ça s'entend. Le full-duplex masque la latence, il ne la supprime pas.

GPT-Live-1 face à Vapi, Retell et Grok Voice : encore besoin d'une plateforme ?

La question qui fâche. Notre comparatif des plateformes vocales montrait déjà que le prix affiché cache l'empilement voix + modèle + télécom. GPT-Live-1 attaque frontalement la couche du milieu : si vous avez un développeur, l'orchestration Vapi ou Retell devient difficile à justifier sur un cas simple — le POC tient dans un week-end, je l'ai fait. Ce que les plateformes conservent : la gestion des numéros, les analytics d'appels, les fallbacks multi-modèles et la conformité enregistrement. Pour une PME sans équipe technique, elles restent la porte d'entrée raisonnable. Et pour la suite du workflow — pousser le rendez-vous dans l'agenda, créer le ticket, notifier l'équipe — un scénario

entre l'API et vos outils fait le travail sans réécrire un backend.

Verdict : branchez si vous avez un dev, attendez sinon

GPT-Live-1 est le premier modèle vocal API que je laisserais décrocher devant un client. La conversation est fluide, l'architecture à délégation est saine, et le 0,05 $/min facturé à la seconde est honnête — pour ce qu'il couvre. Foncez si vous avez déjà un backend d'agent et un cas d'usage téléphonique chiffré. Passez votre tour si vous n'avez pas de dev sous la main (les plateformes feront mieux, plus vite) ou si votre volume d'appels ne justifie pas 250 $ par mois. Et gardez un œil sur le DevDay du 29 septembre : OpenAI y élargira l'accès à Astra, et le duo Live + Astra est clairement l'attelage que la firme pousse pour 2027.

FAQ

Combien coûte GPT-Live-1 en production ?
0,05 $ par minute pour la couche voix, facturé à la seconde et sans arrondi. Il faut ajouter les tokens du modèle backend (négligeables avec GPT-5.6 Luna, sensibles avec GPT-6 Astra) et la télécom. Un appel de 4 minutes revient à environ 0,25-0,30 $ tout compris. Il n'existe pas de tier gratuit : un compte API payant est obligatoire.
GPT-Live-1 parle-t-il bien français ?
Oui, les douze voix du lancement couvrent plusieurs accents et dialectes, et l'API permet d'ajuster ton, débit et accent. Toutes ne se valent pas en français : lors de mes tests, deux ou trois voix gardaient un accent américain audible. Faites un test de 10 minutes sur chaque voix candidate avant de mettre votre agent devant des clients.
Peut-on brancher GPT-Live-1 sur un numéro de téléphone existant ?
Oui, c'est la vraie nouveauté du 10 septembre : GPT-Live-1 supporte la téléphonie et le SIP en plus de WebRTC et WebSocket. Il vous faut un trunk SIP chez un opérateur (les minutes télécom se paient à part, comptez 0,01 à 0,02 $/min). La configuration reste un travail de développeur, pas un clic dans une interface.
GPT-Live-1 remplace-t-il Vapi ou Retell ?
Pour une équipe avec un développeur, en partie : la brique conversation + téléphonie d'OpenAI rend l'orchestrateur optionnel sur les cas simples. Les plateformes gardent l'avantage sur la gestion des numéros, les analytics, les fallbacks multi-modèles et la conformité. Pour une PME sans profil technique, elles restent le chemin le plus court.
GPT-Live est-il déjà disponible dans ChatGPT ?
Oui, la version grand public tourne dans ChatGPT depuis cet été. La nouveauté de septembre 2026, c'est l'accès API (GPT-Live-1) qui permet d'intégrer ce moteur vocal full-duplex dans vos propres applications, votre site ou votre standard téléphonique.
Partager
Résumé vidéoen cours…