GPT-Live-1 : l'API vocale est là, 0,05 $/min en prix d'appel
OpenAI ouvre enfin son modèle vocal full-duplex aux développeurs — j'ai branché mon standard SIP dessus.
En juillet, je refermais mon test de GPT-Live sur une frustration : la conversation vocale la plus naturelle du marché restait enfermée dans ChatGPT, sans API. Deux mois plus tard, c'est réglé. Le 10 septembre, OpenAI a poussé GPT-Live-1 dans l'API : 0,05 $ la minute, facturé à la seconde et sans arrondi, avec WebRTC, WebSocket et — le morceau que j'attendais — un support téléphonie/SIP natif. J'y ai passé mes soirées depuis jeudi, trunk SIP branché sur un vrai numéro. Verdict : le full-duplex tient ses promesses, mais le tarif affiché n'est que le rez-de-chaussée de la facture.
GPT-Live-1 dans l'API : ce qui change depuis juillet
Rappel pour ceux qui prennent le train en marche. Cet été, j'écrivais que GPT-Live tenait la conversation dans ChatGPT, mais pas encore l'API. Le modèle écoutait et parlait en même temps — le fameux full-duplex — pendant que gpt-realtime, seul accessible aux développeurs, continuait de fonctionner au talkie-walkie. Depuis le 10 septembre, GPT-Live-1 s'ouvre à tout compte API payant (pas de tier gratuit), avec trois portes d'entrée : WebRTC pour le navigateur, WebSocket côté serveur, SIP pour le téléphone.
Douze voix accompagnent le lancement — Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta et Cinder — avec des profils personnalisables : ton, débit et accent se règlent par l'API. Côté chiffres, OpenAI revendique 30 points de mieux que GPT-Realtime-2.1 sur Full Duplex Bench, et la première place du benchmark Tau3 quand GPT-Live-1 est couplé à GPT-6 Astra en effort de raisonnement medium. Chiffres maison, à prendre comme tels. Mais à l'oreille, l'écart avec l'ancien Realtime saute aux tympans dès le premier appel.
Une voix devant, un cerveau derrière : l'architecture à délégation
GPT-Live-1 ne raisonne pas, ou très peu. Choix d'architecture assumé : la couche vocale gère le timing de parole, les interruptions et la prosodie, puis délègue le fond — raisonnement, récupération de données, appels d'outils — à un modèle backend. La doc développeur propose deux modes : la délégation Responses, où GPT-Live appelle directement le modèle que vous avez configuré, et la délégation client, où votre serveur garde la main sur l'exécution et décide de ce qui remonte à la voix.
J'ai commencé par la délégation client, par réflexe de contrôle. Mauvaise idée pour un premier jet : mal synchronisé, mon agent répondait deux fois. La voix meublait pendant que mon backend renvoyait sa propre réponse, et les deux se marchaient dessus. Trois heures à chercher le bug chez moi avant d'admettre que le problème était dans ma boucle, pas dans l'API. Repassé en délégation Responses avec GPT-5.6 Luna en backend : tout s'est calé en vingt minutes. Si vos agents temps réel rament, les réflexes décrits dans mon papier sur la latence des agents GPT-5.6 s'appliquent ici tels quels : streaming systématique, outils rapides, et un backend dimensionné à la question posée.
Combien coûte GPT-Live-1 par appel ? La facture à trois étages
Le 0,05 $/min est un prix plancher, et il faut le lire comme tel. Il couvre uniquement la couche voix. L'étage deux, ce sont les tokens du modèle backend : quasi rien avec Luna (0,20 $ le million de tokens en entrée, 1,20 $ en sortie depuis la baisse de juillet), nettement plus si chaque question part vers Astra en raisonnement lourd. L'étage trois, c'est tout le reste : trunk SIP, outils, base de connaissances, écriture dans le CRM. L'analyse d'eesel résume le piège : « 0,05 $/min est le plancher », et la facturation à la minute paie le temps de parole, pas le résultat — un appel qui traîne coûte plus cher qu'un appel résolu.
Mon calcul sur un appel support de 4 minutes : 0,20 $ de voix, moins d'un centime de tokens avec Luna, 0,04 à 0,08 $ de télécom selon l'opérateur. Environ 0,27 $ l'appel, soit 0,07 $/min chargé. À 1 000 appels par mois, comptez 250 à 300 $, hors CRM et hors les cas où Astra s'en mêle. En face, Grok Voice Think Fast 2.0, testé ici à 0,08 $/min, intègre le raisonnement dans son tarif : sur des appels complexes, l'écart avec OpenAI fond vite. Le modulaire d'OpenAI ne gagne que si vous routez intelligemment.
Le test SIP sur mon standard : barge-in, accents et silences d'Astra
Samedi, j'ai ressorti le trunk SIP du prototype monté pour le tuto standard téléphonique Vapi + n8n et je l'ai pointé vers GPT-Live-1. Premier appel depuis mon portable : le barge-in fonctionne comme promis. Je coupe la parole en pleine phrase, le modèle s'arrête net et enchaîne sur ma relance sans répéter son couplet. Le jour et la nuit avec les pipelines STT-LLM-TTS, où chaque interruption déclenchait un blanc de deux secondes.
Deux réserves après une cinquantaine d'appels de test. Un : sur les douze voix, toutes ne se valent pas en français — à mon oreille, deux ou trois gardent un accent américain marqué. Testez avant de choisir : le paramètre accent aide, il ne fait pas de miracle. Deux : quand le backend part en réflexion longue (Astra sur une question de garantie tordue), la voix meuble — « je vérifie ça pour vous » — et au-delà de cinq ou six secondes, ça s'entend. Le full-duplex masque la latence, il ne la supprime pas.
GPT-Live-1 face à Vapi, Retell et Grok Voice : encore besoin d'une plateforme ?
La question qui fâche. Notre comparatif des plateformes vocales montrait déjà que le prix affiché cache l'empilement voix + modèle + télécom. GPT-Live-1 attaque frontalement la couche du milieu : si vous avez un développeur, l'orchestration Vapi ou Retell devient difficile à justifier sur un cas simple — le POC tient dans un week-end, je l'ai fait. Ce que les plateformes conservent : la gestion des numéros, les analytics d'appels, les fallbacks multi-modèles et la conformité enregistrement. Pour une PME sans équipe technique, elles restent la porte d'entrée raisonnable. Et pour la suite du workflow — pousser le rendez-vous dans l'agenda, créer le ticket, notifier l'équipe — un scénario entre l'API et vos outils fait le travail sans réécrire un backend.
Verdict : branchez si vous avez un dev, attendez sinon
GPT-Live-1 est le premier modèle vocal API que je laisserais décrocher devant un client. La conversation est fluide, l'architecture à délégation est saine, et le 0,05 $/min facturé à la seconde est honnête — pour ce qu'il couvre. Foncez si vous avez déjà un backend d'agent et un cas d'usage téléphonique chiffré. Passez votre tour si vous n'avez pas de dev sous la main (les plateformes feront mieux, plus vite) ou si votre volume d'appels ne justifie pas 250 $ par mois. Et gardez un œil sur le DevDay du 29 septembre : OpenAI y élargira l'accès à Astra, et le duo Live + Astra est clairement l'attelage que la firme pousse pour 2027.