Grok Voice Think Fast 2.0 : l'agent vocal xAI à 0,08 $/min au test

xAI vise votre standard téléphonique et vos hotlines avec un modèle voix qui raisonne pendant qu'il parle.

Interface d'un agent vocal IA Grok Voice Think Fast 2.0 en conversation téléphonique

xAI a sorti le 29 juillet un modèle vocal qui ne se contente plus de lire un texte à voix haute : Grok Voice Think Fast 2.0 écoute, réfléchit et parle en même temps. Tarif affiché : 0,08 $ la minute audio. Cible assumée : les standards téléphoniques, les hotlines et les agents de prise de rendez-vous. Autrement dit, le terrain où une PME perd des heures chaque semaine.

On l'a passé au crible des chiffres publiés par xAI et des premiers retours. Voici ce qui tient, ce qui reste à prouver, et pour qui ça change quelque chose.

Un modèle vocal qui raisonne pendant qu'il parle

La vraie nouveauté n'est pas la voix, c'est le timing. Les agents vocaux classiques fonctionnent en tuyau : ils transcrivent votre phrase, l'envoient à un modèle de texte, récupèrent la réponse, puis la vocalisent. Chaque étape ajoute du délai. Résultat : ces blancs gênants où l'IA « réfléchit » avant de répondre.

Grok Voice Think Fast 2.0 fait tourner le raisonnement en parallèle de la parole. Concrètement, le temps avant le premier son tombe à 0,70 seconde, contre 1,25 s sur la version précédente. Et selon xAI, l'usage de tokens de raisonnement descend à 0,4× la ligne de base : les appels d'outils (vérifier un stock, ouvrir un dossier client) « s'exécutent souvent avant que l'agent ait fini sa première phrase ». Pour un appel entrant, c'est la différence entre un robot qu'on raccroche et une conversation qu'on tient.

xAI dit aussi avoir poussé un apprentissage par renforcement intensif pour rendre l'échange naturel : phrases plus courtes, une question à la fois, moins de bavardage. C'est le genre de détail qui fait qu'un agent vocal passe, ou pas, sur une ligne de support.

Les benchmarks : devant GPT-Realtime, sauf sur un point

Sur le score global maison de xAI, Think Fast 2.0 monte à 82,9 %, contre 75,7 % pour la v1.0. Face à la concurrence directe : GPT-Realtime-2.1 est donné à 79,1 % et Gemini 3.1 Flash à 69,5 %. La capacité agentique — enchaîner les actions, gérer une tâche en plusieurs étapes — grimpe à 56,5 % (contre 52,1 % avant).

Un bémol honnête : sur le score purement conversationnel, xAI se donne 95,1 %, soit légèrement sous GPT-Realtime-2.1 (95,7 %). L'écart est mince, mais il existe. Traduction : pour du bavardage fluide, OpenAI reste au niveau ; c'est sur le raisonnement et l'action que Grok prend l'avantage.

Rien de tout ça n'est audité par un tiers pour l'instant. Ce sont les chiffres du constructeur. À prendre comme une direction, pas comme un verdict gravé. Nous avions déjà noté ce réflexe de prudence en décortiquant les benchmarks avantageux de Grok 4.5 : xAI communique fort, la réalité terrain se vérifie ensuite.

La transcription : le vrai coup dur pour ElevenLabs et Deepgram

C'est là que le chiffre pique. xAI affiche une précision de transcription 1,5 à 2× meilleure que Deepgram Nova 3 et ElevenLabs Scribe v2, deux références du marché. Et 1,4× mieux que la version précédente, sur 24 langues évaluées.

Le détail qui compte pour un standard téléphonique : dans les conditions dégradées — bruit de fond, compression téléphonique, accents variés — l'avantage grimperait à près de 10× face aux systèmes de reconnaissance vocale les plus connus. Or c'est exactement le contexte d'un appel client : ligne mobile pourrie, cuisine de restaurant en fond, interlocuteur qui mange ses mots. Si le chiffre tient, c'est le point qui justifie à lui seul de tester.

Combien coûte Grok Voice Think Fast 2.0 en France

Le tarif public est de 0,08 $ la minute audio, facturé à l'usage via l'API xAI. Certaines sources évoquent 0,05 $/min pour un usage « agent » selon la configuration — à confirmer une fois la grille détaillée en ligne. À 0,08 $, comptez environ 4,80 $ pour une heure d'appel cumulée.

Pour situer : sur le marché des plateformes d'agents vocaux, le coût réel dépasse presque toujours le prix affiché, une fois la téléphonie, la TTS et l'orchestration empilées. On l'avait chiffré en détail dans notre comparatif des agents vocaux Vapi, Retell et ElevenLabs. Grok Voice se positionne comme le moteur, pas comme la plateforme complète : il vous faudra encore brancher la téléphonie et vos outils métier autour.

Agent Builder : brancher la voix sur vos process

Le modèle arrive dans l'Agent Builder de xAI, l'outil qui permet d'assembler un agent sans tout coder. L'alias grok-voice-latest bascule automatiquement sur la 2.0 le 5 août 2026 : si vous utilisez déjà la v1, préparez-vous à la mise à jour.

Le test le plus parlant vient de la maison : xAI l'a déployé sur le service téléphonique de Starlink et rapporte une hausse de la conversion commerciale et du taux de résolution sans passage humain. C'est un cas d'usage massif, avec un volume d'appels et un support technique costaud — pas exactement le quotidien d'une TPE, mais un signal sur ce que le modèle encaisse.

Pour une PME, la logique est la même que pour tout agent vocal : le modèle ne fait pas tout seul le lien avec votre agenda, votre CRM ou votre base de stock. Il faut orchestrer. Un outil no-code comme Make permet de connecter l'agent aux briques de votre back-office (envoi d'e-mail de confirmation, création de fiche, notification Slack) sans écrire de code. C'est la partie qu'on sous-estime toujours au démarrage.

Si vous voulez voir à quoi ressemble un standard téléphonique IA monté de bout en bout, notre tuto pas-à-pas avec Vapi et n8n donne le squelette complet — moteur voix, téléphonie, automatisations.

Grok Voice face à GPT-Live et aux voix TTS

Attention à ne pas confondre deux familles d'outils. Grok Voice Think Fast 2.0 est un modèle speech-to-speech pour agents : il tient une conversation, appelle des outils, raccroche. Ce n'est pas la même chose qu'une simple synthèse vocale (TTS) pour lire un script ou doubler une vidéo.

Côté conversation, son concurrent frontal est GPT-Live d'OpenAI et son API Realtime, qui garde un léger avantage sur le pur naturel du dialogue. Côté voix off et lecture de contenu, on reste sur le terrain d'ElevenLabs ou de Voxtral — un match qu'on avait tranché dans notre comparatif Voxtral vs ElevenLabs. Grok Voice ne joue pas dans cette catégorie ; il vise l'appel entrant et sortant, pas le podcast.

Notre verdict après lecture des chiffres

Sur le papier, Grok Voice Think Fast 2.0 vise juste : latence sous la seconde, raisonnement en parallèle, et surtout une transcription qui promet de tenir dans le bruit d'une vraie ligne téléphonique. À 0,08 $/min, le ticket d'entrée est raisonnable pour tester un cas d'usage précis — prise de rendez-vous, qualification d'appels, support de premier niveau.

Les réserves : les benchmarks sont ceux du constructeur, sans audit externe à ce stade ; le naturel conversationnel reste un cran sous GPT-Realtime ; et l'ancrage américain de xAI pose la question habituelle de la souveraineté des données. Grok Voice est un moteur, pas une solution clé en main : la valeur réelle dépendra de votre capacité à l'orchestrer autour de vos outils.

Pour qui ? Les PME avec un volume d'appels répétitifs et des équipes déjà à l'aise avec l'API ou un builder no-code. Pour qui pas ? Ceux qui cherchent une voix off pour vidéo (mauvais outil), ou qui manipulent des données de santé et sensibles sans cadre juridique béton (à éviter tant que l'hébergement n'est pas clarifié). Le bon réflexe : un pilote sur une seule ligne, deux semaines, chiffres à l'appui, avant de généraliser.

FAQ

Combien coûte Grok Voice Think Fast 2.0 ?
Le tarif public est de 0,08 $ la minute audio, facturé à l'usage via l'API xAI. Certaines sources mentionnent 0,05 $/min pour un usage agent selon la configuration. Comptez environ 4,80 $ pour une heure d'appel cumulée. À ce prix s'ajoutent la téléphonie et l'orchestration si vous montez un vrai standard.
Grok Voice est-il meilleur que GPT-Realtime d'OpenAI ?
Selon les benchmarks de xAI, oui sur le score global (82,9 % contre 79,1 %) et sur la capacité agentique. Mais GPT-Realtime-2.1 garde un léger avantage sur le pur naturel de la conversation (95,7 % contre 95,1 %). L'écart est mince : Grok prend l'avance sur le raisonnement et l'action, OpenAI reste au niveau sur le dialogue fluide.
Grok Voice Think Fast 2.0 fonctionne-t-il en français ?
Oui. Le modèle supporte 24 à 25 langues, dont le français, et xAI met en avant sa robustesse face aux accents variés et aux conditions dégradées (bruit, compression téléphonique). La précision de transcription serait 1,5 à 2× meilleure que Deepgram Nova 3 et ElevenLabs Scribe v2.
Comment tester Grok Voice pour un standard téléphonique de PME ?
Le modèle est disponible dans l'Agent Builder de xAI et via l'API. Le plus simple : monter un pilote sur une seule ligne (prise de rendez-vous ou qualification), brancher la téléphonie et votre back-office via un outil no-code comme Make, et mesurer sur deux semaines le taux de résolution sans humain avant de généraliser.
Quelle est la différence avec un outil de voix off comme ElevenLabs ?
Grok Voice est un modèle conversationnel speech-to-speech : il tient un dialogue, appelle des outils, gère les interruptions. ElevenLabs ou Voxtral sont surtout des moteurs de synthèse vocale (TTS) pour lire un texte ou doubler une vidéo. Ce ne sont pas les mêmes usages : l'un pour l'appel téléphonique, l'autre pour le contenu enregistré.
Partager
Résumé vidéoen cours…