Gemini 3.7 Flash face à GPT-5.6 Terra : 3× moins cher, le hic 2027

Le workhorse le plus rapide du marché, mais son prix promo expire dans quatre mois.

Comparatif Gemini 3.7 Flash contre GPT-5.6 Terra : prix, vitesse et benchmarks

Google a lâché Gemini 3.7 Flash le 13 août, sans keynote, juste une note de version et un prix cassé. J'ai basculé deux workloads de prod dessus dans la foulée. En face : GPT-5.6 Terra, le cheval de trait qu'OpenAI a sorti le 9 juillet et sur lequel tournent une bonne partie de mes agents. Voici ce que ça donne quand c'est moi qui paie la facture à la fin du mois.

Précision de vocabulaire d'abord. On parle ici des workhorses : les modèles rapides et pas chers qu'on met en production pour du volume, pas les monstres de raisonnement type Opus 5 ou GPT-5.6 Sol qu'on sort une fois par semaine sur un problème dur. C'est cette catégorie-là qui fait réellement tourner un back-office, un pipeline de triage ou une flotte d'agents. On avait déjà passé la génération précédente au crible dans notre comparatif des workhorses de la rentrée ; la 3.7 change assez la donne pour justifier un nouveau round. Notre round précédent, Gemini 3.6 Flash contre Luna, est ici.

Gemini 3.7 Flash : ce qui bouge vraiment depuis la 3.6

Sur le papier, Google vend une mise à jour incrémentale. En pratique, le saut est net sur deux axes qui comptent pour des tâches de pro. Le premier, c'est l'agentique : la 3.7 monte à 30,4 % sur AutomationBench (le benchmark maison qui mesure l'automatisation de workflows d'entreprise) contre 17,0 % pour la 3.6. Presque le double. Le second, c'est le code agentique : 65,3 % sur DeepSWE v1.1 d'après les évals de Google, contre 49,0 % pour la version d'avant. Là aussi, un vrai delta.

Le reste ne bouge pas : fenêtre de contexte d'environ 1,05 million de tokens, entrées texte/image/audio/vidéo, sortie maximale de 64 000 tokens. Sur l'Artificial Analysis Intelligence Index, le modèle marque 56 — un point sous Terra. Autrement dit : à ce niveau de gamme, l'intelligence brute est un quasi match nul. Ce qui départage, c'est le prix, la vitesse et la façon dont chacun tient un agent.

Combien coûte chaque modèle en France (et le piège de janvier 2027)

C'est là que Google frappe fort. Voici les tarifs API, hors remises volume, convertis en dollars par million de tokens :

CritèreGemini 3.7 FlashGPT-5.6 Terra
Sortie13 août 20269 juillet 2026
Entrée (input)0,75 $/M (promo) → 1,50 $ au 1/1/20272,00 $/M
Sortie (output)3,75 $/M (promo) → 7,50 $12,00 $/M
Input caché0,20 $/M
Contexte~1,05 M tokens~1,05 M tokens
Sortie max64 000 tokens128 000 tokens
Vitesse~340 tokens/s~115 tokens/s
Intelligence Index5657

Sur un job typique — beaucoup d'entrée, sortie courte — Gemini 3.7 Flash revient à environ un tiers du prix de Terra. Sur mon pipeline de classification (gros contexte, réponse en JSON de quelques centaines de tokens), je suis passé d'à peu près 41 € à 14 € par tranche de 100 000 requêtes. C'est le genre d'écart qui change une décision de budget, pas juste une ligne de facture. Pour situer l'ordre de grandeur sur du volume brut, notre tuto pour trier 10 000 emails en batch donnait déjà des chiffres au sol avec la génération Luna. Le tuto batch, avec les coûts réels, est ici.

Sauf qu'il y a une astérisque, et elle est grosse. Le tarif de 0,75 $/3,75 $ est un prix de lancement valable jusqu'au 31 décembre 2026. Au 1er janvier 2027, Google double : 1,50 $ en entrée, 7,50 $ en sortie. Terra reste plus cher même après, mais l'écart passe de « 3× moins cher » à « ~1,4× moins cher ». Si vous dimensionnez un budget annuel ou un contrat SaaS sur la base du prix promo, vous vous préparez une mauvaise surprise au premier trimestre 2027.

340 contre 115 tokens/seconde : la vitesse qui change le workflow

Le chiffre qui m'a le plus marqué à l'usage, ce n'est pas le prix, c'est le débit. Gemini 3.7 Flash crache environ 340 tokens par seconde, contre ~115 pour Terra d'après les mesures d'Artificial Analysis. Trois fois plus vite. Sur un agent qui enchaîne dix appels avant de rendre un résultat, ça ne se ressent pas sur une ligne de log — ça se ressent sur le temps de bout en bout d'une tâche.

Concrètement : un agent de résumé de tickets qui mettait 22 secondes à boucler sous Terra tombe à 8 secondes sous Gemini. Pour un usage temps réel — un assistant qui répond pendant qu'un opérateur attend — c'est la différence entre « fluide » et « il rame ». Terra affiche par ailleurs un time-to-first-token d'environ 3,7 secondes, ce qui pique quand l'utilisateur regarde un curseur clignoter. Si votre cas d'usage est interactif, la vitesse de Gemini n'est pas un bonus, c'est le critère numéro un.

Benchmarks coding et agents : Terra creuse l'écart sur le dur

Maintenant, la contre-attaque d'OpenAI. Sur le code réellement difficile, Terra garde la main. DeepSWE v1.1 : 69,6 % contre 65,3 %. Terminal-bench 2.1 : 87,4 % contre 85,8 %. Rien de spectaculaire pris isolément, mais sur des tâches d'ingénierie longues — plusieurs fichiers, plusieurs étapes, un état à maintenir — ces quelques points se traduisent par moins de reprises manuelles. C'est le retour que confirme aussi le comparatif d'ExplainX : Gemini pour le code agentique à petit budget, Terra pour les tâches d'ingénierie à horizon long.

L'autre atout de Terra, c'est le Programmatic Tool Calling, sa fonction signature côté Responses API : des boucles d'appels d'outils déterministes, pensées pour les frameworks d'agents. En clair, quand un agent doit orchestrer cinq outils dans un ordre précis, Terra dérape moins. La fonction équivalente de Gemini fait le job, mais avec un peu plus de retries sur mes tests d'orchestration. On a détaillé le Programmatic Tool Calling et son impact sur la facture de tokens ici.

Le plafond de sortie à 64K qui m'a cassé un agent

Voilà le truc que je n'avais pas vu venir. J'ai voulu migrer un agent de génération de documents — des contrats structurés, du JSON long — de Terra vers Gemini pour économiser. Résultat : mes sorties se faisaient tronquer en plein milieu, le parser en aval plantait, et j'ai perdu une bonne heure à croire que mon prompt déconnait. Le coupable : Gemini 3.7 Flash plafonne à 64 000 tokens de sortie, contre 128 000 pour Terra. Pour du texte court en masse, invisible. Pour de la génération longue et structurée, c'est rédhibitoire.

J'ai fini par router : les jobs à sortie longue restent sur Terra, tout le high-volume à réponse courte part sur Gemini. Pas élégant, mais c'est la config qui minimise ma facture sans casser la prod.

Gemini 3.7 Flash ou GPT-5.6 Terra : mon choix selon le job

Mon verdict après avoir fait tourner les deux en conditions réelles : il n'y a pas de gagnant absolu, il y a un gagnant par cas d'usage. Prenez Gemini 3.7 Flash si votre workload est du volume à réponse courte, du temps réel où la latence se voit, ou de l'automatisation de workflows (son point fort sur AutomationBench n'est pas du marketing). Prenez GPT-5.6 Terra si vous faites du code d'ingénierie sérieux, de l'orchestration d'agents multi-outils, ou de la génération de documents longs — le plafond 128K et le tool calling déterministe valent leur surcoût.

Un mot pour les équipes qui hésitent à migrer un défaut de prod : ne basculez jamais sur la foi d'un benchmark d'éditeur. Ces chiffres viennent en grande partie des évals maison de Google et d'OpenAI. Faites tourner votre charge, sur un échantillon représentatif, avant de changer quoi que ce soit — et gardez un œil sur les coûts d'infra autour du modèle, qui pèsent souvent plus que les tokens eux-mêmes. On avait chiffré où l'argent d'un agent IA s'enfuit vraiment ; le token n'est que la partie visible. La ventilation FinOps d'un agent en prod est ici.

Pour brancher l'un ou l'autre sur vos automatisations sans écrire de connecteur — relances, triage, génération de comptes rendus — un orchestrateur no-code fait le pont proprement entre l'API et vos outils métier.

À noter aussi : GPT-5.6 Terra alimente une partie des fonctions agents de ChatGPT côté entreprise, donc si votre équipe est déjà dans l'écosystème OpenAI, l'inertie joue en sa faveur même quand Gemini est moins cher.

FAQ

Gemini 3.7 Flash est-il vraiment moins cher que GPT-5.6 Terra ?
Oui, nettement, pendant la promo : 0,75 $/3,75 $ par million de tokens contre 2 $/12 $ pour Terra, soit environ 3× moins cher. Mais le tarif de Gemini double au 1er janvier 2027 (1,50 $/7,50 $). Après cette date, il reste moins cher, mais l'écart tombe autour de 1,4×.

Lequel choisir pour des agents IA en production ?
Terra pour l'orchestration multi-outils complexe et les tâches longues, grâce à son Programmatic Tool Calling et à sa sortie de 128K tokens. Gemini 3.7 Flash pour les agents à fort volume et faible latence, où sa vitesse de 340 tokens/s fait la différence.

Gemini 3.7 Flash suffit-il pour coder ?
Pour du code courant et du refactoring, oui : 65,3 % sur DeepSWE v1.1, c'est solide pour un modèle de ce prix. Pour de l'ingénierie difficile, multi-fichiers et à horizon long, Terra reste devant (69,6 %) et vous fera moins de reprises.

Peut-on tester les deux gratuitement ?
Les deux sont des modèles d'API payants, mais chaque plateforme offre un crédit de démarrage et un accès via des agrégateurs comme OpenRouter. Le vrai test à faire avant de migrer : rejouer votre propre charge sur un échantillon et mesurer coût réel + taux d'erreur, pas vous fier aux benchmarks des éditeurs.

Le plafond de 64K tokens de Gemini est-il un problème ?
Seulement si vous générez des sorties longues (documents structurés, gros JSON, longs rapports). Pour des réponses courtes en masse, il ne se voit jamais. Terra, avec ses 128K de sortie, est le choix sûr dès que vous produisez de longs livrables d'un seul appel.

En résumé : Gemini 3.7 Flash gagne la course au débit et au prix cet été, et c'est le meilleur rapport vitesse/dollar du marché aujourd'hui. Mais l'avantage tarifaire a une date de péremption, et Terra reste le choix des agents complexes et du code exigeant. La bonne réponse n'est pas « lequel », c'est « lequel pour quoi » — et un plan B pour janvier 2027.

FAQ

Gemini 3.7 Flash est-il vraiment moins cher que GPT-5.6 Terra ?
Oui pendant la promo : 0,75 $/3,75 $ par million de tokens contre 2 $/12 $ pour Terra, soit environ 3× moins cher. Mais le tarif de Gemini double au 1er janvier 2027 (1,50 $/7,50 $) ; l'écart tombe alors autour de 1,4×.
Lequel choisir pour des agents IA en production ?
Terra pour l'orchestration multi-outils complexe et les tâches longues, grâce au Programmatic Tool Calling et à la sortie de 128K tokens. Gemini 3.7 Flash pour les agents à fort volume et faible latence, où sa vitesse de 340 tokens/s domine.
Gemini 3.7 Flash suffit-il pour coder ?
Pour du code courant et du refactoring, oui (65,3 % sur DeepSWE v1.1). Pour de l'ingénierie difficile, multi-fichiers et à horizon long, Terra reste devant (69,6 %) et génère moins de reprises.
Peut-on tester les deux gratuitement ?
Ce sont des modèles d'API payants, mais chaque plateforme offre un crédit de démarrage et un accès via des agrégateurs comme OpenRouter. Avant de migrer, rejouez votre propre charge sur un échantillon et mesurez coût réel plus taux d'erreur.
Le plafond de 64K tokens de sortie de Gemini est-il bloquant ?
Seulement si vous générez de longues sorties structurées (gros JSON, longs rapports). Pour des réponses courtes en masse, il ne se voit pas. Terra, avec 128K de sortie, est plus sûr dès que vous produisez de longs livrables en un seul appel.
Partager
Résumé vidéoen cours…