Gemini 3.8 Flash coûte 5× plus que DeepSeek V4.1 : ça se défend ?
Deux modèles « Flash » sortis à huit jours d'écart, un million de tokens de contexte chacun, et un rapport de prix qui monte à 11 au 1er janvier.
Huit jours séparent les deux sorties. Le 2 septembre, Google publie Gemini 3.8 Flash. Le 10, DeepSeek répond avec V4.1 Flash, poids ouverts en licence MIT, un million de tokens de contexte, et une grille tarifaire qui descend à 0,15 $ le million de tokens en entrée. J'ai branché les deux sur le même agent pendant 48 heures. Le verdict n'est pas celui que les benchmarks laissent croire.
Ce que DeepSeek V4.1 Flash apporte réellement
Le modèle est un MoE de 552 milliards de paramètres qui n'en active que 8 milliards pour lire votre prompt et 16 milliards pour générer la réponse. C'est le premier à s'appuyer sur l'architecture Causal Encoder-Decoder maison : 20 couches d'encodeur, 20 couches de décodeur. Conséquence directe, le cache KV global tombe à 890 octets par token, soit environ un quart de ce que consommait V4 Flash. C'est cette ligne-là qui explique tout le reste de l'article : la mémoire coûte moins cher à servir, donc les tokens coûtent moins cher à vendre.
Le modèle remplace d'un coup V4 Flash et V4 Flash Vision Exp, avec la compréhension d'image intégrée nativement, comme l'a relevé Le Big Data. Contexte d'un million de tokens, sortie maximale de 384 000 tokens, checkpoint de 510 Go en FP8 sur Hugging Face. Nous avions déjà raconté la fin de la stratégie low-cost de DeepSeek et sa hausse de prix ; V4.1 Flash prend le contre-pied complet de cet épisode.
Combien coûte DeepSeek V4.1 Flash face à Gemini 3.8 Flash en 2026
Voilà le nerf de la guerre, et il faut lire les deux colonnes de droite avec attention, parce que les deux fournisseurs jouent sur des tarifs à durée limitée.
| Poste (par million de tokens) | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|
| Entrée, cache manqué | 0,15 $ (0,30 $ en heures pleines) | 0,75 $ jusqu'au 31/12, puis 1,50 $ |
| Sortie | 0,60 $ (1,20 $ en heures pleines) | 3,75 $ jusqu'au 31/12, puis 7,50 $ |
| Entrée en cache | 0,003 $ (0,006 $ en heures pleines) | 0,075 $, puis 0,15 $ en 2027 |
| Sortie maximale | 384 000 tokens | 65 536 tokens |
| Licence | MIT, poids téléchargeables | Propriétaire, API seulement |
Prenons un agent réaliste de PME : tri et réponse sur 5 millions de tokens d'entrée par mois, 1 million de tokens générés. Chez DeepSeek hors heures pleines, la facture est de 1,35 $. Chez Google, 7,50 $. En janvier, la même charge passe à 15 $ côté Gemini quand DeepSeek reste à 1,35 $. Le rapport passe de 5,5 à 11. Sur du cache, l'écart devient indécent : 0,003 $ contre 0,075 $, un facteur 25.
Attention au piège des heures pleines, il m'a coûté le double sur mon premier batch. Les tarifs majorés s'appliquent du lundi au vendredi de 01h00 à 04h00 et de 06h00 à 10h00 UTC. En France, ça tombe pile entre 3h et 6h puis entre 8h et midi. Autrement dit, votre traitement de nuit programmé à 4 h du matin heure de Paris paie plein pot, et votre batch de 14 h paie moitié prix. J'ai lancé le mien un mardi à 9 h en pensant être tranquille. Facture doublée, leçon retenue.
Benchmarks : où DeepSeek V4.1 Flash gagne, où il décroche
Sur le terrain agentique, les deux modèles sont au coude à coude. Terminal-Bench 2.1 : 90,6 pour DeepSeek, 89,4 pour Gemini. DeepSWE v1.1, la suite qui mesure les tâches d'ingénierie logicielle longues : 74,2 contre 73,7. Pour situer, Claude Opus 5 est à 74,0 sur ce même test. Un modèle open weights à 0,15 $ le million tient la dragée haute à un frontier à 10 $. DeepSeek annonce aussi 88,1 sur CyberGym, 65,4 sur NL2Repo-Bench et un Elo Codeforces de 3 471.
Sur Terminal-Bench 4.0, la version durcie qui casse tout le monde, l'écart se creuse en faveur de DeepSeek : 31,2 contre 19,1 pour Gemini 3.8 Flash. Mais Opus 5 plafonne quand même à 43,3, ce qui rappelle que le tier Flash reste un tier Flash.
Le trou de 18 points sur la connaissance pure
C'est là que le prix bas s'explique. Sur HLE sans outils, DeepSeek V4.1 Flash marque 36,8. Gemini 3.8 Flash marque 54,9 en version vérifiée, selon le relevé de Vellum. Pire : le V4 Pro que V4.1 Flash remplace faisait 42,7. DeepSeek a explicitement troqué de la connaissance encyclopédique contre de l'exécution d'outils.
Ça s'est vu tout de suite dans mes tests. Sur une tâche de refacto avec accès au dépôt et au terminal, V4.1 Flash a été bluffant, plus rapide à converger que ce que j'attendais d'un modèle à ce tarif. Sur une question posée sans aucun outil — résumer les obligations d'un article de réglementation française de mémoire — il a produit trois phrases parfaitement construites et fausses. Gemini a répondu correctement, plus platement. Si votre agent n'a pas de RAG ni d'outil de recherche derrière, cet écart de 18 points vous sautera à la figure. C'est exactement le genre de régression qu'un jeu d'évals attrape en dix minutes ; nous avions détaillé la méthode pour changer de modèle sans casser la prod.
Le 14 septembre : ce qui casse pour les utilisateurs de deepseek-v4-pro
Point le plus urgent de cet article. À partir du 14 septembre 2026, 12h00 heure de Pékin, toute requête envoyée à deepseek-v4-pro est servie par V4.1 Flash, au tarif Flash, jusqu'à la sortie d'un futur V4.1 Pro. Vous ne changez pas d'endpoint, vous changez de modèle sans le savoir.
Pour les charges agentiques, c'est une bonne nouvelle : DeepSWE passe de 62,7 à 74,2, Terminal-Bench 2.1 de 87,9 à 90,6, et la facture baisse. Pour les charges de raisonnement sans outils, c'est une régression nette : HLE tombe de 42,7 à 36,8 et GPQA Diamond glisse de 92,4 à 90,9. Si vous faites tourner un assistant qui répond à des questions métier de tête, votre qualité va baisser lundi matin sans que personne ne touche à votre code.
DeepSeek V4.1 Flash et RGPD : l'obstacle pour une PME française
L'API officielle DeepSeek traite vos données sous juridiction chinoise. Pour un cabinet de conseil ou une PME qui manipule des données clients, c'est rédhibitoire en l'état. Trois sorties existent, et elles coûtent toutes quelque chose.
- Passer par un hyperscaler en région UE. La génération V4 est disponible sur Microsoft Foundry, AWS Bedrock et Vertex AI avec résidence des données européenne. Surcoût observé : 20 à 50 % par rapport à l'API officielle. Même avec ça, on reste sous le prix Gemini.
- Passer par une passerelle européenne. Les gateways type EUrouter traitent en UE et signent un DPA. Pratique, mais vous ajoutez un intermédiaire de plus dans la chaîne.
- Héberger vous-même. La licence MIT le permet, le matériel beaucoup moins : plancher réaliste à 8 GPU (H200 ou B200 confortables, H100 80 Go à l'étroit) pour un checkpoint de 510 Go. Ce n'est pas une option de PME, c'est une option d'ESN ou de grand compte.
Gemini 3.8 Flash, lui, arrive avec Vertex AI, ses régions européennes et un contrat cadre que votre juriste connaît déjà. Ce confort administratif fait partie des 5× que vous payez. Sur le fond du sujet, notre comparatif des API IA souveraines reste la référence à croiser avant d'arbitrer.
Gemini 3.8 Flash : ce que les 5× de plus achètent
Soyons honnête sur ce que Google vend. La multimodalité est d'un autre calibre : 87,8 sur LVBench en compréhension de vidéo longue, 86,2 sur CharXiv pour le raisonnement sur graphiques, 59,0 sur OSWorld-2.0 en usage d'ordinateur. DeepSeek accepte le texte et l'image, point. Pas de vidéo, pas d'audio.
La vitesse ensuite : environ 305 tokens par seconde en sortie côté Gemini, avec trois niveaux de réflexion paramétrables. Sur les interfaces où l'utilisateur attend devant son écran, ça se sent. Et l'intégration Workspace et Vertex évite trois semaines de plomberie.
Le vrai caillou dans la chaussure de Google, c'est le calendrier. Le tarif d'appel expire le 31 décembre 2026. Au 1er janvier, entrée et sortie doublent, le cache passe de 0,075 à 0,15 $ et le stockage de cache de 0,50 à 1,00 $ par million de tokens et par heure. Un budget validé en septembre sur la base du prix promo sera faux en janvier. Nous l'avions déjà signalé dans notre test de Gemini 3.8 Flash où la facture réelle avait grimpé de 37 % malgré un prix affiché inchangé.
Si votre besoin est un modèle frontier unique, sans arbitrage horaire ni question de juridiction, la question ne se pose pas de la même manière — et ce n'est ni l'un ni l'autre de ces deux modèles qu'il faut regarder.
DeepSeek V4.1 Flash avis : mon verdict après 48 heures
Ce qui m'a convaincu : le rapport qualité-prix sur l'agentique est indiscutable, et la sortie de 384 000 tokens contre 65 536 chez Google change la donne pour la génération de documents longs ou de gros diffs. Ce qui m'a refroidi : l'absence de garantie de disponibilité comparable, la fenêtre d'heures pleines qui oblige à réfléchir à l'ordonnancement, et ce trou de connaissance qui transforme n'importe quelle question hors contexte en réponse plausible et fausse.
Ma configuration actuelle : DeepSeek V4.1 Flash sur les batchs asynchrones et les agents outillés, via un provider tiers hébergé en UE. Gemini 3.8 Flash sur tout ce qui touche l'image, la vidéo et les interactions temps réel. Le routage multi-modèle n'est pas un luxe d'architecte, c'est devenu la seule façon de ne pas payer 11× le prix nécessaire. Ceux qui explorent la voie open weights trouveront des points de repère dans notre comparatif Kimi K3, DeepSeek V4 Pro et GLM-5.2.
Qui doit basculer, qui doit rester
Basculez sur DeepSeek V4.1 Flash si vos charges sont asynchrones, outillées, volumineuses, et si vos données passent par un hébergeur européen ou votre propre infra. Le gain de 5 à 11× est réel et les benchmarks agents tiennent.
Restez sur Gemini 3.8 Flash si vous traitez de la vidéo ou de l'audio, si vous avez besoin de latence basse en face d'un humain, ou si votre direction juridique refuse tout détour par un modèle chinois — même hébergé en Europe. Mais provisionnez le doublement du 1er janvier dès maintenant dans votre budget 2027, sinon vous découvrirez la note au premier relevé de l'année.
Et dans tous les cas, si vous appelez deepseek-v4-pro en production, ouvrez votre code aujourd'hui. Lundi, ce ne sera plus le même modèle qui répond.