Gemini 3.8 Flash coûte 5× plus que DeepSeek V4.1 : ça se défend ?

Deux modèles « Flash » sortis à huit jours d'écart, un million de tokens de contexte chacun, et un rapport de prix qui monte à 11 au 1er janvier.

Comparaison des modèles DeepSeek V4.1 Flash et Gemini 3.8 Flash

Huit jours séparent les deux sorties. Le 2 septembre, Google publie Gemini 3.8 Flash. Le 10, DeepSeek répond avec V4.1 Flash, poids ouverts en licence MIT, un million de tokens de contexte, et une grille tarifaire qui descend à 0,15 $ le million de tokens en entrée. J'ai branché les deux sur le même agent pendant 48 heures. Le verdict n'est pas celui que les benchmarks laissent croire.

Ce que DeepSeek V4.1 Flash apporte réellement

Le modèle est un MoE de 552 milliards de paramètres qui n'en active que 8 milliards pour lire votre prompt et 16 milliards pour générer la réponse. C'est le premier à s'appuyer sur l'architecture Causal Encoder-Decoder maison : 20 couches d'encodeur, 20 couches de décodeur. Conséquence directe, le cache KV global tombe à 890 octets par token, soit environ un quart de ce que consommait V4 Flash. C'est cette ligne-là qui explique tout le reste de l'article : la mémoire coûte moins cher à servir, donc les tokens coûtent moins cher à vendre.

Le modèle remplace d'un coup V4 Flash et V4 Flash Vision Exp, avec la compréhension d'image intégrée nativement, comme l'a relevé Le Big Data. Contexte d'un million de tokens, sortie maximale de 384 000 tokens, checkpoint de 510 Go en FP8 sur Hugging Face. Nous avions déjà raconté la fin de la stratégie low-cost de DeepSeek et sa hausse de prix ; V4.1 Flash prend le contre-pied complet de cet épisode.

Combien coûte DeepSeek V4.1 Flash face à Gemini 3.8 Flash en 2026

Voilà le nerf de la guerre, et il faut lire les deux colonnes de droite avec attention, parce que les deux fournisseurs jouent sur des tarifs à durée limitée.

Poste (par million de tokens)DeepSeek V4.1 FlashGemini 3.8 Flash
Entrée, cache manqué0,15 $ (0,30 $ en heures pleines)0,75 $ jusqu'au 31/12, puis 1,50 $
Sortie0,60 $ (1,20 $ en heures pleines)3,75 $ jusqu'au 31/12, puis 7,50 $
Entrée en cache0,003 $ (0,006 $ en heures pleines)0,075 $, puis 0,15 $ en 2027
Sortie maximale384 000 tokens65 536 tokens
LicenceMIT, poids téléchargeablesPropriétaire, API seulement

Prenons un agent réaliste de PME : tri et réponse sur 5 millions de tokens d'entrée par mois, 1 million de tokens générés. Chez DeepSeek hors heures pleines, la facture est de 1,35 $. Chez Google, 7,50 $. En janvier, la même charge passe à 15 $ côté Gemini quand DeepSeek reste à 1,35 $. Le rapport passe de 5,5 à 11. Sur du cache, l'écart devient indécent : 0,003 $ contre 0,075 $, un facteur 25.

Attention au piège des heures pleines, il m'a coûté le double sur mon premier batch. Les tarifs majorés s'appliquent du lundi au vendredi de 01h00 à 04h00 et de 06h00 à 10h00 UTC. En France, ça tombe pile entre 3h et 6h puis entre 8h et midi. Autrement dit, votre traitement de nuit programmé à 4 h du matin heure de Paris paie plein pot, et votre batch de 14 h paie moitié prix. J'ai lancé le mien un mardi à 9 h en pensant être tranquille. Facture doublée, leçon retenue.

Benchmarks : où DeepSeek V4.1 Flash gagne, où il décroche

Sur le terrain agentique, les deux modèles sont au coude à coude. Terminal-Bench 2.1 : 90,6 pour DeepSeek, 89,4 pour Gemini. DeepSWE v1.1, la suite qui mesure les tâches d'ingénierie logicielle longues : 74,2 contre 73,7. Pour situer, Claude Opus 5 est à 74,0 sur ce même test. Un modèle open weights à 0,15 $ le million tient la dragée haute à un frontier à 10 $. DeepSeek annonce aussi 88,1 sur CyberGym, 65,4 sur NL2Repo-Bench et un Elo Codeforces de 3 471.

Sur Terminal-Bench 4.0, la version durcie qui casse tout le monde, l'écart se creuse en faveur de DeepSeek : 31,2 contre 19,1 pour Gemini 3.8 Flash. Mais Opus 5 plafonne quand même à 43,3, ce qui rappelle que le tier Flash reste un tier Flash.

Le trou de 18 points sur la connaissance pure

C'est là que le prix bas s'explique. Sur HLE sans outils, DeepSeek V4.1 Flash marque 36,8. Gemini 3.8 Flash marque 54,9 en version vérifiée, selon le relevé de Vellum. Pire : le V4 Pro que V4.1 Flash remplace faisait 42,7. DeepSeek a explicitement troqué de la connaissance encyclopédique contre de l'exécution d'outils.

Ça s'est vu tout de suite dans mes tests. Sur une tâche de refacto avec accès au dépôt et au terminal, V4.1 Flash a été bluffant, plus rapide à converger que ce que j'attendais d'un modèle à ce tarif. Sur une question posée sans aucun outil — résumer les obligations d'un article de réglementation française de mémoire — il a produit trois phrases parfaitement construites et fausses. Gemini a répondu correctement, plus platement. Si votre agent n'a pas de RAG ni d'outil de recherche derrière, cet écart de 18 points vous sautera à la figure. C'est exactement le genre de régression qu'un jeu d'évals attrape en dix minutes ; nous avions détaillé la méthode pour changer de modèle sans casser la prod.

Le 14 septembre : ce qui casse pour les utilisateurs de deepseek-v4-pro

Point le plus urgent de cet article. À partir du 14 septembre 2026, 12h00 heure de Pékin, toute requête envoyée à deepseek-v4-pro est servie par V4.1 Flash, au tarif Flash, jusqu'à la sortie d'un futur V4.1 Pro. Vous ne changez pas d'endpoint, vous changez de modèle sans le savoir.

Pour les charges agentiques, c'est une bonne nouvelle : DeepSWE passe de 62,7 à 74,2, Terminal-Bench 2.1 de 87,9 à 90,6, et la facture baisse. Pour les charges de raisonnement sans outils, c'est une régression nette : HLE tombe de 42,7 à 36,8 et GPQA Diamond glisse de 92,4 à 90,9. Si vous faites tourner un assistant qui répond à des questions métier de tête, votre qualité va baisser lundi matin sans que personne ne touche à votre code.

DeepSeek V4.1 Flash et RGPD : l'obstacle pour une PME française

L'API officielle DeepSeek traite vos données sous juridiction chinoise. Pour un cabinet de conseil ou une PME qui manipule des données clients, c'est rédhibitoire en l'état. Trois sorties existent, et elles coûtent toutes quelque chose.

  • Passer par un hyperscaler en région UE. La génération V4 est disponible sur Microsoft Foundry, AWS Bedrock et Vertex AI avec résidence des données européenne. Surcoût observé : 20 à 50 % par rapport à l'API officielle. Même avec ça, on reste sous le prix Gemini.
  • Passer par une passerelle européenne. Les gateways type EUrouter traitent en UE et signent un DPA. Pratique, mais vous ajoutez un intermédiaire de plus dans la chaîne.
  • Héberger vous-même. La licence MIT le permet, le matériel beaucoup moins : plancher réaliste à 8 GPU (H200 ou B200 confortables, H100 80 Go à l'étroit) pour un checkpoint de 510 Go. Ce n'est pas une option de PME, c'est une option d'ESN ou de grand compte.

Gemini 3.8 Flash, lui, arrive avec Vertex AI, ses régions européennes et un contrat cadre que votre juriste connaît déjà. Ce confort administratif fait partie des 5× que vous payez. Sur le fond du sujet, notre comparatif des API IA souveraines reste la référence à croiser avant d'arbitrer.

Gemini 3.8 Flash : ce que les 5× de plus achètent

Soyons honnête sur ce que Google vend. La multimodalité est d'un autre calibre : 87,8 sur LVBench en compréhension de vidéo longue, 86,2 sur CharXiv pour le raisonnement sur graphiques, 59,0 sur OSWorld-2.0 en usage d'ordinateur. DeepSeek accepte le texte et l'image, point. Pas de vidéo, pas d'audio.

La vitesse ensuite : environ 305 tokens par seconde en sortie côté Gemini, avec trois niveaux de réflexion paramétrables. Sur les interfaces où l'utilisateur attend devant son écran, ça se sent. Et l'intégration Workspace et Vertex évite trois semaines de plomberie.

Le vrai caillou dans la chaussure de Google, c'est le calendrier. Le tarif d'appel expire le 31 décembre 2026. Au 1er janvier, entrée et sortie doublent, le cache passe de 0,075 à 0,15 $ et le stockage de cache de 0,50 à 1,00 $ par million de tokens et par heure. Un budget validé en septembre sur la base du prix promo sera faux en janvier. Nous l'avions déjà signalé dans notre test de Gemini 3.8 Flash où la facture réelle avait grimpé de 37 % malgré un prix affiché inchangé.

Si votre besoin est un modèle frontier unique, sans arbitrage horaire ni question de juridiction, la question ne se pose pas de la même manière — et ce n'est ni l'un ni l'autre de ces deux modèles qu'il faut regarder.

DeepSeek V4.1 Flash avis : mon verdict après 48 heures

Ce qui m'a convaincu : le rapport qualité-prix sur l'agentique est indiscutable, et la sortie de 384 000 tokens contre 65 536 chez Google change la donne pour la génération de documents longs ou de gros diffs. Ce qui m'a refroidi : l'absence de garantie de disponibilité comparable, la fenêtre d'heures pleines qui oblige à réfléchir à l'ordonnancement, et ce trou de connaissance qui transforme n'importe quelle question hors contexte en réponse plausible et fausse.

Ma configuration actuelle : DeepSeek V4.1 Flash sur les batchs asynchrones et les agents outillés, via un provider tiers hébergé en UE. Gemini 3.8 Flash sur tout ce qui touche l'image, la vidéo et les interactions temps réel. Le routage multi-modèle n'est pas un luxe d'architecte, c'est devenu la seule façon de ne pas payer 11× le prix nécessaire. Ceux qui explorent la voie open weights trouveront des points de repère dans notre comparatif Kimi K3, DeepSeek V4 Pro et GLM-5.2.

Qui doit basculer, qui doit rester

Basculez sur DeepSeek V4.1 Flash si vos charges sont asynchrones, outillées, volumineuses, et si vos données passent par un hébergeur européen ou votre propre infra. Le gain de 5 à 11× est réel et les benchmarks agents tiennent.

Restez sur Gemini 3.8 Flash si vous traitez de la vidéo ou de l'audio, si vous avez besoin de latence basse en face d'un humain, ou si votre direction juridique refuse tout détour par un modèle chinois — même hébergé en Europe. Mais provisionnez le doublement du 1er janvier dès maintenant dans votre budget 2027, sinon vous découvrirez la note au premier relevé de l'année.

Et dans tous les cas, si vous appelez deepseek-v4-pro en production, ouvrez votre code aujourd'hui. Lundi, ce ne sera plus le même modèle qui répond.

FAQ

DeepSeek V4.1 Flash est-il gratuit ?
L'API est payante : 0,15 $ par million de tokens en entrée et 0,60 $ en sortie hors heures pleines, le double pendant les heures pleines (01h00-04h00 et 06h00-10h00 UTC, du lundi au vendredi). En revanche, les poids sont publiés sous licence MIT sur Hugging Face : vous pouvez les télécharger et les exploiter commercialement sans redevance, à condition d'avoir le matériel — comptez un nœud de 8 GPU minimum pour un checkpoint de 510 Go en FP8.
DeepSeek V4.1 Flash vaut-il le coup face à Gemini 3.8 Flash pour une PME ?
Oui pour les traitements par lots, les agents outillés et la génération de documents longs : les scores agentiques sont équivalents (90,6 contre 89,4 sur Terminal-Bench 2.1) pour un coût 5 à 11 fois inférieur selon la période. Non si vous traitez de la vidéo, de l'audio, ou si vous avez besoin d'une réponse instantanée devant un utilisateur. Et non si votre conformité interdit tout traitement hors UE sans passer par un hébergeur tiers.
Que se passe-t-il le 14 septembre 2026 pour les utilisateurs de deepseek-v4-pro ?
À partir du 14 septembre 2026 à 12h00 heure de Pékin, toutes les requêtes envoyées à l'alias deepseek-v4-pro sont servies par V4.1 Flash, au tarif Flash, jusqu'à la sortie d'un V4.1 Pro. Les tâches d'agent et de code y gagnent, les tâches de connaissance sans outils y perdent : HLE passe de 42,7 à 36,8 et GPQA Diamond de 92,4 à 90,9. Testez vos prompts critiques avant la bascule.
Comment utiliser DeepSeek V4.1 Flash en restant conforme au RGPD ?
Trois voies. Passer par un hyperscaler avec région européenne (Microsoft Foundry, AWS Bedrock, Vertex AI), pour un surcoût de 20 à 50 % par rapport à l'API officielle. Passer par une passerelle européenne qui signe un DPA et traite exclusivement dans l'UE. Ou héberger les poids MIT sur votre propre infrastructure, ce qui suppose au minimum un nœud 8 GPU. Dans les trois cas, vous sortez de la juridiction chinoise.
Le prix de Gemini 3.8 Flash va-t-il vraiment doubler ?
Oui, et c'est écrit dans la grille officielle. Les tarifs de lancement, 0,75 $ en entrée et 3,75 $ en sortie par million de tokens, courent jusqu'au 31 décembre 2026. Au 1er janvier 2027, ils passent à 1,50 $ et 7,50 $. Le cache contextuel double également, de 0,075 à 0,15 $ par million, et le stockage de 0,50 à 1,00 $ par million de tokens et par heure. Tout budget calé sur le prix actuel sera faux dès janvier.
Partager
Résumé vidéoen cours…