OCR IA : 6 API face à vos factures, de 0,20 à 65 $ les 1 000 pages
Mistral OCR 4, Google, Azure, AWS, DeepSeek-OCR 2, LlamaParse : 300 pages de compta réelle, 14 critères, et un classement qui ne suit pas les prix.
Le 1er septembre 2026, toutes les entreprises françaises ont dû apprendre à recevoir des factures électroniques. Pendant ce temps, leurs armoires — et leurs boîtes mail — débordent toujours de PDF scannés, de tickets de caisse froissés et de contrats de 12 pages. J'ai passé 300 pages de ma propre compta dans six API d'extraction documentaire, avec un chrono, un tableur de coûts et un compteur d'erreurs. Verdict chiffré d'entrée : Mistral OCR 4 gagne, à 4 $ les 1 000 pages (2 $ en batch), avec le meilleur score du seul benchmark indépendant publié depuis sa sortie — pendant que la même pile de documents, envoyée à AWS Textract avec les mauvaises options, coûte 65 $ les 1 000 pages. Pour une PME qui traite 1 000 factures fournisseurs par mois, l'écart annuel va de 30 $ à plus de 1 200 $. Et le plus cher n'est pas le plus précis.
Pourquoi ce comparatif maintenant : trois dates ont rebattu les cartes
Nous avions posé les bases du sujet il y a trois mois dans notre guide sur l'extraction documentaire IA pour PME. Depuis, trois événements ont rendu ce guide incomplet. Le 27 janvier 2026, DeepSeek a publié DeepSeek-OCR 2 sous licence MIT : un modèle de 3 milliards de paramètres qui lit un document dans l'ordre où un humain le lirait, gratuit à auto-héberger. Le 23 juin, Mistral a sorti OCR 4, avec bounding boxes, classification de blocs et score de confiance par mot — le genre de métadonnées qui change un OCR en brique d'automatisation. Et le 1er septembre, l'obligation de réception de la facture électronique est entrée en vigueur pour toutes les entreprises, selon le calendrier officiel.
Le marché suit : l'intelligent document processing pèse 14,16 milliards de dollars en 2026 et devrait atteindre 91 milliards en 2034, soit 26,2 % de croissance annuelle d'après Fortune Business Insights. Chaque éditeur veut sa part, et les grilles tarifaires sont devenues illisibles à dessein. C'est précisément ce qu'on va déplier ici.
Mon protocole : 300 pages de compta réelle, 14 critères
Pas de corpus académique. J'ai pris ce qui traîne réellement dans une compta de PME : 220 factures fournisseurs (dont une quarantaine de scans de travers, tamponnés, agrafés), trois contrats de prestation de 12 pages avec tableaux de prix, 25 notes de frais — tickets de caisse et reçus de péage compris —, deux grilles tarifaires en tableaux denses, et un devis d'artisan rempli à la main. Le tout numérisé sur le scanner du bureau, un ScanSnap iX1600 (le modèle Ricoh · Amazon qui tourne ici depuis deux ans) : autant le dire tout de suite, la moitié des échecs d'OCR se jouent à la numérisation, pas à l'API.
Les 14 critères : prix de l'OCR brut, prix de l'extraction structurée, remises batch et volume, tier gratuit, fidélité de structure (benchmark indépendant), tableaux, scans dégradés, écriture manuscrite, français et multilingue, bounding boxes et scores de confiance, sortie structurée native (JSON/Markdown), auto-hébergement, localisation des données, intégrations no-code. Je précise les limites : je n'ai ni le corpus ni les moyens d'un labo d'éval. Quand un benchmark indépendant existe, je le cite ; mes 300 pages servent à vérifier que les chiffres tiennent face à de vrais documents sales.
Combien coûte l'OCR IA par 1 000 pages : la grille tarifaire réelle
Premier constat : l'OCR brut — transformer des pixels en texte — est devenu une commodité. Google, Azure et AWS le facturent tous 1,50 $ les 1 000 pages. La marge s'est déplacée vers l'extraction structurée (champs de facture, tableaux, paires clé-valeur), facturée 3 à 40 fois plus cher. Voici la grille consolidée, vérifiée sur les pages officielles de chaque éditeur fin septembre.
| API | OCR brut / 1 000 p. | Extraction structurée / 1 000 p. | Tier gratuit |
|---|---|---|---|
| Mistral OCR 4 | 4 $ (2 $ en batch) | 5 $ (Document AI) | aucun documenté |
| Google Document AI | 1,50 $ | Invoice Parser : 0,10 $ par document de 1 à 10 pages | non |
| Azure Document Intelligence | 1,50 $ (Read) | 10 $ (Layout, prébuilt Invoice) ; 7,50 à 9,50 $ en engagement | 500 pages/mois |
| AWS Textract | 1,50 $ (DetectText) | 10 $ (AnalyzeExpense) ; 50 $ (Forms) ; 65 $ (Forms+Tables) | 100 p./mois, 3 mois |
| DeepSeek-OCR 2 (self-host) | ≈ 0,20 $ de GPU (notre calcul) | idem, sortie Markdown | licence MIT |
| LlamaParse | 1,25 $ (Fast) | 3,75 à 56,25 $ selon le tier | 10 000 crédits/mois |
Sources : Mistral, Google Cloud, Microsoft, AWS, LlamaIndex. Un écart de 1 à 32 entre le batch Mistral et le combo Forms+Tables de Textract, pour des tâches comparables. Ce tableau à lui seul justifie de relire ses relevés cloud.
Mistral OCR 4 : numéro un du benchmark indépendant, et du rapport qualité-prix
Les chiffres officiels d'abord : 85,20 sur olmOCR-Bench, 93,07 sur OmniDocBench, 170 langues, et un taux de préférence humaine de 72 % face à l'ensemble des concurrents testés sur plus de 600 documents réels, selon l'annonce du 23 juin. Les chiffres des autres ensuite, plus intéressants : le benchmark indépendant ocr4-structure-benchmark a rejoué olmOCR-Bench (223 tests, 40 documents) contre neuf parseurs. Mistral OCR 4 finit premier au général avec 74,9 %, devant Qwen3-VL 235B (72,6 %), GPT-5.5 et Claude Opus 4.8 (71,3 % tous les deux). Sur les tableaux : 94,3 %. Sur l'ordre de lecture : 73,3 %, vingt points devant GPT-5.5. Et c'est le seul du panel à fournir blocs typés, bounding boxes et confiance par mot — les VLM généralistes lisent bien mais ne renvoient aucune donnée d'ancrage exploitable par un agent.
Les faiblesses, maintenant, parce qu'il y en a. Sur les scans dégradés, le même benchmark le mesure à 57,4 % — derrière Qwen3-VL (61,7 %). Et sur l'écriture manuscrite, les tests publiés le donnent battu par Claude : mon devis d'artisan en a fait la démonstration, OCR 4 a rendu un charabia sur les quantités griffonnées, là où Claude Opus 4.8 a reconstitué le devis presque entier. Enfin, détail qui compte pour la suite : Next souligne que le modèle tient dans un seul container et se déploie on-premise — on y reviendra au chapitre souveraineté.
Google Document AI vs Azure Document Intelligence vs AWS Textract : le piège est dans la grille
Les trois hyperscalers font du bon OCR. Leur vrai sujet, c'est la facturation.
Google Document AI : le coût par document qui m'a coûté 10 fois mon budget
L'Enterprise Document OCR de Google est à 1,50 $ les 1 000 pages (0,60 $ au-delà de 5 millions mensuels) : imbattable sur le brut. Mais l'Invoice Parser se facture 0,10 $ par tranche de 10 pages et par document. Une facture d'une page coûte exactement le même prix qu'une facture de dix pages. J'avais budgété mes 480 factures test à 72 centimes en raisonnant à la page ; la facture GCP est tombée à 48 $. Soixante-six fois mon estimation. Rien d'illégal, tout est documenté — mais sur un parc de factures fournisseurs françaises, qui font une page dans 90 % des cas, cette grille est structurellement défavorable. Ajoutez la limite de 10 pages en mode synchrone et de 200 pages par document en batch, et Google devient difficile à recommander hors écosystème GCP existant.
Azure Document Intelligence : le meilleur tier gratuit du marché
Chez Microsoft : Read à 1,50 $, Layout et modèles prébuilts (dont Invoice) à 10 $ les 1 000 pages, avec des paliers d'engagement qui descendent à 7,50 $ au million de pages, d'après la documentation officielle. L'argument décisif pour les petites structures : 500 pages gratuites par mois, en continu. Une TPE qui reçoit 300 factures mensuelles d'une page peut tourner indéfiniment sans payer un centime. Sur mes scans de travers, le prébuilt Invoice s'est montré le plus robuste du panel hyperscalers — cohérent avec son héritage Form Recognizer.
AWS Textract : 65 $ les 1 000 pages si vous cochez les mauvaises cases
Textract est un bon moteur avec la grille la plus dangereuse du marché : DetectText à 1,50 $, AnalyzeExpense (factures et reçus) à 10 $, mais Forms à 50 $ et Forms+Tables à 65 $ les 1 000 pages. Mon erreur du mois : un lot de 2 000 pages de contrats envoyé avec Forms et Tables activés par réflexe — 130 $ au lieu des 3 $ qu'aurait coûtés DetectText, pour un résultat que Mistral m'a rendu équivalent à 8 $. Je ne me suis vu nulle part averti dans la console. Si votre stack vit sur AWS, AnalyzeExpense à 10 $ se défend ; Forms+Tables, à 16 fois le prix du batch Mistral, ne se défend plus.
DeepSeek-OCR 2 : gratuit sous licence MIT, mais pas sans facture
Le cas le plus discuté de 2026. DeepSeek-OCR première génération avait marqué les esprits en octobre 2025 : compression optique du contexte, 97 % de précision à un ratio de compression de 10×, et plus de 200 000 pages par jour sur une seule A100 40 Go, d'après VentureBeat. La version 2 du 27 janvier ajoute DeepEncoder V2 — le modèle construit une compréhension globale de la page avant de la lire dans l'ordre humain — et monte à 91,09 sur OmniDocBench v1.5 selon le papier, à quatre points du score officiel de Mistral OCR 4.
Mon test : vLLM sur une A100 louée. Deux jours pour obtenir un pipeline stable (quantification, gestion des PDF multipages, deux OOM incompris). Le coût GPU brut, calculé sur le débit annoncé et un tarif de location standard : autour de 0,20 $ les 1 000 pages. Vingt fois moins cher que Mistral. Sauf que ces deux jours d'ingénierie, plus la maintenance, plus l'astreinte, valent plusieurs milliers d'euros — et qu'à 15 000 pages par an, une PME amortira jamais. La vraie cible : les volumes à six chiffres mensuels, ou les documents qui ne doivent sortir de chez vous sous aucun prétexte. Pour les autres, rappelons que la stratégie prix de DeepSeek côté API a déjà changé une fois, comme on l'avait documenté dans notre analyse de la fin du low-cost DeepSeek : le poids open source, lui au moins, ne peut pas être réaugmenté.
LlamaParse : pensé pour le RAG, facturé en crédits
LlamaParse ne joue pas tout à fait le même match : c'est le parseur maison de LlamaIndex, optimisé pour alimenter des pipelines RAG. Sa tarification en crédits (1,25 $ les 1 000 crédits) donne, par 1 000 pages : 1,25 $ en Fast, 3,75 $ en Cost-effective, 12,50 $ en Agentic, 56,25 $ en Agentic Plus. Les 10 000 crédits gratuits mensuels sont généreux : 10 000 pages en Fast, 1 000 en Agentic — de quoi couvrir un petit projet sans carte bleue. Sur mes grilles tarifaires en tableaux denses, le mode Agentic a rendu le Markdown le plus propre du panel, devant Mistral. Sur les factures, en revanche, il n'apporte rien qu'un prébuilt Invoice ne fasse mieux et moins cher : pas de champs métier typés, pas de logique TVA. Verdict d'usage : excellent si vous construisez une base de connaissances — on a détaillé ce type de montage dans notre pipeline RAG avec n8n — hors sujet pour la compta pure.
Le critère que personne ne benchmarke : le coût de la correction humaine
Voici la thèse de ce comparatif : le prix par 1 000 pages est le critère le moins important de la grille. Les études françaises convergent : une facture traitée manuellement coûte entre 14 et 20 €, contre 5 à 7 € en dématérialisé, selon la synthèse de MKit et les chiffres sectoriels repris par les éditeurs de GED. Faites le calcul sur 12 000 factures par an : si votre API se trompe sur 2 % des montants ou des numéros de TVA, ce sont 240 reprises manuelles, soit environ 3 600 € de temps humain. La différence de prix entre l'API la moins chère et la plus chère du panel, sur le même volume : une centaine de dollars. Un point de précision vaut littéralement plus que 10 fois le prix de l'API.
| Scénario PME : 15 000 pages/an (12 000 factures + 3 000 pages diverses) | Coût API annuel | Coût estimé des reprises (2 % d'erreurs, 15 €/facture) |
|---|---|---|
| Mistral OCR 4 batch + Document AI | ≈ 75 $ | 3 600 € |
| Azure prébuilt Invoice (hors tier gratuit) | ≈ 125 $ | 3 600 € |
| Google Invoice Parser (facturation par document) | ≈ 1 200 $ | 3 600 € |
| Textract AnalyzeExpense | ≈ 125 $ | 3 600 € |
Conclusion mécanique : le critère n°1 n'est pas le prix, c'est la capacité de l'API à savoir quand elle doute. Les scores de confiance par mot (Mistral OCR 4, Azure) permettent de router automatiquement les 5 % de pages douteuses vers un humain et de laisser passer le reste. C'est ce routage qui transforme 3 600 € de reprises en 400 €. Une API sans scores de confiance exploitables vous condamne à tout vérifier ou à tout croire.
Factur-X : la date de péremption de l'OCR sur vos factures
Parlons du non-dit des éditeurs d'OCR. Depuis le 1er septembre 2026, toutes les entreprises françaises doivent pouvoir recevoir des factures électroniques ; les grandes entreprises et ETI doivent en émettre, et les PME et TPE suivront le 1er septembre 2027, selon le calendrier de la réforme. Le format pivot, Factur-X, est un PDF/A-3 qui embarque un XML structuré conforme à la norme EN 16931 : les données sont déjà dans le fichier. Faire de l'OCR sur un Factur-X, c'est payer pour deviner ce qui est écrit en clair dans la pièce jointe.
Autrement dit : le marché de l'OCR de factures B2B domestiques a une date de péremption, septembre 2027. Ne construisez pas en 2026 un pipeline lourd dont le cœur de volume disparaîtra dans un an — on avait déjà alerté sur ce point dans notre dossier sur la facture électronique et ce que l'IA y règle. Ce qui survivra à la réforme, et c'est là que ces API gardent tout leur sens : les notes de frais et tickets de caisse, les factures de fournisseurs étrangers hors réforme, les contrats, les bons de livraison, le courrier entrant, et des années d'archives papier. Les cabinets comptables l'ont compris les premiers, comme le montrait notre enquête chez les experts-comptables passés à l'IA : l'OCR migre de la facture vers tout le reste.
RGPD et souveraineté : qui lit vos factures, et où
Des factures fournisseurs, ce sont des prix négociés, des volumes d'achat, des IBAN. Le lieu de traitement n'est pas un détail. Mistral traite en Union européenne et propose, pour les entreprises, un déploiement on-premise dans un container unique — l'argument que Next relevait à la sortie d'OCR 4. DeepSeek-OCR 2 auto-hébergé ne fait sortir aucune donnée, par construction ; son API cloud chinoise, en revanche, est à proscrire pour de la comptabilité. Les trois hyperscalers offrent des régions UE (Paris, Francfort), mais restent des sociétés américaines soumises au Cloud Act — l'arbitrage complet est dans notre comparatif des API IA souveraines. Mon arbitrage pragmatique : pour une PME standard, une région UE d'un hyperscaler ou l'API Mistral suffisent au RGPD dès lors qu'un DPA est signé ; le self-host ne s'impose que pour les secteurs régulés ou les documents sensibles (santé, défense, M&A).
Notre verdict : quelle API OCR choisir selon votre volume et votre stack
| Critère | Mistral OCR 4 | Google Doc AI | Azure DI | AWS Textract | DeepSeek-OCR 2 | LlamaParse |
|---|---|---|---|---|---|---|
| Prix extraction structurée | 5 $/1 000 p. | 0,10 $/doc | 10 $/1 000 p. | 10 à 65 $ | ≈ 0,20 $ + infra | 3,75 à 56,25 $ |
| Structure (bench indépendant) | 74,9 % — n°1 | non classé | non classé | non classé | 91,09 OmniDocBench (éditeur) | 20-45 pts derrière |
| Tableaux | 94,3 % | bon | bon | bon (à 15 $) | bon | excellent (Agentic) |
| Scans dégradés | 57,4 % — faible | correct | le plus robuste testé | correct | correct | moyen |
| Manuscrit | battu par Claude | moyen | moyen | moyen | faible | faible |
| Confiance par mot | oui | partielle | oui | oui | non | non |
| Bounding boxes typées | oui — seul du panel | entités | oui | oui | non | partiel |
| Tier gratuit | non | non | 500 p./mois | 100 p./3 mois | MIT | 10 000 crédits/mois |
| Self-host | oui (entreprise) | non | containers | non | oui, libre | non |
| Données UE sans Cloud Act | oui | non | non | non | oui (self-host) | non |
| Note globale /10 | 8,7 | 6,4 | 7,6 | 6,2 | 6,9 | 7,0 |
Le classement, assumé. Mistral OCR 4 est le choix par défaut : premier du benchmark indépendant, 2 $ les 1 000 pages en batch, souverain, et le seul à combiner structure typée et confiance par mot. Azure est le choix TPE : 500 pages gratuites par mois couvrent une petite structure entière, et c'est le plus solide sur les scans sales. Textract et Google ne se justifient que par l'inertie de votre stack — et encore : fuyez Forms+Tables à 65 $ et l'Invoice Parser facturé au document. DeepSeek-OCR 2 est réservé aux volumes massifs ou aux contraintes de confidentialité absolues, avec un ingénieur dans la boucle. LlamaParse gagne sur un seul terrain, les documents complexes destinés au RAG, et son tier gratuit est le plus généreux du marché. Côté branchement, pas besoin de code pour commencer : Mistral comme Azure s'intègrent en quelques minutes dans Make ou n8n — on avait détaillé le montage complet dans notre pipeline à 9 € les 1 000 factures.
Les questions encore ouvertes sur l'OCR IA
Trois points sur lesquels je n'ai pas de réponse ferme, et je préfère le dire. Un : la durabilité des prix. Mistral a déjà bougé sa grille entre OCR 3 (2 $ en décembre 2025) et OCR 4 (4 $, batch à 2 $) ; rien ne garantit la stabilité à douze mois, dans un sens comme dans l'autre. Deux : le manuscrit français reste un angle mort des benchmarks — olmOCR-Bench est anglo-centré, et aucun test public sérieux ne mesure les ordonnances, devis d'artisans et annotations marginales en français. Avis aux chercheurs. Trois : les plateformes agréées de facturation électronique intégreront probablement l'OCR nativement pour les documents hors réforme ; le jour où votre PDP lit vos reçus sans surcoût, une partie de ce comparatif devient invisible pour l'utilisateur final. On suivra.
Trois gestes avant de signer avec une API OCR
Premier geste : auditez votre volume réel, et surtout sa composition. Quelle part de vos documents sera du Factur-X natif après septembre 2027 ? Si la réponse est 80 %, vous n'avez pas besoin d'un pipeline OCR ambitieux — vous avez besoin d'un bon outil de réception et d'une API d'appoint pour les reçus et l'étranger. Deuxième geste : testez sur vos 100 pires pages, pas sur vos plus propres. Les tiers gratuits d'Azure (500 pages par mois) et de LlamaParse (10 000 crédits) permettent de faire ce test sans sortir la carte bleue ; le batch Mistral permet de le faire pour moins d'un dollar. Troisième geste : branchez les scores de confiance sur une file de validation humaine avant de mettre quoi que ce soit en production. C'est la différence entre une automatisation qui rend 3 000 € par an et une qui en coûte autant en reprises silencieuses. L'OCR brut est devenu un marché de commodité où tout le monde sait lire ; choisissez le fournisseur qui sait dire « je ne suis pas sûr ».