Code review IA : 6 bots en PR, 12 critères, prix bien réels
CodeRabbit, Greptile, Qodo, Cursor Bugbot, GitHub Copilot et Graphite Agent passés au crible sur des benchmarks indépendants et une équipe de 20 dev.
Le code review IA n'est plus un gadget. GitHub Copilot arrive dans le CLI et sur Azure Repos, Cursor a rebasculé Bugbot en usage-only, Anthropic pousse son Claude Code GitHub Action en v1 GA, et deux startups spécialisées — CodeRabbit et Greptile — revendiquent des millions de PR analysées. Résultat, chaque équipe de dev sérieuse doit trancher : quel bot on colle en pré-merge, avec quel budget, et surtout, pour attraper quoi ?
J'ai passé les six offres les plus citées au crible : CodeRabbit, Greptile, Qodo Merge, Cursor Bugbot, GitHub Copilot Code Review et Graphite Agent (ex-Diamond). Croisement de trois benchmarks indépendants, tarifs officiels publiés en juin 2026, retours users et facture reconstituée pour une équipe de 20 dev. Verdict tranché à la fin. Pas de "tout dépend de vos besoins" : j'explique quel bot je collerais où, et pourquoi.
Cet article prolonge nos comparatifs sur les 6 IDE IA et les agents codeurs. Ici on ne parle pas d'autocomplétion, on parle du bot qui lâche des commentaires sur ta PR pendant que tu déjeunes.
Pourquoi le code review IA est devenu incontournable en 2026
Deux chiffres à garder en tête. Un : CodeRabbit revendique plus de 13 millions de PR analysées et 2 millions de repos connectés sur GitHub et GitLab. Deux : Greptile a levé sa Série A en 2025 et publie un benchmark maison sur 50 PR open source revendiquant 82 % de bugs attrapés. Autant dire que le marché s'est fixé, à défaut d'être mûr.
Ce qui a changé sur les 12 derniers mois : les PR bots ne se contentent plus du diff. Greptile indexe l'intégralité du repo, Qodo Merge fait de même sur plusieurs repos à la fois via son moteur RAG maison, et CodeRabbit — traditionnellement diff-only — a ajouté un mode "deep review" cette année. Côté GitHub Copilot, Microsoft a introduit en avril les review effort levels (Low par défaut, Medium pour la logique critique), et depuis le 1er juin 2026 chaque review consomme des AI Credits + minutes d'Actions sur les repos privés.
Autre bascule majeure : Cursor a supprimé le fee par siège de Bugbot en juin 2026 pour passer en facturation purement usage-based. Un run coûte désormais entre 1 et 1,5 $ selon la taille de la PR. C'est un choix radical : plus de coût fixe, mais plus non plus de prévisibilité budgétaire.
Ce qu'on a mesuré (et pas mesuré)
Trois sources externes servent de base au comparatif :
- Le benchmark Entelligence 2026 et le CodeAnt / OpenSSF CVE Benchmark sur 200 000+ PR réelles, cross-langages.
- Le benchmark maison Greptile sur 50 PR (Sentry, Cal.com, Grafana) et son contre-benchmark indépendant qui retombe à 45 % de catch rate.
- Une étude Martian menée en janvier-février 2026 sur des repos open source publics, avec une métrique simple : le dev a-t-il modifié le code après le commentaire du bot ?
J'y ajoute ma facture sur une équipe fictive mais très courante : 20 devs, deux repos GitHub privés, une centaine de PR par semaine, review humaine maintenue sur la logique métier. Les tarifs cités sont ceux affichés au 28 juin 2026, hors remises négociées enterprise.
Le peloton : 6 bots pour 6 promesses distinctes
CodeRabbit : le mainstream à 24 $/dev
CodeRabbit reste le bot le plus déployé du marché, avec 13 millions de PR analysées et un positionnement clair : review rapide, coûteuse en analyse mais peu bruyante. Le plan Pro affiché à 24 $/dev/mois facture uniquement les créateurs de PR, pas toute l'équipe. L'Enterprise démarre à 15 000 $/mois pour 500 utilisateurs via AWS Marketplace, soit ~30 $/user, avec self-host, SSO SAML, RBAC et déploiement UE.
Points forts : intégration sur toutes les grandes forges (GitHub, GitLab, Bitbucket, Azure DevOps), commentaires courts et peu de faux positifs — 2 en moyenne par run sur le benchmark Greptile. Points faibles : le bot ne lit que le diff, ce qui lui vaut de rater les régressions cross-fichier et les cascades architecturales. Sur l'OpenSSF CVE Benchmark, CodeRabbit sort à 59,39 % d'accuracy et un F1 de 36,19 % — comprenez : il attrape à peine plus d'une vraie vulnérabilité sur deux.
Greptile : le catch rate maximal, la note qui pique
Greptile indexe la totalité du codebase et fait tourner ses reviews avec le contexte complet. Résultat sur son propre benchmark : 82 % de bugs attrapés, contre 44 % pour CodeRabbit et 54 % pour Copilot. Sur les bugs de sévérité "High", il monte à 100 %. Sur les "Critical", à 58 %.
Deux caveats. D'abord, la note. Le tarif Team affiché est de 30 $/dev/mois avec un cap à 50 reviews par siège, puis 1 $ par review supplémentaire. Sur une équipe qui pousse 100 PR/semaine, la facture réelle dépasse rapidement le double du prix marketing. Ensuite, la reproductibilité : un contre-benchmark indépendant a évalué le même repo à ~45 % de catch rate, bien loin des 82 %. Greptile trouve beaucoup, mais génère aussi 11 faux positifs par run — cinq fois plus que CodeRabbit.
Qodo Merge : le seul avec vrai cross-repo
Qodo a lancé sa v2.0 en février 2026 avec une architecture multi-agents : un agent bugs, un agent sécurité, un agent qualité, un agent tests, tous en parallèle. Le moteur Qodo Aware (RAG) indexe plusieurs repos à la fois — le seul du panel à faire ça proprement. Résultat concret : si un changement dans Service A casse une interface qu'utilise Service B, Qodo Enterprise le voit. CodeRabbit, Copilot et Cursor Bugbot ne le voient pas.
Tarifs affichés fin juin 2026 : gratuit jusqu'à 75 PR/mois et 250 crédits LLM, Teams à 30 $/user/mois (annuel), Enterprise à partir de 45 $/user/mois avec SSO, audit logs, BYOK et déploiement single-tenant. C'est le tarif le plus élevé du comparatif, justifié uniquement si vous êtes en monorepo massif ou microservices avec vraies dépendances inter-services.
Cursor Bugbot : le bot rapide, désormais usage-only
Cursor a fait un choix radical en mai-juin 2026 : plus de facturation par siège pour Bugbot. Vous payez à l'usage, point. Un run coûte entre 1 et 1,5 $, et depuis la mise à jour de juin, 90 % des runs finissent en moins de trois minutes, 22 % moins cher, 10 % de bugs de plus. La communauté décrit ses reviews comme "clean and focused" — un ton nettement moins bavard que CodeRabbit ou Greptile.
Autre feature qui compte : Bugbot Autofix envoie un Cloud Agent Cursor corriger le bug détecté, avec push soit sur la branche existante, soit sur une nouvelle branche. Ça change la nature du bot : il ne pointe plus le problème, il propose le patch. Cursor annonce que 70 % des flags sont résolus avant merge grâce à ça. Support GitHub, GitLab, Bitbucket Cloud, GitHub Enterprise Server et GitLab Self-Hosted.
GitHub Copilot Code Review : celui que vous payez déjà
Copilot est le bot qui ne coûte rien de plus si vous êtes déjà sur Copilot Business (19 $/user) ou Enterprise (39 $/user). Depuis mars 2026, on peut demander une review depuis le CLI GitHub, et depuis juin il est en preview sur Azure Repos. Deux effort levels : Low par défaut (rapide, bugs et vulns communes) et Medium (raisonnement plus long, sécurité et cross-service).
Le vrai piège se cache dans la facturation. Depuis le 1er juin 2026, chaque review consomme deux compteurs simultanément : des AI Credits sur le nouveau modèle usage-based, et des minutes GitHub Actions sur les repos privés. Sur une équipe qui review 400 PR/mois, ça se sent. Côté performance, Copilot sort à 54 % de bugs attrapés sur le benchmark Greptile — au-dessus de CodeRabbit, en-dessous de Greptile lui-même. Convenable, sans plus.
Graphite Agent (ex-Diamond) : le pari des équipes rapides
Graphite a levé 52 millions en Série B en 2024 pour lancer Diamond. En 2026, la marque a été renommée Graphite Agent. Trois offres : gratuit pour les indépendants, Starter à 20 $/mois, Team à 40 $/user/mois avec reviews IA illimitées incluses. Les 100 premières PR/mois restent gratuites même hors abo Graphite.
Clientèle affichée : Vercel, Snowflake, Shopify, Notion, Asana. Le pitch est celui d'un outil pour équipes à haute vélocité : stacking de PR, review IA, et intégration serrée avec le workflow Graphite. En revanche, pas de benchmark public indépendant sur le catch rate — c'est le point aveugle du comparatif.
Tableau de synthèse — 12 critères sur 6 bots
Prix affichés au 28 juin 2026, hors remises enterprise.
| Critère | CodeRabbit | Greptile | Qodo Merge | Cursor Bugbot | GitHub Copilot | Graphite Agent |
|---|---|---|---|---|---|---|
| Prix affiché (Team) | 24 $/dev/mois | 30 $/dev + 1 $/review over | 30 $/user (annuel) | 1-1,5 $/run | Inclus Copilot Business | 40 $/user/mois |
| Formule gratuite | OSS uniquement | OSS uniquement | 75 PR + 250 crédits | Non | Non (via Copilot payant) | 100 PR/mois |
| Bug catch rate (bench Greptile) | 44 % | 82 % | Non testé | Non testé | 54 % | Non testé |
| F1 OpenSSF CVE | 36,19 % | ND | ND | ND | ND | ND |
| Faux positifs par run | ~2 | ~11 | ND | Faible (perception) | Moyen | ND |
| Analyse cross-fichier | Diff-only + deep mode | Repo complet indexé | Cross-repo (unique) | PR + contexte | PR + contexte | Repo indexé |
| Forges supportées | GitHub, GitLab, Bitbucket, Azure | GitHub, GitLab | GitHub, GitLab, Bitbucket, Azure | GitHub, GitLab, Bitbucket | GitHub (natif) + Azure preview | GitHub |
| Auto-fix | Suggestions inline | Suggestions | Multi-agent fix | Autofix via Cloud Agent | Suggested changes | Suggestions |
| Self-host / on-prem | Enterprise | Enterprise | Enterprise (single-tenant) | Non | GitHub Enterprise Server | Non annoncé |
| SSO / RBAC / audit | Enterprise | Team+ | Enterprise | Team | Copilot Enterprise | Team |
| Effort levels | Deep review | Configurable | Multi-agent | Effort setting | Low / Medium | ND |
| Modèle sous-jacent | Multi-modèle | Claude / GPT | Multi-agent | Cursor stack | Copilot models | Multi-modèle |
Le vrai coût sur 20 devs, à la calculette
C'est là que la promesse marketing prend un coup. Voici une simulation sur 20 devs, 100 PR/semaine, 400 PR/mois environ, deux repos GitHub privés.
| Outil | Mode de facturation | Facture mensuelle estimée | Note |
|---|---|---|---|
| GitHub Copilot Code Review | Déjà inclus si Copilot Business (19 $/user) | 380 $ (Copilot) + AI Credits + Actions min | Le compteur AI Credits + minutes a démarré le 1er juin 2026 |
| CodeRabbit Pro | 24 $ × créateurs de PR (≈ 18) | ~432 $ | Vous payez uniquement les devs qui poussent des PR |
| Cursor Bugbot | 1,25 $ × 400 PR | ~500 $ | Facture variable, imprévisible sur les grosses PR |
| Greptile Team | 30 $ × 20 + overages au-delà de 50 review/siège | 600 $ + overage possible | Cap 1 000 reviews inclus, puis 1 $/review |
| Qodo Merge Teams | 30 $ × 20 (annuel) | 600 $ | Passer à 45 $/user en Enterprise pour cross-repo |
| Graphite Agent Team | 40 $ × 20 | 800 $ | Reviews IA illimitées incluses |
Deux surprises. D'abord, CodeRabbit reste le meilleur ratio prix/couverture standard, à condition d'accepter son F1 modeste sur les vulns critiques. Ensuite, Copilot Code Review sort en tête sur le coût marginal — mais le combo AI Credits + Actions minutes peut faire déraper la facture si vous n'avez pas paramétré les effort levels correctement.
À noter aussi : Cursor Bugbot est le seul dont la facture peut doubler d'un mois à l'autre sans que rien ne change côté équipe. Un sprint chargé, une refonte, et c'est 800 $ au lieu de 500 $. À budgéter en fourchette, pas en ligne fixe.
L'option Anthropic Claude Code Action : le joker gratuit
Il faut mentionner un septième acteur, hors comparatif mais qui commence à peser : le GitHub Action officiel Anthropic Claude Code, en v1 GA depuis août 2025. Vous pouvez faire tourner Claude Sonnet 4.6 sur vos PR, avec un upgrade optionnel Opus 4.7 pour les paths sensibles sécurité, en payant uniquement les tokens API Anthropic. Sur un repo moyen, on tombe à 15-30 $/mois pour une équipe de 20 devs, hors tests. Rien à voir avec les 500 $+ des bots dédiés.
Contrepartie : vous configurez vous-même le workflow, vous n'avez pas de tableau de bord, et vous n'avez pas les garde-fous entreprise (audit, RBAC, gouvernance des faux positifs). C'est le choix des équipes techniques qui veulent piloter finement leur review IA sans passer par un SaaS. Pour tester Claude en review avant de payer un bot dédié, c'est l'entrée en matière la plus efficace.
Sur notre stack, j'ai laissé Copilot Code Review en filet de sécurité niveau Low, ajouté le Claude Code Action sur les fichiers sécurité, et gardé une review humaine sur toute PR qui touche la logique métier. Le tout coûte moins de 100 $/mois de tokens Anthropic et attrape ce qu'aucun bot single-purpose ne voit — parce que c'est nous qui écrivons le prompt de review.
Ce qui casse encore chez tous les bots
Trois limites structurelles que personne ne résout complètement fin juin 2026.
La logique métier reste hors de portée. Les benchmarks convergent : les bots sont excellents sur les null pointers, injections SQL, secrets exposés, exceptions non gérées. Ils sont médiocres sur la logique business — parce qu'ils ne connaissent pas votre domaine. Un bot qui laisse passer une PR qui autorise un client à sortir en négatif au checkout, alors que votre règle interne l'interdit, c'est le quotidien.
Le bruit tue l'adoption. Greptile trouve plus de bugs, mais génère 5x plus de faux positifs que CodeRabbit. Résultat concret : dans les équipes que je connais qui ont testé Greptile, la moitié a désactivé le bot après trois semaines parce que les devs ignoraient systématiquement les commentaires. Un bot silencieux qui rate 30 % des bugs vaut mieux qu'un bot qui trouve 80 % mais dont personne ne lit les commentaires.
Les benchmarks se contredisent. Greptile publie 82 % de catch rate, un ré-évaluateur indépendant retombe à 45 %, DeepSource sort à 84,51 % F1 sur OpenSSF, CodeRabbit à 36,19 % sur le même benchmark mais à 44 % sur Greptile. Aucun benchmark public unifié n'existe encore. Ça arrive — Martian, Entelligence et CodeAnt convergent lentement — mais fin 2026 on est encore obligé de tester en interne.
Notre verdict par profil d'équipe
Startup 5-10 devs, un seul repo, budget serré. Copilot Code Review si vous êtes déjà sur Copilot Business, sinon le Claude Code Action + workflow custom. Ne payez pas 30-40 $/user pour un bot dédié tant que vous n'êtes pas à volume.
Scale-up 20-50 devs, plusieurs services. CodeRabbit Pro pour le rapport qualité/prix, en gardant l'effort level maximal sur les repos sensibles. Ajoutez le Claude Code Action sur les paths sécurité si vous voulez une double review. Rejetez Graphite tant qu'il n'y a pas de benchmark public — ses prix ne sont pas justifiés objectivement.
Monorepo massif ou microservices avec dépendances inter-services. Qodo Merge Enterprise. C'est le seul qui fait vraiment du cross-repo. La note à 45 $/user se justifie si vos incidents viennent d'interfaces cassées entre services. Sinon, gardez CodeRabbit.
Grande équipe, gouvernance stricte, secteur régulé. CodeRabbit Enterprise (SSO, RBAC, EU deployment, self-host). L'option Greptile Enterprise fait sens si votre priorité est la détection maximale et que vous êtes prêts à filtrer le bruit — auquel cas prévoyez un lead qui trie les faux positifs chaque semaine.
Équipe qui vit dans Cursor. Bugbot, sans réfléchir. Intégration native, autofix via Cloud Agent, facture usage-based prévisible si vous plafonnez. Basculez sur le nouveau modèle facturation dès la fin de votre cycle en cours.
Combien coûte un bot code review IA en France ?
Question qui revient dans toutes les discussions PME. La grille en juin 2026, hors TVA et en équivalent euros à 0,92 :
- Gratuit : Copilot Code Review si vous êtes déjà sur Copilot Business (19 $/user, ~17,50 €), Qodo jusqu'à 75 PR, Graphite jusqu'à 100 PR, ou le Claude Code Action avec vos propres crédits API.
- Entrée : 22 €/dev/mois environ pour CodeRabbit Pro, en payant uniquement les créateurs de PR.
- Milieu : 27-37 €/user/mois pour Greptile Team, Qodo Teams et Graphite Agent Team.
- Enterprise : à partir de 40 €/user/mois pour Qodo Enterprise, ou custom pour CodeRabbit Enterprise (contrat à partir de ~14 000 €/mois via AWS Marketplace).
À budgéter aussi : un tiers du coût réel arrive via consommation API ou minutes Actions. Sur Copilot, la nouvelle facturation AI Credits ajoute facilement 20-30 % au coût facial du plan Business.
Bots vs review humaine : le vrai débat
Aucun des six bots testés ne remplace une review humaine. Ce que les benchmarks confirment sans ambiguïté : la précision maximale reste sur les catégories techniques (sécurité, null safety, syntaxe), pas sur la logique métier ni sur l'architecture. Sur un projet dont l'incident type est "le code marche mais fait la mauvaise chose", vos bots seront muets.
Le mix qui tient dans les équipes que je connais :
- Un bot rapide en filet de sécurité (Copilot Code Review Low ou CodeRabbit) — 100 % des PR.
- Une deuxième passe IA sur les PR sensibles (Qodo, Greptile ou Claude Code Action) — ~20 % des PR.
- Review humaine obligatoire sur toute PR qui touche la logique métier, l'authentification, les paiements ou l'infra prod.
Ce triptyque coûte typiquement 500-800 $/mois pour 20 devs, attrape 60-70 % des bugs mécaniques avant qu'un humain n'ouvre le fichier, et laisse le reviewer humain se concentrer sur ce qui compte : est-ce qu'on veut faire ça comme ça ?
Ce qu'on continue de creuser
Deux zones aveugles à date. Un : l'impact sur le throughput d'équipe. Personne ne publie de mesure sérieuse du "temps entre PR ouverte et PR mergée" avant/après bot IA. On sait que les bots réduisent le nombre d'aller-retour reviewer humain, on ne sait pas de combien. Deux : la question de la responsabilité juridique si un bot laisse passer une vulnérabilité qui finit exploitée. Sujet croisé avec notre article sur la responsabilité quand l'IA se trompe. Pour l'instant, contrats côté SaaS = limitation de responsabilité au montant de l'abonnement. Autant dire zéro.
À suivre côté benchmark : Martian a annoncé fin mai une évaluation en continu sur 500 000+ PR pour Q3 2026. Ça pourrait enfin donner une base de comparaison neutre entre tous ces bots. On y reviendra dès publication.