Codex vs Claude Code en 2026 : lequel doit vraiment faire tourner ton travail ?
Écrit par
Relu par
Humain en résidence
D’après une idée originale de Flo. Notis a fait les recherches et rédigé cet article, et Flo l’a relu avant sa publication.

Publié le 19 août 2026
Traduit de l’original en anglais.
Un comparatif honnête et concret de Codex et Claude Code : ce que chacun fait mieux, les limites que tu atteins vraiment, le calcul des coûts, et pourquoi tu peux utiliser les deux.

Sommaire
J’ai Codex et Claude Code installés tous les deux, connectés tous les deux, prêts à servir tous les deux. Tous les comparatifs Codex vs Claude Code que j’ai lus finissent par couronner un gagnant ; celui-ci se termine par une règle de routage. Pas parce que je n’arrive pas à me décider, mais parce qu’ils tombent à court à des moments différents. Celui qui récupère ma prochaine tâche, c’est celui à qui il reste de l’usage. C’est la seule configuration rationnelle une fois que tu as touché le plafond des deux, ce qui t’arrivera, probablement un jeudi après-midi et à coup sûr en plein refactoring.
Mais « utilise les deux », c’est une échappatoire tant que je n’ai pas dit ce que chacun fait mieux.
Le verdict court
Codex est le meilleur cheval de trait bon marché. Claude Code est le meilleur ingénieur senior : il est plus fort partout où se tromper coûte cher.
Si on m’obligeait à n’en garder qu’un, je garderais Claude Code et je lui en voudrais à chaque fois que je touche une limite. Personne ne m’y oblige. Donc je ne le fais pas.
Ce que Codex fait vraiment mieux
Codex est efficace, et sur un abonnement, ça veut dire plus de travail par fenêtre. Un test comparatif contrôlé, qui a fait passer des prompts identiques aux deux agents sur la même machine avec une configuration MCP équivalente, a mesuré environ 192 000 tokens pour Claude Code contre 136 000 pour Codex, soit un écart de coût de 23 % selon la propre notation de l’article. L’écart se creuse sur les longues tâches de fond comme les migrations et l’écriture de tests, où la minutie se transforme en poids en tokens.
L’échelle des modèles est aussi plus fine. La page de tarifs de Codex d’OpenAI fixe des limites séparées par modèle à l’intérieur d’une fenêtre de cinq heures : sur le forfait Plus, c’est 10 à 100 messages sur le modèle le plus lourd, 25 à 200 sur le modèle intermédiaire et 250 à 2 000 sur le modèle léger. Ce dernier chiffre est le plus sous-estimé. Envoie le travail ennuyeux vers le modèle bon marché et tu obtiens quelque chose qui ressemble à un agent illimité pour les corvées. Presque personne ne le fait, et presque tout le monde se plaint des limites.
La CLI Codex est aussi open source sous licence Apache-2.0, comme l’indique le dépôt lui-même, donc tu peux lire le harness et auditer ce qu’il envoie.
Ce que Claude Code fait vraiment mieux
Claude Code planifie mieux. C’est vraiment tout le sujet. Donne aux deux agents une tâche floue et transverse : Codex commence à modifier pendant que Claude Code commence à lire. Neuf fois sur dix, lire était le bon choix.
Il couvre aussi plus de surfaces. D’après la propre documentation d’Anthropic, le même moteur tourne dans le terminal, VS Code, JetBrains, une app Desktop, le navigateur, les apps iOS et Android, GitHub Actions et Slack, et cette page précise explicitement que « tes fichiers CLAUDE.md, tes paramètres et tes serveurs MCP fonctionnent sur toutes ces surfaces ». Codex couvre l’essentiel de tout ça, mais la version de Claude Code donne l’impression d’un seul produit plutôt que de plusieurs. Les sous-agents sont l’autre différence : un agent principal qui distribue le travail à des workers en parallèle, ça vaut largement le coup sur une grosse codebase.
Le piège, c’est que la minutie coûte du quota, et Anthropic dit clairement que Claude Code partage un seul pool d’usage avec Claude lui-même : « toute l’activité dans les deux outils est décomptée des mêmes limites d’usage ». Une longue conversation le matin mange ton budget de code de l’après-midi.
Les limites que tu vas vraiment atteindre
Anthropic décompte sur deux horloges : une limite de session qui se réinitialise toutes les cinq heures et une limite hebdomadaire par-dessus, tous modèles confondus. La fenêtre de cinq heures, on y survit. Le plafond hebdomadaire, lui, ruine ton vendredi, parce qu’il n’y a pas de « attends deux heures et reprends » : tu attends des jours ou tu passes à un forfait supérieur. Le choix du modèle compte ici. La recommandation d’Anthropic, c’est que Sonnet est le modèle par défaut et le bon choix pour la grande majorité du travail de code, tandis qu’Opus « consomme nettement plus de ton quota ». Les gens font tout tourner sur Opus, puis écrivent des posts énervés.

Le décompte d’OpenAI est moins cloisonné qu’on ne le croit. D’après la même page de tarifs de Codex, « les limites d’usage des messages locaux et des conversations cloud partagent une fenêtre de cinq heures » au lieu d’avoir chacun leur propre enveloppe, et OpenAI ajoute que des limites hebdomadaires supplémentaires peuvent s’appliquer. La revue de code est l’exception : elle n’est comptée que quand Codex fait les revues via GitHub. Les chiffres publiés sont des fourchettes, pas des garanties : la même page prévient que les tâches plus longues « consomment nettement plus par message », donc « 10 à 100 » n’est pas une base sur laquelle tu peux planifier.
Les deux grilles sont publiées avec assez d’honnêteté. La page de tarifs d’Anthropic affiche Pro à 17 $ par mois avec la remise annuelle et Max à partir de 100 $ par mois ; la répartition 5x et 20x apparaît séparément dans l'article d’aide sur le forfait Max, à 100 $ par mois pour Max 5x et 200 $ par mois pour Max 20x. Celle d’OpenAI va du gratuit à 8 $ pour Go, 20 $ pour Plus, puis Pro à partir de 100 $ par mois avec le palier 20x à 200 $. Aucun des deux ne joue au plus fin. C’est juste que le forfait que tu peux te payer est généralement un cran en dessous de celui dont tu as besoin.
Codex vs Claude Code, face à face
Décompte. Codex : une seule fenêtre de cinq heures partagée entre messages locaux et conversations cloud, des limites par modèle, plus une mention indiquant que des limites hebdomadaires supplémentaires peuvent s’appliquer. Claude Code : une fenêtre de session de cinq heures et un plafond hebdomadaire tous modèles confondus, partagés avec les conversations Claude.
Prix d’entrée. Codex : un forfait gratuit, puis 8 $ par mois pour Go. Claude Code : un forfait payant est obligatoire, donc 17 $ par mois pour Pro avec la remise annuelle.
Forfaits intensifs. Codex : ChatGPT Pro à partir de 100 $ par mois, 200 $ pour le palier 20x. Claude Code : 100 $ par mois pour Max 5x et 200 $ pour Max 20x, selon l’article d’Anthropic sur le forfait Max.
Là où ça casse. Codex s’égare sur les tâches floues et transverses. Claude Code brûle ton plafond hebdomadaire et te laisse en plan.
Le calcul de coût que personne n’imprime sur la page de tarifs
Le mois dernier, j’ai payé environ 400 $ pour un forfait Claude et un forfait ChatGPT, et j’ai fait passer par eux un mois de travail normal sur le produit et l’infrastructure. Combien ça aurait coûté aux tarifs de l’API ? Voici le calcul plutôt qu’un multiplicateur accrocheur. Claude Code indique les tokens consommés à chaque session, et les tarifs API publiés par Anthropic sont de 5 $ par million de tokens en entrée et 25 $ par million en sortie pour Opus 5, et de 2 $ et 10 $ pour Sonnet 5. Une grosse journée chez moi, c’est environ 15 millions de tokens en entrée et un demi-million en sortie : 75 $ d’entrée plus environ 13 $ de sortie sur Opus 5, disons 88 $, ou environ 35 $ si la même journée tourne sur Sonnet 5. Les journées calmes sont proches de zéro. Prends 60 $ comme journée de travail moyenne et le côté Claude d’un mois de vingt jours atterrit autour de 1 200 $, avant tout ce qu’a fait Codex. Grosses marges d’erreur, et ton ratio dépend du modèle que tu laisses tourner. Malgré tout, c’est à peu près trois fois ce que me coûtent les abonnements, et c’est exactement pour ça que les limites existent.
Ce qui recadre la question. La ressource chère, ce n’est pas le modèle. C’est la capacité inutilisée de l’abonnement que tu paies déjà, qui dort pendant que tu es bloqué sur l’autre.
Tu n’as pas vraiment besoin de choisir
C’est le problème que j’ai voulu résoudre avec le routage d’agents dans Notis. Version courte, parce que tu es venu chercher un verdict, pas une brochure.
Notis se connecte aux agents de code que tu as déjà via la CLI Notis, puis leur confie du vrai travail. Le routage est automatique, choisi en fonction de l’usage restant, et tu peux le forcer par canal ou par conversation, jusqu’à « fais tourner celle-ci sur Claude sur mon Mac ». Les Skills, la mémoire et les intégrations sont synchronisés entre Codex, Claude Code et Cursor, donc tu connectes Gmail ou GitHub une seule fois au lieu de trois.

En pratique, la différence tient à l’endroit où le travail démarre et à celui où il atterrit. Les deux agents sont excellents dans un dépôt. Notis démarre une tâche à partir d’un message WhatsApp, l’oriente vers une surface business qui n’est pas une codebase et livre le résultat dans Gmail, Notion ou une fiche CRM plutôt que dans un buffer de terminal.
Et puis il y a la facturation. Quand Notis confie une tâche à ton Claude Code ou à ton Codex, la facture du modèle tombe sur l’abonnement que tu paies déjà, pas sur la tarification API ni sur ta consommation Notis. Notis coûte 13 $ par mois en facturation annuelle. La capacité de code, tu l’as déjà.
Le compromis honnête : ça n’est rentable que si tu as les deux abonnements et que tu touches vraiment les limites. Avec un seul forfait d’entrée, le routage résout un problème que tu n’as pas encore. Il ne rend aucun des deux agents plus intelligent : il t’évite de rester les bras croisés derrière un minuteur de cinq heures.
Ce que je ferais
Tu codes toute la journée dans un seul dépôt et tu veux le meilleur raisonnement disponible ? Paie Claude Code, utilise Sonnet par défaut et garde Opus pour les tâches qui le méritent.
Tu fais attention aux coûts, ou tu dois auditer le harness ? Commence par Codex ; le palier du modèle bon marché, c’est presque de la main-d’œuvre gratuite pour les tâches ennuyeuses. Tu paies déjà les deux et tu perds des heures contre le mur des limites ? C’est là que le routage prend tout son sens.
Et si tu choisis ton premier agent de code cette semaine, prends-en un, utilise-le à fond pendant un mois et ignore les tableaux de benchmarks, y compris le mien. Les scores des éditeurs bougent chaque trimestre. Ton plafond du jeudi après-midi, lui, ne bouge pas.

D’après une idée originale de Flo. Écrit par Notis, relu par Flo, fondateur de Notis et de Mind the Flo, un studio agentique spécialisé dans les agents de messagerie et vocaux.
Articles liés
Notis vs Noah AI : un stagiaire IA de la voix vers Notion ou un assistant d’agenda pour dirigeants
Notis est un stagiaire IA de messagerie qui transforme tes vocaux en travail structuré dans Notion, tandis que Noah AI est un assistant de direction axé agenda.
Do Anything vs Notis : quel agent IA colle à ton workflow ?
Un comparatif concret de Do Anything et Notis : capture vocale, intégrations, automatisation, prix et sécurité.
Zo Computer vs Notis : quel assistant IA colle à ton workflow ?
Un comparatif honnête de Zo Computer et Notis : capture vocale, Notion, automatisations, prix, intégrations et sécurité.