Tarification et facturation
📚 Navigation de la série : Le chapitre précédent 03 Installation et connexion a guidé le déploiement de Codex et son authentification via compte ChatGPT ou clé API. Ce chapitre détaille les aspects financiers — le choix de la formule, l'évaluation des coûts, le cas particulier des clés API et les techniques pour optimiser vos quotas d'utilisation.
On estime fréquemment qu'un simple abonnement ChatGPT Plus suffit à utiliser Codex sans restriction. En réalité, la structure tarifaire s'avère plus complexe qu'un forfait illimité.
À mes débuts sur Codex, j'ai supposé que l'abonnement Plus à $20 couvrait l'ensemble de mes besoins. Après avoir demandé à l'agent de refactoriser un projet complexe de plus de dix mille lignes, la CLI a bloqué mes requêtes dès le deuxième après-midi, signalant que le quota d'utilisation était atteint. Pourtant, je n'avais formulé que quelques dizaines de requêtes. C'est en analysant le fonctionnement que j'ai compris : les limites de Codex ne s'évaluent pas au nombre de messages envoyés, mais au volume de tokens consommé par chaque requête. Mes messages incluaient des lectures de fichiers volumineux et des tâches d'envergure, consommant dix fois plus de ressources qu'un prompt standard.
De plus, Codex propose deux structures de facturation distinctes : l'authentification par compte ChatGPT s'appuie sur un forfait mensuel avec des limites de consommation, tandis que l'authentification par clé API repose sur une facturation à l'usage (consommation réelle de tokens). Ces deux modèles sont propices aux confusions.
Ce chapitre détaille ces deux logiques. Comprendre les règles de facturation est essentiel — un abonnement Plus peut couvrir un mois d'activité pour un développeur averti, ou être consommé en 48 heures sans optimisation.
À la fin de ce chapitre, vous obtiendrez :
- Un tableau comparatif des offres d'abonnement ChatGPT face à la tarification par clé API
- La distinction entre les limites de consommation (quotas d'abonnement) et la facturation à la consommation de tokens (clés API)
- L'usage de la commande
/statuspour analyser votre solde de consommation en temps réel - Des techniques d'optimisation validées pour réduire la consommation de tokens à périmètre égal
⚠️ 价格与限额随时会变 : Les tarifs, limites et coûts des jetons cités ci-dessous font référence à la page de tarification officielle et sont sujets à des ajustements fréquents de la part d'OpenAI.
01 Comprendre l'objet de la facturation
En synthèse : l'utilitaire Codex est gratuit, la facturation ciblant exclusivement les ressources de calcul consommées par le modèle.
Codex n'est qu'un outil en ligne de commande (complété par l'application de bureau, les extensions IDE et la version web). La facturation s'applique au traitement des requêtes par les modèles de la famille GPT — lecture de fichiers, modifications de code, exécutions de commandes shell. C'est ce volume de données transmises qui sert d'unité de facturation.
Analogie : L'application de transport et le trajet. Télécharger l'application de transport est gratuit. En revanche, chaque déplacement génère une facturation indexée sur la distance parcourue. Pour Codex, la distance équivaut au volume de données traitées : plus vos fichiers sont lourds et vos prompts complexes, plus le coût de traitement augmente.
Le traitement de texte par le modèle s'évalue en tokens (fractions de mots servant d'unité lexicale). Analogie : le tarif au mot. Les textes transmis en entrée (prompts) et générés en sortie (réponses) sont convertis en tokens. Les tokens de sortie (générés) s'avèrent généralement plus coûteux que les tokens d'entrée (soumis).
Exemples de consommation de tokens invisibles au quotidien :
- Demander d'éditer un document de 2000 lignes — l'intégralité du texte est soumise en entrée, consommant de nombreux tokens.
- Une conversation atteignant 50 messages — les 49 échanges précédents sont renvoyés à chaque nouvelle requête pour maintenir le contexte.
- Un fichier
AGENTS.md(conventions du projet) volumineux à la racine — il est réinséré dans le contexte de chaque message.
Le coût dépend donc moins du nombre de prompts soumis que de la taille du contexte transmis à chaque fois — c'est le levier d'optimisation principal à retenir.
💡 En résumé : L'utilitaire est gratuit, la facturation ciblant les ressources de calcul évaluées en tokens — entrées, sorties et contexte inclus.
02 Deux logiques financières : abonnement ChatGPT vs clé API
Le mode de facturation se décline selon deux approches distinctes :
| Critère | Abonnement ChatGPT | Connexion par clé API |
|---|---|---|
| Mode de facturation | Forfait mensuel fixe incluant un quota d'usage ; recharge par crédits au-delà | Aucun forfait, débit en temps réel basé sur la consommation réelle de tokens |
| Prévisibilité | Coût mensuel plafonné et prévisible | Facturation variable post-usage |
| Fonctionnalités cloud (revues automatiques, Slack, GitHub...) | ✅ Disponibles | ❌ Non disponibles |
| Accès aux nouveaux modèles | Immédiat | Décalé dans le temps |
| Public cible | Développeurs individuels (usage régulier, budget fixe) | Pipelines CI/CD, scripts d'automatisation, serveurs partagés |
| Modalité d'authentification | codex login (connexion au compte ChatGPT) | Connexion par clé API dans l'utilitaire |
Le choix dépend de l'usage recherché :
L'abonnement ChatGPT est recommandé pour l'usage individuel quotidien. Si vous disposez d'une formule Plus ou Pro, l'accès à Codex est inclus dans les limites associées. Cela évite de lier des moyens de paiement spécifiques ou de suivre des débits unitaires. En cas de dépassement, vous pouvez acquérir des recharges de crédits. Les services cloud (intégrations GitHub, Slack) exigent ce mode d'authentification.
La clé API est conçue pour l'usage automatisé (machine-to-machine), notamment dans les pipelines CI/CD. Les requêtes s'exécutent en asynchrone et font l'objet d'une facturation standard à la consommation de tokens. Ce mode exclut l'accès aux fonctions cloud et aux derniers modèles expérimentaux. Ce choix s'avère peu pertinent pour le développement interactif quotidien.
关于「用 API key 时钱怎么算」:它走的是 OpenAI Platform 的标准 API 价,跟 ChatGPT 订阅的限额、积分完全是两套账,具体单价以 API pricing 页为准,本文不写死。
Recommandation : privilégiez la connexion par compte ChatGPT pour le développement interactif à votre poste, et réservez les clés API aux exécutions planifiées ou automatisées.
💡 En résumé : Compte d'abonnement pour l'utilisateur, clé API pour l'automatisation. Le premier offre la prévisibilité budgétaire et les services cloud, le second la flexibilité d'intégration.
03 Choisir son abonnement : Plus, Pro, Business ou Enterprise
Voici le comparatif des formules ChatGPT intégrant les services de Codex :

| Formule | Tarif mensuel (indicatif) | Quotas Codex (relatifs) | Caractéristiques clés | Public cible |
|---|---|---|---|---|
| Plus | $20/mois | Volume de base | Accès multi-interfaces (Web, CLI, IDE, mobile), fonctions cloud, nouveaux modèles | Usage individuel modéré |
| Pro | À partir de $100/mois | 5 à 20 fois le volume Plus | Avantages Plus + modèle d'exécution rapide (version expérimentale) | Développeurs intensifs à temps plein |
| Business | Facturation à l'usage par utilisateur | Volume Plus de base extensible par crédits | Console d'administration d'équipe, SSO/MFA, exclusion d'entraînement des données | Équipes de développement et startups |
| Enterprise & Edu | Sur devis | Tarification sur mesure et quotas flexibles | Avantages Business + exécution prioritaire, contrôles avancés de sécurité (RBAC, logs d'audit) | Déploiements à l'échelle de l'organisation |
Détails complémentaires sur ces offres :
L'offre Plus ($20) répond aux besoins de la majorité des développeurs. Elle ouvre l'accès à l'ensemble des interfaces (console, IDE, web) et des services d'intégration cloud, ainsi qu'aux derniers modèles. La seule contrainte concerne les limites de consommation (détaillées ci-dessous).
La formule Pro (à partir de $100) s'adresse aux développeurs intensifs. Elle étend les quotas d'usage (5 à 20 fois le volume Plus) et propose un modèle d'exécution accéléré. Elle évite d'avoir à acquérir régulièrement des recharges de crédits. Il est cependant conseillé d'optimiser sa consommation de tokens avant d'envisager cette formule.
Les offres Business et Enterprise ciblent le travail en équipe et l'usage en entreprise, intégrant des fonctionnalités d'administration, d'isolation de données et de sécurité. Les développeurs individuels n'en auront pas l'utilité.
Qu'en est-il des versions Free et Go ?
L'accès à Codex depuis les offres gratuites (Free) ou d'entrée de gamme (Go) fait l'objet de limitations.
En pratique, la grille tarifaire officielle de Codex cible les formules à partir de l'offre Plus ($20). Les offres gratuites (Free) ou d'entrée de gamme ne disposent pas de quotas garantis pour la programmation autonome.
Recommandations :
- N'envisagez pas de développer régulièrement en mode autonome sous les formules Free ou Go.
- Pour tester les capacités visuelles, le service Sites de l'interface web de Codex est accessible gratuitement en version d'évaluation (cette option ne couvrant pas l'exécution de code local).
- Les conditions d'accès des formules d'entrée de gamme étant sujettes à évolution, consultez la page chatgpt.com/pricing avant de souscrire.
💡 En résumé : Plus pour débuter, Pro pour s'affranchir des limites, et formules collectives pour les équipes. Évitez de compter sur les formules gratuites pour le développement.
04 Comprendre les quotas : cycle de 5 heures et recharges
La gestion des limites s'articule autour de deux aspects : l'évaluation des quotas et l'acquisition de recharges.
1. Limite glissante de 5 heures
Les limites de Codex distinguent les messages locaux (Local Messages) et les tâches cloud (Cloud Tasks), ces deux usages partageant une fenêtre glissante de 5 heures (les modalités de calcul de la fenêtre dépendant des conditions d'utilisation d'OpenAI).
De plus, le quota est évalué sous forme d'intervalle variable et non d'une limite fixe (par exemple, 15 à 80 messages locaux sur 5 heures sous la formule Plus pour le modèle GPT-5.5). La raison :
« Le nombre de requêtes disponibles dépend du modèle sélectionné, de la taille et de la complexité de la tâche, et de l'environnement d'exécution (local ou cloud). Les scripts simples consomment peu de ressources, tandis que les modifications sur des dépôts volumineux, les tâches de longue durée et les sessions longues à grand contexte consomment beaucoup plus de jetons par message. » (Traduit de la documentation officielle).
C'est la raison pour laquelle mes modifications d'architecture complexes ont rapidement saturé mon quota Plus. Sur un même projet, l'écriture d'une fonction simple consomme très peu de ressources, tandis que l'exploration globale d'un dépôt complexe réduit l'intervalle de requêtes utilisables.
2. Comparatif des quotas selon la formule
Données indicatives pour le modèle GPT-5.5 (messages locaux sur 5 heures) :
| Formule | Messages locaux / 5 heures (indicatif) |
|---|---|
| Plus | 15 à 80 requêtes |
| Pro (5x) | 80 à 400 requêtes |
| Pro (20x) | 300 à 1600 requêtes |
| Business | 15 à 80 requêtes (identique Plus, extensible par crédits) |
Note : Basculer vers un modèle de taille réduite (comme GPT-5.4-mini) permet de multiplier le nombre de requêtes disponibles pour un même quota (voir section 05).
3. Gestion du dépassement : l'achat de recharges
Si la limite est atteinte, vous n'avez pas à faire évoluer votre abonnement mensuel. OpenAI propose des recharges de crédits (credits) :
« Les utilisateurs des formules Plus et Pro ayant atteint leurs limites de consommation peuvent acquérir des crédits supplémentaires pour poursuivre leur travail sans changer de formule. » (Traduit de la documentation officielle).
Analogie : Les recharges de données mobiles. Le quota de l'abonnement est votre enveloppe mensuelle. En cas de dépassement, vous achetez une recharge ponctuelle pour continuer votre activité sans modifier votre forfait principal.
La consommation des crédits reste indexée sur le volume de tokens. La documentation fournit une estimation :
« Une requête GPT-5.5 consomme en moyenne entre 5 et 45 crédits. » (Traduit de la documentation officielle).
Conservez cet ordre de grandeur en mémoire, les tarifs unitaires par million de tokens dépendant des modèles configurés.
💡 En résumé : Les limites s'évaluent sur un cycle glissant de 5 heures en fonction des modèles. L'analyse de dépôts volumineux réduit rapidement le quota ; utilisez des recharges de crédits en cas de besoin temporaire.
05 Bonnes pratiques pour optimiser la consommation de tokens
Optimiser ses méthodes d'utilisation est plus efficace que de souscrire à une formule supérieure. La facturation dépendant de la taille du contexte transmis, voici les techniques de préservation recommandées officiellement :
1. Rédiger des requêtes précises. La consigne officielle est de « donner des instructions précises à Codex, en éliminant le contexte superflu ». Les demandes floues forcent l'agent à explorer de nombreux fichiers à la recherche d'informations, consommant des tokens. Privilégiez des consignes explicites : « modifie la fonction login dans src/auth.ts pour y intégrer un contrôle de saisie ».
2. Alléger le fichier AGENTS.md. Ce document de conventions étant transmis lors de chaque requête, sa taille influe directement sur la consommation. Pour les projets importants, structurez les règles de manière imbriquée (des fichiers locaux dans les sous-répertoires) plutôt que d'accumuler des centaines de lignes à la racine.
3. Limiter les serveurs MCP actifs. Les descriptions des outils exposés par chaque serveur MCP connecté sont injectées dans le contexte système. La documentation officielle conseille de désactiver les serveurs non utilisés pour la tâche en cours.
4. Utiliser des modèles plus légers. L'usage de GPT-5.4 ou de GPT-5.4-mini étend le quota de messages disponibles. Pour les tâches courantes (correction de bugs simples ou édition de fonctions), basculez de modèle avec la commande /model pour préserver vos limites.
Synthèse des pratiques d'optimisation :
| Pratique inefficace ❌ | Pratique recommandée ✅ | Gain obtenu |
|---|---|---|
| « Aide-moi à optimiser ce projet » | « Modifie login dans src/auth.ts » | Réduction des scans de fichiers inutiles |
Fichier AGENTS.md de plusieurs pages | Règles synthétiques structurées | Réduction de la taille du prompt système |
| Serveurs MCP connectés en permanence | Activation ciblée | Allégement des définitions d'outils |
| Usage systématique du modèle le plus puissant | Passage au modèle mini pour les tâches simples | Extension du quota disponible |
Recommandation pour la CLI : utilisez la commande /new pour démarrer une nouvelle tâche. Elle réinitialise le contexte d'échange sans quitter la session, évitant de renvoyer l'historique d'une activité terminée lors de vos prompts ultérieurs.
💡 En résumé : L'optimisation repose sur des prompts ciblés, un fichier
AGENTS.mdléger, la désactivation des serveurs MCP inactifs, l'usage de modèles légers pour les tâches simples et l'usage de/newpour réinitialiser le contexte.
06 Pratique : suivre sa consommation dans la CLI
Cet exercice vous permet de mesurer l'impact de vos commandes sur le contexte.
Prérequis : Codex doit être installé et authentifié.
Lancez Codex dans votre dossier projet :
codexÉtape 1 : Interroger la session avec la commande /status
/statusLa console retourne les paramètres actifs : modèle en cours, politique d'approbation, dossier autorisé, taille du contexte et estimation du quota restant.
« Pour consulter votre quota restant en cours de session, utilisez la commande
/status» (Traduit de la documentation officielle).
Vérifiez le modèle sélectionné et estimez les requêtes restantes pour anticiper un éventuel dépassement.
Étape 2 : Lancer un prompt et comparer l'état du contexte
看看当前目录下有哪些文件,简单说下这个项目是干嘛的Une fois la réponse affichée, relancez /status pour analyser la variation de la taille du contexte. Cela vous donne un ordre de grandeur de la consommation par requête.
Étape 3 : Basculer de modèle
/modelSélectionnez un modèle plus léger pour étendre vos limites de requêtes. Vous pouvez également déclarer le modèle au lancement :
codex --model gpt-5.5(Les identifiants de modèles valides dépendent de votre formule ; consultez les choix disponibles via la CLI).
Étape 4 (abonnés) : Consulter le tableau de bord de consommation
https://chatgpt.com/codex/settings/usageLe suivi global inter-appareils est disponible à cette adresse.
Note pour les clés API : La consommation est comptabilisée sur la Console OpenAI (platform.openai.com) et non sur l'interface ChatGPT. La commande
/statusreste cependant utile pour vérifier la taille du contexte local.
07 Résumé
Ce chapitre a détaillé la structure de facturation de Codex :
| Notions acquises | Point clé |
|---|---|
| Objet de la facturation | L'utilitaire est gratuit, le traitement des requêtes s'évaluant en tokens |
| Deux logiques distinctes | Formules ChatGPT (forfait + crédits) ou clés API (débit à l'usage) |
| Choix de l'abonnement | Plus pour débuter, Pro pour étendre les limites, Business pour les équipes |
| Calcul des limites | Fenêtre glissante de 5 heures dépendant de l'usage ; recharges par crédits |
| Optimisation | Requêtes précises, conventions légères, serveurs MCP limités et usage de /new |
La consommation est dictée par la taille du contexte transmis et non par le nombre de prompts. Optimiser sa façon de formuler les requêtes, gérer la persistance de l'historique et choisir le modèle adapté permet de maximiser le retour sur investissement.
⚠️ Note : Les tarifs et seuils de consommation cités sont indicatifs et sujets à évolution sur les canaux d'OpenAI.
Le chapitre suivant 05 · Connexion à des modèles tiers comme DeepSeek présente une alternative intéressante : comment lier Codex à des modèles tiers comme DeepSeek, Kimi ou GLM, permettant d'exécuter l'agent sans compte OpenAI.