Gérer les coûts efficacement
Suivez l'utilisation des tokens, définissez des limites de dépenses pour l'équipe, et réduisez les coûts de Claude Code grâce à la gestion du contexte, la sélection du modèle, les paramètres de réflexion étendue et les hooks de prétraitement.
Claude Code facture selon la consommation de tokens API. Pour les tarifs des plans d'abonnement (Pro, Max, Team, Enterprise), consultez claude.com/pricing. Les coûts par développeur varient considérablement en fonction de la sélection du modèle, de la taille de la base de code et des modèles d'utilisation tels que l'exécution de plusieurs instances ou l'automatisation.
Dans les déploiements d'entreprise, le coût moyen est d'environ 13 $par développeur par jour actif et de 150 à 250$ par développeur par mois, les coûts restant en dessous de 30 $ par jour actif pour 90 % des utilisateurs. Pour estimer les dépenses de votre équipe, commencez par un petit groupe pilote et utilisez les outils de suivi ci-dessous pour établir une base de référence avant un déploiement plus large.
Cette page explique comment suivre vos coûts, gérer les coûts pour votre organisation et réduire l'utilisation des tokens.
Suivre vos coûts
Utiliser la commande `/usage`
Le bloc Session dans /usage affiche l'utilisation des tokens API et est destiné aux utilisateurs d'API. Les abonnés Claude Max et Pro ont l'utilisation incluse dans leur abonnement, donc le chiffre du coût de session n'est pas pertinent à des fins de facturation. Les abonnés voient les barres d'utilisation du plan, les statistiques d'activité et une ventilation de l'utilisation sur le même écran.
Le bloc Session en haut de /usage affiche des statistiques détaillées sur l'utilisation des tokens pour votre session actuelle. Claude Code calcule le chiffre en dollars localement à partir des décomptes de tokens au prix catalogue, sauf si une table modelPricing est en vigueur. Un administrateur en définit une dans les paramètres gérés de votre organisation afin que le chiffre utilise vos tarifs contractuels, et tant qu'une table est en vigueur, la ligne Total cost porte la note at your organization's configured rates. Le chiffre est une estimation, donc pour une facturation fiable, consultez la page Utilisation dans la Console Claude.
Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)
Ces totaux se réinitialisent quand /clear démarre une nouvelle session, donc le coût total de la session suivante recommence à $0. Avant la v2.1.211, ils continuaient à s'accumuler sur /clear pendant la durée de vie du processus Claude Code.
Pour une réponse de l'API Claude facturée au taux de résidence des données 1,1×, Claude Code multiplie le prix catalogue des tokens de cette réponse par 1,1 dans le chiffre du coût de session. Claude Code rapporte le même total dans le champ de coût de la ligne d'état et le compare avec --max-budget-usd. Avant la v2.1.239, Claude Code n'appliquait pas le 1,1× à ces réponses, donc le chiffre du coût de session était inférieur à la facture.
Statistiques du cache de prompt
Après la première réponse API de la conversation principale, Claude Code ajoute également une ligne Prompt cache (main) au bloc Session, résumant l'utilisation du cache de prompt de la session : le nombre de demandes, la part des tokens d'entrée servis à partir du cache, les défauts de cache, et si le cache est chaud en ce moment. Nécessite Claude Code v2.1.251 ou version ultérieure.
Prompt cache (main): 14 requests · 91% of input tokens from cache · 2 misses (last 6m 10s ago, 310.2k tokens re-cached) · 1 expected rebuild (compaction or tool-result clearing) · warm (1h TTL, last activity 40s ago)
Les défauts, les reconstructions attendues, et les parties chaudes ou froides de la ligne signifient ce qui suit :
- Misses : demandes qui ont retraité le contenu que le cache contenait déjà, avec l'heure du dernier défaut et le nombre de tokens que ces demandes ont réécrits dans le cache. Claude Code compte une demande comme un défaut quand la demande a retraité plus de 5 % et au moins 2 000 tokens de ce qu'elle aurait pu lire à partir du cache. Les actions qui invalident le cache énumèrent les causes habituelles. Quand Claude Code peut identifier une cause probable du dernier défaut, la ligne la nomme aussi, par exemple
likely cause: tool definitions changed. Le texte de cause probable nécessite Claude Code v2.1.260 ou version ultérieure. - Expected rebuilds : quand Claude Code a lui-même réécrit la conversation, par compaction ou en supprimant les anciens résultats d'outils du contexte, il compte le même type de défaut comme une reconstruction attendue à la place. Cette partie n'apparaît qu'après qu'au moins une reconstruction attendue s'est produite.
- Warm or cold : si le préfixe mis en cache se trouve toujours dans sa durée de vie du cache, avec le TTL en vigueur. Quand le cache est froid, la ligne affiche depuis combien de temps la session est inactive. Quand aucune réponse n'a rapporté de tokens de cache, la ligne se termine par
no prompt caching reported by the APIà la place.
Les décomptes proviennent des champs de tokens de cache dans les réponses de l'API, donc la ligne fonctionne sur chaque fournisseur et passerelle. Elle couvre la conversation principale uniquement, pas les subagents. /clear la réinitialise avec le reste du bloc Session.
Les scripts de ligne d'état peuvent lire les mêmes nombres à partir de l'objet prompt_cache.
Ventilation de l'utilisation du plan
Sur un plan Pro, Max, Team ou Enterprise, /usage affiche également une ventilation de ce qui compte par rapport à vos limites de plan :
- Attribution : utilisation récente attribuée aux skills, subagents, plugins et serveurs MCP individuels, chacun affiché en pourcentage du total. La part d'un serveur MCP compte uniquement les demandes qui ont consommé l'un de ses résultats d'outils. Avant la v2.1.222, après un appel à un serveur MCP, Claude Code attribuait chaque demande ultérieure à ce serveur, surestimant sa part.
- Behavior flags : comportements tels que le contexte long ou les défauts de cache, signalés quand l'un d'eux représente 10 % ou plus de l'utilisation récente.
- Loops : une ligne pour chacune des tâches
/loopou autres tâches planifiées les plus lourdes qui ont été exécutées récemment, ordonnées par tokens totaux, avec un décompte du reste. Claude Code rapporte la fréquence d'exécution de chaque tâche, le nombre de fois qu'elle a été exécutée, ses tokens totaux et par exécution, et quand elle a été exécutée pour la dernière fois. Claude Code clé une ligne par le prompt de la tâche, donc une boucle que vous arrêtez et recréez reste une ligne. Nécessite Claude Code v2.1.242 ou version ultérieure.
Appuyez sur d ou w pour basculer entre les 24 dernières heures et les 7 derniers jours. Les chiffres sont approximatifs et calculés à partir de l'historique des sessions locales sur cette machine, donc l'utilisation d'autres appareils ou de claude.ai n'est pas incluse.
Dans l'extension VS Code, les parts d'attribution et les drapeaux de comportement apparaissent dans la boîte de dialogue Compte et utilisation avec un bouton bascule Jour et Semaine, sans les lignes Loops. Nécessite Claude Code v2.1.174 ou version ultérieure.
Vérifier vos dépenses en crédits d'utilisation
/usage affiche également une ligne de crédits d'utilisation tandis que les crédits d'utilisation sont activés. Ce que la ligne affiche dépend de votre plan :
- Pro et Max : vos dépenses pour le mois en cours, mesurées par rapport à votre limite de dépenses mensuelles quand vous en avez défini une. Quand vous n'avez pas défini de limite, la ligne affiche
Unlimitedet aucun chiffre de dépenses. - Team et Enterprise : vos propres dépenses pour le mois en cours, mesurées par rapport à toute limite que votre organisation a définie qui s'applique à vous. Une limite qui couvre l'ensemble de l'organisation n'apparaît pas dans la ligne. Quand vous n'avez pas de limite qui vous est propre, la ligne affiche vos dépenses sans limite à côté. Tandis que les crédits d'utilisation sont désactivés pour vous,
/usagen'affiche aucune ligne de crédits d'utilisation.
Quand vous avez une limite de dépenses, la ligne apparaît dès que les crédits d'utilisation sont activés et affiche 0 % jusqu'à ce que vous dépensez d'abord des crédits d'utilisation. Avant la v2.1.236, /usage affichait la ligne uniquement sur les plans Pro et Max, et une ligne avec une limite de dépenses restait cachée jusqu'à ce que vous ayez dépensé quelque chose.
Quand la demande d'utilisation échoue
Quand la demande de vos limites de plan échoue, le plus souvent parce que le point de terminaison d'utilisation est limité en débit, /usage affiche les dernières barres d'utilisation qu'il a chargées sur cette machine au cours des 60 dernières minutes, ainsi qu'une note « Showing last-known usage » indiquant depuis combien de temps ces données ont été récupérées. Appuyez sur r pour réessayer ; une nouvelle tentative réussie remplace les dernières barres connues par des données actualisées. Sans un instantané des 60 dernières minutes, /usage signale que le point de terminaison d'utilisation est limité en débit et propose le même raccourci de nouvelle tentative. Avant la v2.1.208, une demande limitée en débit dans une session qui n'avait pas encore chargé l'utilisation affichait toujours l'erreur sans barres.
Analyser vos modèles d'utilisation
Exécutez /insights pour un rapport sur votre façon de travailler plutôt que sur le nombre de tokens que vous avez utilisés. Il analyse vos sessions récentes sur cette machine et écrit un rapport HTML couvrant ce sur quoi vous travaillez, les points de friction tels que les demandes mal comprises ou le code bogué, et les suggestions pour utiliser Claude Code plus efficacement. Une seule exécution analyse jusqu'à 200 sessions qu'il n'a pas vues auparavant et ignore les très courtes. Quand des sessions sont omises, l'en-tête du rapport affiche le nombre analysé avec le total entre parenthèses, par exemple 200 sessions (412 total).
Claude Code écrit le dernier rapport dans ~/.claude/usage-data/report.html et enregistre une copie horodatée de chaque exécution dans le même répertoire, donc les rapports antérieurs ne sont pas écrasés. Claude Code supprime les rapports selon le même calendrier que le reste de vos données de session : au démarrage, il supprime les fichiers plus anciens que cleanupPeriodDays, 30 jours par défaut.
Vous pouvez exécuter /insights sur n'importe quel plan et avec n'importe quel fournisseur. L'analyse s'exécute via le même fournisseur et le même compte que vos sessions régulières, et les tokens comptent par rapport à votre utilisation de plan ou d'API. Les sessions d'autres appareils et de claude.ai ne sont pas incluses.
Ajouter des crédits d'utilisation à votre abonnement
Les crédits d'utilisation vous permettent de continuer à travailler au-delà de la limite d'utilisation de votre plan. Pour les gérer, exécutez /usage-credits après vous être connecté avec votre abonnement claude.ai via /login ; la commande n'est pas disponible avec l'authentification par clé API. Dans les organisations Enterprise en libre-service, les essais Enterprise et les organisations Enterprise facturées via AWS Marketplace, la commande nécessite Claude Code v2.1.248 ou version ultérieure ; les versions antérieures la rejettent avec Unknown command: /usage-credits. Ce qu'elle ouvre dépend de votre rôle :
| Votre rôle | Ce que /usage-credits fait |
|---|---|
| Abonné Pro ou Max | Ouvre Settings > Usage sur claude.ai dans le navigateur. Dans sa section Usage credits vous pouvez activer ou désactiver les crédits d'utilisation et vérifier votre solde de crédit, les dépenses de ce mois et votre limite de dépenses mensuelles |
| Membre Team ou Enterprise avec accès à la facturation | Ouvre les paramètres d'utilisation de votre organisation, Admin settings > Usage, dans le navigateur |
| Membre Team ou Enterprise sans accès à la facturation | Vous demande de confirmer, puis envoie une demande aux administrateurs de votre organisation. Avant la v2.1.211, Claude Code envoyait la demande sans étape de confirmation |
Pour les membres Team et Enterprise sans accès à la facturation, la confirmation n'apparaît que dans les sessions interactives : en mode non interactif avec le drapeau -p et depuis Remote Control, la commande n'envoie aucune demande et vous dit de l'exécuter dans une session interactive à la place.
Si vous exécutez /usage-credits à nouveau tandis que votre demande antérieure attend un administrateur, Claude Code vous dit qu'une demande a déjà été envoyée plutôt que d'envoyer un doublon. Après qu'un administrateur rejette votre demande, l'exécution de la commande à nouveau envoie une nouvelle. Avant la v2.1.222, une demande rejetée bloquait également les nouvelles demandes.
Sur les plans Pro et Max, quand vous atteignez votre limite de dépenses avec des crédits d'utilisation toujours disponibles, Claude Code vous invite à augmenter ou supprimer la limite sans quitter la CLI. Si le serveur rejette la modification, consultez Could not update your spend limit.
Gérer les coûts pour votre organisation
Les contrôles dont vous disposez dépendent de la façon dont votre organisation accède à Claude Code : un plan Claude for Teams ou Enterprise, la Claude Console, ou un fournisseur cloud. Sur les plans Teams et Enterprise, l'utilisation est prélevée sur l'allocation de siège de chaque membre. Sur la Console et chez les fournisseurs cloud, l'utilisation est facturée par token à votre organisation. Si votre organisation mélange les méthodes de connexion, chaque développeur est mesuré selon celle avec laquelle il s'est authentifié.
Le tableau mappe chaque configuration à l'endroit où vous voyez les dépenses, où vous les plafonnez, et comment vous extrayez les chiffres par utilisateur. Sur un plan Pro ou Max individuel, vous n'avez pas d'organisation à gérer, donc suivez vos propres dépenses en crédits d'utilisation, y compris le mode rapide, sous Ajouter des crédits d'utilisation à votre abonnement.
| Votre configuration | Voir les dépenses | Plafonner les dépenses | Rapports par utilisateur |
|---|---|---|---|
| Claude for Teams ou Enterprise | Rapport de dépenses dans l'analyse organisationnelle | Limites de dépenses dans les paramètres d'administration | CSV du rapport de dépenses ; API d'analyse Enterprise sur Enterprise |
| Claude Console (API) | Page d'utilisation de la Console | Limites de dépenses de l'espace de travail | Tableau de bord de la Console, API d'analyse Claude Code |
| Amazon Bedrock, Google Cloud's Agent Platform, ou Microsoft Foundry | Votre console de facturation cloud | Les contrôles budgétaires de votre cloud | OpenTelemetry ou une passerelle LLM |
L'export OpenTelemetry fonctionne sur chaque configuration et est la seule option qui diffuse les métriques de tokens et de coûts par utilisateur dans votre propre pile d'observabilité en temps quasi réel.
Signaler les dépenses à vos tarifs contractuels
Par défaut, Claude Code calcule chaque chiffre de coût qu'il affiche aux développeurs au prix catalogue, donc si votre organisation paie des tarifs contractuels, les chiffres dans /usage, la ligne d'état et OpenTelemetry ne correspondent pas à votre facture. Pour les faire correspondre, définissez le paramètre géré modelPricing à vos tarifs. Le paramètre change ce que Claude Code signale, pas ce qu'Anthropic facture. Nécessite Claude Code v2.1.242 ou ultérieur.
Prenez les tarifs de votre contrat
Entrez les tarifs par million de tokens de votre contrat. Claude Code ne les récupère pas de la Claude Console, donc mettez à jour le paramètre lorsque le contrat change.
Écrivez le paramètre
Définissez multiplier pour une réduction en pourcentage fixe du prix catalogue, listez les quatre tarifs par token de chaque modèle sous overrides, ou faites les deux. L'entrée modelPricing a la forme et un exemple prêt à coller.
Déployez-le via les paramètres gérés
Livrez-le en tant que paramètres gérés : paramètres gérés par serveur, une politique MDM, managed-settings.json, ou un assistant de politique. Claude Code ignore la clé dans les paramètres utilisateur, projet et locaux et dans --settings.
Pour confirmer que les tarifs sont en vigueur, exécutez /usage dans une session qui a reçu les paramètres gérés : la ligne Total cost du bloc Session porte la note at your organization's configured rates. Les chiffres sont toujours des estimations, pas une facture. Les prix par million de tokens dans le sélecteur /model restent au prix catalogue.
Claude for Teams et Enterprise
Sur les plans Claude for Teams et Enterprise, l'utilisation de Claude Code par chaque membre est prélevée sur une allocation par siège qui se réinitialise sur une fenêtre glissante de cinq heures et une fenêtre hebdomadaire. L'allocation est partagée avec Claude chat et Cowork, et sa taille dépend du niveau de siège (Standard ou Premium). Vos contrôles se trouvent dans la console d'administration claude.ai, pas dans la Claude Console.
- Voir les dépenses : le rapport de dépenses dans l'analyse organisationnelle affiche les dépenses estimées par utilisateur et par modèle, avec export CSV, mis à jour quotidiennement. Le rapport couvre les dépenses en crédits d'utilisation et apparaît une fois que les crédits d'utilisation sont activés. L'utilisation dans l'allocation de siège n'est pas mesurée en dollars.
- Voir l'adoption : le tableau de bord d'analyse affiche les utilisateurs actifs quotidiens, les sessions et les métriques de contribution, avec export CSV des données de contribution. Voir suivre l'utilisation de l'équipe avec l'analyse.
- Plafonner les dépenses : l'allocation de siège est le plafond par défaut. Pour permettre aux membres de continuer au-delà, activez les crédits d'utilisation et définissez les limites de dépenses au niveau de l'organisation, du groupe ou du membre individuel.
- Extraire les chiffres par utilisateur : sur le plan Enterprise, l'API d'analyse Enterprise retourne les rapports d'utilisation et de coûts par utilisateur sur toutes les surfaces Claude, y compris Claude Code. Un propriétaire principal crée une clé avec la portée
read:analyticsà claude.ai/analytics/api-keys. Sur le plan Teams, exportez le CSV du rapport de dépenses, qui répertorie l'utilisation des tokens et les dépenses estimées par utilisateur et par modèle.
Le guide de consommation Claude Enterprise est la référence de planification pour les administrateurs. Il explique comment la consommation diffère entre Claude chat, Claude Code et Cowork, et donne des points de départ en dollars par utilisateur pour la budgétisation. Budgétisez davantage pour un siège de codage que pour un siège de chat : chaque tour de Claude Code contient le contenu des fichiers, les appels d'outils et le raisonnement multi-étapes, donc une session de débogage peut consommer plus qu'une journée de chat.
Claude Console
Les organisations API gèrent les dépenses de Claude Code via les espaces de travail. Vous pouvez définir les limites de dépenses de l'espace de travail sur la dépense totale de Claude Code et afficher les rapports de coûts et d'utilisation dans la Console.
Lorsque vous authentifiez pour la première fois Claude Code avec votre compte Claude Console, un espace de travail appelé « Claude Code » est automatiquement créé pour vous. Cet espace de travail fournit un suivi et une gestion centralisés des coûts pour toute l'utilisation de Claude Code dans votre organisation. Vous ne pouvez pas créer de clés API pour cet espace de travail ; il est exclusivement destiné à l'authentification et à l'utilisation de Claude Code.
Pour les organisations avec des limites de débit personnalisées, le trafic Claude Code dans cet espace de travail compte vers les limites de débit API globales de votre organisation. Vous pouvez définir une limite de débit d'espace de travail sur la page Limites de cet espace de travail dans la Console Claude pour limiter la part de Claude Code et protéger les autres charges de travail de production.
Pour les rapports par utilisateur, le tableau de bord de la Console affiche les dépenses et les lignes acceptées par membre, et l'API d'analyse Claude Code retourne les mêmes métriques quotidiennes par utilisateur par programmation avec une clé API Admin. Voir analyse pour les clients API.
Recommandations de limite de débit
Lors de la configuration de Claude Code pour les équipes, tenez compte de ces recommandations de Token Par Minute (TPM) et Requête Par Minute (RPM) par utilisateur en fonction de la taille de votre organisation :
| Taille de l'équipe | TPM par utilisateur | RPM par utilisateur |
|---|---|---|
| 1-5 utilisateurs | 200 000-300 000 | 5-7 |
| 5-20 utilisateurs | 100 000-150 000 | 2,5-3,5 |
| 20-50 utilisateurs | 50 000-75 000 | 1,25-1,75 |
| 50-100 utilisateurs | 25 000-35 000 | 0,62-0,87 |
| 100-500 utilisateurs | 15 000-20 000 | 0,37-0,47 |
| 500+ utilisateurs | 10 000-15 000 | 0,25-0,35 |
Par exemple, si vous avez 200 utilisateurs, vous pourriez demander 20 000 TPM pour chaque utilisateur, soit 4 millions de TPM au total (200 × 20 000 = 4 millions).
Le TPM par utilisateur diminue à mesure que la taille de l'équipe augmente, car moins d'utilisateurs ont tendance à utiliser Claude Code simultanément dans les grandes organisations. Ces limites de débit s'appliquent au niveau de l'organisation, et non par utilisateur individuel, ce qui signifie que les utilisateurs individuels peuvent temporairement consommer plus que leur part calculée lorsque d'autres n'utilisent pas activement le service.
Si vous anticipez des scénarios avec une utilisation concurrente inhabituellement élevée (comme des sessions de formation en direct avec de grands groupes), vous pourriez avoir besoin d'allocations TPM plus élevées par utilisateur.
Fournisseurs cloud
Sur Amazon Bedrock, Google Cloud's Agent Platform et Microsoft Foundry, Claude Code est facturé par token à votre compte cloud, et les contrôles de dépenses se trouvent dans la console de facturation de votre fournisseur cloud. Claude Code n'envoie pas de métriques de votre cloud vers Anthropic, donc les tableaux de bord d'analyse et l'API d'analyse Claude Code ne couvrent pas cette utilisation.
Pour l'attribution des coûts par utilisateur, vous avez trois options :
- OpenTelemetry : exporter les métriques de la machine de chaque développeur vers votre propre pile d'observabilité. Cela vous donne les décomptes de tokens par utilisateur, les coûts et l'activité des outils quel que soit le fournisseur.
- Une passerelle d'applications Claude : une passerelle d'applications Claude auto-hébergée fournit l'attribution d'utilisation par utilisateur, les métriques OTLP avec les décomptes de tokens, et les limites de dépenses par utilisateur sur ces fournisseurs.
- Une passerelle LLM : acheminez tout le trafic Claude Code via un proxy qui suit les dépenses par clé. Plusieurs grandes entreprises ont signalé l'utilisation de LiteLLM, un outil open-source qui suit les dépenses par clé. Ce projet n'est pas affilié à Anthropic et n'a pas été audité pour la sécurité.
Quand un développeur pose des questions sur une limite
Les développeurs apportent généralement les questions de limite à leur administrateur, il est donc utile de savoir quel plafond ils ont atteint. Les quatre situations signifient des choses différentes :
- « Vous avez atteint votre limite de session » ou « Vous avez atteint votre limite hebdomadaire » : une fenêtre d'utilisation basée sur le siège sur un plan d'abonnement, partagée sur tous les modèles, donc le développeur ne peut pas restaurer l'accès en changeant de modèles avec
/model. Le message affiche quand la fenêtre se réinitialise. Après le message spécifique au modèle « Vous avez atteint votre limite Opus » ou « Vous avez atteint votre limite Sonnet », passer à un modèle en dehors de cette famille avec/modelpermet au développeur de continuer à travailler. Voir erreurs de limite d'utilisation. Ce que le développeur peut faire en attendant :- Exécutez
/usage-creditspour demander une utilisation au-delà de l'allocation, si vous avez activé les crédits d'utilisation. - Sur Claude Code v2.1.234 ou ultérieur, attendez et continuez la tâche interrompue automatiquement après la réinitialisation ; cette section énumère quand Claude Code démarre l'attente de lui-même et quand le développeur la choisit dans
/rate-limit-options. Pour contrôler pour votre flotte si Claude Code démarre cette attente de lui-même, définissezautoContinueAtUsageLimitdans les paramètres gérés.
- Exécutez
- Un message de limite de dépenses d'une passerelle d'applications Claude : le développeur a dépassé un plafond de dépenses que vous avez défini sur votre passerelle auto-hébergée, et la passerelle bloque ses demandes jusqu'à ce que la période se réinitialise ou que vous augmentiez le plafond. Voir limites de dépenses de la passerelle pour les plafonds, les calendriers de réinitialisation et le message que le développeur voit.
- Un avertissement de contexte ou d'auto-compactage : pas une limite d'utilisation. La conversation s'est rapprochée de la fenêtre d'auto-compactage de la session, le seuil où Claude Code résume l'historique plus ancien pour libérer de l'espace. Pointez le développeur vers réduire l'utilisation des tokens.
- Des dépenses inhabituellement élevées sur un plan API ou fournisseur cloud : généralement tracées jusqu'à des sessions longues qui n'ont jamais été effacées ou à Opus laissé comme modèle par défaut. Les habitudes à impact le plus élevé à partager sont l'effacement entre les tâches non liées et l'adaptation du modèle au travail, tous deux couverts dans réduire l'utilisation des tokens.
Coûts en tokens des équipes d'agents
Les équipes d'agents lancent plusieurs instances de Claude Code, chacune avec sa propre fenêtre de contexte. L'utilisation des tokens augmente avec le nombre de coéquipiers actifs et la durée d'exécution de chacun.
Pour maintenir les coûts des équipes d'agents gérables :
- Utilisez Sonnet pour les coéquipiers. Il équilibre la capacité et le coût pour les tâches de coordination.
- Gardez les équipes petites. Chaque coéquipier exécute sa propre fenêtre de contexte, donc l'utilisation des tokens est à peu près proportionnelle à la taille de l'équipe.
- Gardez les invites de génération concentrées. Les coéquipiers chargent CLAUDE.md, les serveurs MCP et les skills automatiquement, mais tout ce qui se trouve dans l'invite de génération s'ajoute à leur contexte dès le départ.
- Arrêtez les coéquipiers lorsque leur travail est terminé. Chaque coéquipier actif continue à consommer des tokens jusqu'à ce qu'il se termine ou que la session se termine.
- Les équipes d'agents sont désactivées par défaut. Définissez
CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1dans votre settings.json ou dans l'environnement pour les activer. Voir activer les équipes d'agents.
Réduire l'utilisation des tokens
Les coûts des tokens augmentent avec la taille du contexte : plus Claude traite de contexte, plus vous utilisez de tokens. Claude Code optimise automatiquement les coûts grâce à la mise en cache des invites, qui réduit les coûts pour le contenu répété comme les invites système, et à la compaction automatique, qui résume l'historique des conversations en approchant les limites du contexte.
Les stratégies suivantes vous aident à maintenir le contexte petit et à réduire les coûts par message.
Gérer le contexte de manière proactive
Utilisez /usage pour vérifier votre utilisation actuelle des tokens, ou configurez votre ligne d'état pour l'afficher en continu.
- Effacer entre les tâches : Utilisez
/clearpour recommencer à zéro lorsque vous passez à un travail non lié. Le contexte obsolète gaspille des tokens à chaque message suivant. Utilisez/renameavant d'effacer pour pouvoir facilement retrouver la session plus tard, puis/resumepour y revenir. - Ajouter des instructions de compaction personnalisées :
/compact Focus on code samples and API usageindique à Claude ce qu'il faut préserver lors de la résumé. Dans une session nouvelle,/compactafficheNot enough messages to compact.car il n'y a pas encore d'historique de conversation à résumer.
Vous pouvez également personnaliser le comportement de compaction dans votre fichier CLAUDE.md à la racine de votre projet :
# Compact instructions
When you are using compact, please focus on test output and code changes
Choisir le bon modèle
Sonnet gère bien la plupart des tâches de codage et coûte moins cher qu'Opus. Réservez Opus pour les décisions architecturales complexes ou le raisonnement multi-étapes. Utilisez /model pour changer de modèle en cours de session, ou définissez une valeur par défaut dans /config. Pour les tâches simples de subagent, spécifiez model: haiku dans votre configuration de subagent.
Réduire la surcharge des serveurs MCP
Les définitions d'outils MCP sont reportées par défaut, donc seuls les noms d'outils et les instructions du serveur entrent en contexte jusqu'à ce que Claude utilise un outil spécifique. Exécutez /context pour voir ce qui consomme de l'espace.
- Préférez les outils CLI lorsqu'ils sont disponibles : Les outils comme
gh,aws,gcloudetsentry-clisont plus efficaces en contexte que les serveurs MCP car ils n'ajoutent pas de liste d'outils par outil. Claude peut exécuter les commandes CLI directement. - Désactiver les serveurs inutilisés : Exécutez
/mcppour voir les serveurs configurés et désactiver ceux que vous n'utilisez pas activement.
Installer des plugins d'intelligence de code pour les langages typés
Les plugins d'intelligence de code donnent à Claude une navigation de symboles précise au lieu d'une recherche basée sur le texte, réduisant les lectures de fichiers inutiles lors de l'exploration de code inconnu. Un seul appel « aller à la définition » remplace ce qui pourrait autrement être une recherche grep suivie de la lecture de plusieurs fichiers candidats. Les serveurs de langage installés signalent également automatiquement les erreurs de type après les modifications, donc Claude détecte les erreurs sans exécuter un compilateur.
Déléguer le traitement aux hooks et aux skills
Les hooks personnalisés peuvent prétraiter les données avant que Claude ne les voie. Au lieu que Claude lise un fichier journal de 10 000 lignes pour trouver les erreurs, un hook peut rechercher ERROR et retourner uniquement les lignes correspondantes, réduisant le contexte de dizaines de milliers de tokens à des centaines.
Une skill peut donner à Claude des connaissances de domaine pour qu'il n'ait pas à explorer. Par exemple, une skill « codebase-overview » pourrait décrire l'architecture de votre projet, les répertoires clés et les conventions de nommage. Lorsque Claude invoque la skill, il obtient ce contexte immédiatement au lieu de dépenser des tokens pour lire plusieurs fichiers pour comprendre la structure.
Par exemple, ce hook PreToolUse filtre la sortie des tests pour afficher uniquement les échecs :
Ajoutez ceci à votre settings.json pour exécuter le hook avant chaque commande Bash :
{
"hooks": {
"PreToolUse": [
{
"matcher": "Bash",
"hooks": [
{
"type": "command",
"command": "~/.claude/hooks/filter-test-output.sh"
}
]
}
]
}
}
Le hook appelle ce script. Créez le dossier avec mkdir -p ~/.claude/hooks, enregistrez le script ci-dessous sous ~/.claude/hooks/filter-test-output.sh et rendez-le exécutable avec chmod +x ~/.claude/hooks/filter-test-output.sh. Il vérifie si la commande est un exécuteur de test et la modifie pour afficher uniquement les échecs :
#!/bin/bash
input=$(cat)
cmd=$(echo "$input" | jq -r '.tool_input.command')
# If running tests, filter to show only failures
if [[ "$cmd" =~ ^(npm test|pytest|go test) ]]; then
filtered_cmd="$cmd 2>&1 | grep -A 5 -E '(FAIL|ERROR|error:)' | head -100"
echo "$input" | jq --arg filtered "$filtered_cmd" \
'{hookSpecificOutput: {hookEventName: "PreToolUse", permissionDecision: "allow", updatedInput: (.tool_input + {command: $filtered})}}'
else
echo "{}"
fi
Pour vérifier la configuration, exécutez /hooks et vérifiez que le hook apparaît sous PreToolUse. Vous pouvez également démarrer Claude Code avec claude --debug-file ./claude-debug.txt et demander à Claude d'exécuter npm test. Lorsque le hook réécrit la commande, ce fichier journal contient une ligne modified tool input keys listant command et les autres champs d'entrée Bash.
Déplacer les instructions de CLAUDE.md vers les skills
Votre fichier CLAUDE.md est chargé en contexte au démarrage de la session. S'il contient des instructions détaillées pour des flux de travail spécifiques (comme les révisions de PR ou les migrations de base de données), ces tokens sont présents même lorsque vous faites un travail non lié. Les skills se chargent à la demande uniquement lorsqu'elles sont invoquées, donc déplacer les instructions spécialisées dans les skills maintient votre contexte de base plus petit. Visez à garder CLAUDE.md en dessous de 200 lignes en incluant uniquement les éléments essentiels.
Ajuster la réflexion étendue
La réflexion étendue est activée par défaut car elle améliore considérablement les performances sur les tâches complexes de planification et de raisonnement. Les tokens de réflexion sont facturés comme des tokens de sortie, et le budget par défaut peut être des dizaines de milliers de tokens par requête selon le modèle.
Pour les tâches plus simples où un raisonnement approfondi n'est pas nécessaire, vous pouvez réduire les coûts en abaissant le niveau d'effort avec /effort ou dans /model, ou en désactivant la réflexion dans /config. Vous ne pouvez pas désactiver la réflexion sur les modèles Fable, qui utilisent toujours la réflexion étendue.
Sur les modèles avec un budget de réflexion fixe, vous pouvez également abaisser le budget en définissant la variable d'environnement MAX_THINKING_TOKENS, par exemple MAX_THINKING_TOKENS=8000. Les modèles de raisonnement adaptatif ignorent les budgets non nuls, donc utilisez plutôt les niveaux d'effort.
Déléguer les opérations détaillées aux subagents
L'exécution de tests, la récupération de documentation ou le traitement de fichiers journaux peuvent consommer un contexte important. Déléguez-les aux subagents pour que la sortie détaillée reste dans le contexte du subagent tandis que seul un résumé revient à votre conversation principale.
Gérer les coûts des équipes d'agents
Les équipes d'agents utilisent environ 7 fois plus de tokens que les sessions standard lorsque les coéquipiers s'exécutent en mode plan, car chaque coéquipier maintient sa propre fenêtre de contexte et s'exécute en tant qu'instance Claude distincte. Gardez les tâches d'équipe petites et autonomes pour limiter l'utilisation des tokens par coéquipier. Voir équipes d'agents pour plus de détails.
Écrire des invites spécifiques
Les demandes vagues comme « améliorer cette base de code » déclenchent une analyse large. Les demandes spécifiques comme « ajouter la validation des entrées à la fonction de connexion dans auth.ts » permettent à Claude de travailler efficacement avec des lectures de fichiers minimales.
Travailler efficacement sur des tâches complexes
Pour un travail plus long ou plus complexe, ces habitudes aident à éviter les tokens gaspillés en prenant la mauvaise direction :
- Utilisez le mode plan pour les tâches complexes : Appuyez sur Maj+Tab pour entrer en mode plan avant l'implémentation. Claude explore la base de code et propose une approche pour votre approbation, évitant les retouches coûteuses lorsque la direction initiale est mauvaise.
- Corriger la trajectoire tôt : Si Claude commence à aller dans la mauvaise direction, appuyez sur Échap pour arrêter immédiatement. Utilisez
/rewindou appuyez deux fois sur Échap pour restaurer la conversation et le code à un point de contrôle précédent. - Donner des cibles de vérification : Incluez des cas de test, collez des captures d'écran ou définissez la sortie attendue dans votre invite. Lorsque Claude peut vérifier son propre travail, il détecte les problèmes avant que vous ayez besoin de demander des corrections.
- Tester de manière progressive : Écrivez un fichier, testez-le, puis continuez. Cela détecte les problèmes tôt lorsqu'ils sont bon marché à corriger.
Utilisation des tokens en arrière-plan
Claude Code utilise des tokens pour certaines fonctionnalités en arrière-plan même lorsqu'il est inactif :
- Résumé des conversations : Les tâches en arrière-plan qui résument les conversations précédentes pour la fonctionnalité
claude --resume - Traitement des commandes : Certaines commandes comme
/usagepeuvent générer des requêtes pour vérifier l'état
Ces processus en arrière-plan consomment une petite quantité de tokens (généralement moins de 0,04 $ par session) même sans interaction active.
Pourquoi l'utilisation augmente dans une longue session
Une session qui a été ouverte pendant des heures peut utiliser bien plus de vos limites de plan que votre activité ne le suggère, généralement pour l'une de ces raisons :
- Contexte long : Claude Code envoie votre conversation complète avec chaque requête, et chaque fois que Claude utilise des outils, il envoie une autre requête contenant ce lot de résultats d'outils. Avec la mise en cache des invites, Claude Code relit cet historique au taux de jetons mis en cache, donc une question d'une ligne dans une session ouverte toute la journée consomme quand même l'utilisation pour toute la conversation. Consultez Gérer le contexte de manière proactive pour découvrir des façons de garder votre contexte petit
- Absences de cache : votre premier message après une pause plus longue que la durée de vie du cache manque le cache et retraite votre contexte complet. La durée de vie est d'une heure sur un abonnement et tombe à cinq minutes une fois que vous utilisez des crédits d'utilisation ; sur une clé API ou un fournisseur cloud, c'est cinq minutes par défaut. Pour conserver la durée de vie d'une heure tout en utilisant des crédits d'utilisation, choisissez vous-même le TTL. Sur les plans Pro et Max, lorsque vous reprenez une grande session après une longue pause, Claude Code propose de reprendre à partir d'un résumé afin que les requêtes ultérieures ne portent pas l'historique complet
- Tâches planifiées : une tâche planifiée s'exécute selon son intervalle même pendant que la session est inactive, envoyant votre contexte complet à chaque fois
- Messages entre sessions : Claude Code livre un message d'une autre de vos sessions comme un nouveau tour lorsque cette session est inactive, envoyant votre contexte complet à chaque fois. Pour retenir les messages entrants au lieu de les livrer, définissez
crossSessionInboundsurhold - Vérifications d'objectifs : tandis que le travail en arrière-plan maintient un objectif actif en attente, Claude Code demande à Claude de vérifier ce travail même lorsque la session est inactive, en commençant un nouveau tour qui envoie votre contexte complet. Claude Code démarre au maximum trois vérifications inactives par objectif entre vos invites. Avant la v2.1.246, les vérifications inactives n'étaient pas limitées. Pour désactiver les vérifications, définissez
CLAUDE_CODE_GOAL_CHECKIN_MINUTESsur0. Les vérifications inactives nécessitent Claude Code v2.1.236 ou version ultérieure - Coéquipiers agents : chaque coéquipier actif continue de consommer des jetons jusqu'à sa sortie
- Compaction :
/compactlit la conversation qu'il résume, donc compacter un grand contexte est en soi une grande requête. Lorsque vous voulez un nouveau départ au lieu de continuité,/clearne coûte rien
Sur un plan Pro, Max, Team ou Enterprise, la répartition /usage signale les comportements qui représentent 10 % ou plus de votre utilisation récente, comme un contexte long ou des absences de cache, chacun avec un conseil pour le réduire.
Comprendre les changements de comportement de Claude Code
Claude Code reçoit régulièrement des mises à jour qui peuvent modifier le fonctionnement des fonctionnalités, y compris la génération de rapports de coûts. Exécutez claude --version pour vérifier votre version actuelle.
Pour les questions de facturation concernant votre compte spécifique, contactez le support Anthropic via le messenger intégré au produit :
- Plans d'abonnement (Pro, Max, Team, Enterprise) : connectez-vous sur claude.ai, cliquez sur vos initiales en bas à gauche, et sélectionnez Obtenir de l'aide
- Facturation Console (API) : connectez-vous sur platform.claude.com, cliquez sur vos initiales, et sélectionnez Obtenir de l'aide
Consultez Comment obtenir du support pour connaître le processus complet, y compris qui peut vous mettre en contact avec un agent humain selon votre plan.