SpyBara
Go Premium

costs.md 2026-09-23 23:57 UTC to 2026-09-24 22:57 UTC

This page contains 2 additions and 0 deletions.

2026
Wed 9 22:58 Sat 12 03:02 Mon 14 22:58 Fri 18 23:58 Tue 22 23:59 Thu 24 22:57 Fri 25 23:58

Gérer les coûts efficacement

Suivez l'utilisation des tokens, définissez des limites de dépenses pour l'équipe, et réduisez les coûts de Claude Code grâce à la gestion du contexte, la sélection du modèle, les paramètres de réflexion étendue et les hooks de prétraitement.

Claude Code facture selon la consommation de tokens API. Pour les tarifs des plans d'abonnement (Pro, Max, Team, Enterprise), consultez claude.com/pricing. Les coûts par développeur varient considérablement en fonction de la sélection du modèle, de la taille de la base de code et des modèles d'utilisation tels que l'exécution de plusieurs instances ou l'automatisation.

Dans les déploiements d'entreprise, le coût moyen est d'environ 13 $par développeur par jour actif et de 150 à 250$ par développeur par mois, les coûts restant en dessous de 30 $ par jour actif pour 90 % des utilisateurs. Pour estimer les dépenses de votre équipe, commencez par un petit groupe pilote et utilisez les outils de suivi ci-dessous pour établir une base de référence avant un déploiement plus large.

Cette page explique comment suivre vos coûts, gérer les coûts pour votre organisation et réduire l'utilisation des tokens.

Suivre vos coûts

Utiliser la commande `/usage`

Le bloc Session en haut de /usage affiche des statistiques détaillées sur l'utilisation des tokens pour votre session actuelle. Claude Code calcule le chiffre en dollars localement à partir des décomptes de tokens au prix catalogue, sauf si une table modelPricing est en vigueur. Un administrateur en définit une dans les paramètres gérés de votre organisation afin que le chiffre utilise vos tarifs contractuels, et tant qu'une table est en vigueur, la ligne Total cost porte la note at your organization's configured rates. Le chiffre est une estimation, donc pour une facturation fiable, consultez la page Utilisation dans la Console Claude.

Total cost:            $0.55
Total duration (API):  6m 20s
Total duration (wall): 6h 33m 10s
Total code changes:    0 lines added, 0 lines removed
Usage by model:
   claude-sonnet-4-6:  1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)

Ces totaux se réinitialisent quand /clear démarre une nouvelle session, donc le coût total de la session suivante recommence à $0. Avant la v2.1.211, ils continuaient à s'accumuler sur /clear pendant la durée de vie du processus Claude Code.

Pour une réponse de l'API Claude facturée au taux de résidence des données 1,1×, Claude Code multiplie le prix catalogue des tokens de cette réponse par 1,1 dans le chiffre du coût de session. Le même total apparaît dans le champ de coût de la ligne d'état, et le chiffre multiplié compte également vers --max-budget-usd. Avant la v2.1.239, Claude Code n'appliquait pas le 1,1× à ces réponses, donc le chiffre du coût de session était inférieur à la facture.

Statistiques du cache de prompt

Après la première réponse API de la conversation principale, Claude Code ajoute également une ligne Prompt cache (main) au bloc Session, résumant l'utilisation du cache de prompt de la session : le nombre de demandes, la part des tokens d'entrée servis à partir du cache, les défauts de cache, et si le cache est chaud en ce moment. Nécessite Claude Code v2.1.251 ou version ultérieure.

Prompt cache (main):   14 requests · 91% of input tokens from cache · 2 misses (last 6m 10s ago, 310.2k tokens re-cached) · 1 expected rebuild (compaction or tool-result clearing) · warm (1h TTL, last activity 40s ago)

Les défauts, les reconstructions attendues, et les parties chaudes ou froides de la ligne signifient ce qui suit :

  • Misses : demandes qui ont retraité le contenu que le cache contenait déjà, avec l'heure du dernier défaut et le nombre de tokens que ces demandes ont réécrits dans le cache. Claude Code compte une demande comme un défaut quand la demande a retraité plus de 5 % et au moins 2 000 tokens de ce qu'elle aurait pu lire à partir du cache. Les actions qui invalident le cache énumèrent les causes habituelles. Quand Claude Code peut identifier une cause probable du dernier défaut, la ligne la nomme aussi, par exemple likely cause: tool definitions changed. Le texte de cause probable nécessite Claude Code v2.1.260 ou version ultérieure.
  • Expected rebuilds : quand Claude Code a lui-même réécrit la conversation, par compaction ou en supprimant les anciens résultats d'outils du contexte, il compte le même type de défaut comme une reconstruction attendue à la place. Cette partie n'apparaît qu'après qu'au moins une reconstruction attendue s'est produite.
  • Warm or cold : si le préfixe mis en cache se trouve toujours dans sa durée de vie du cache, avec le TTL en vigueur. Quand le cache est froid, la ligne affiche depuis combien de temps la session est inactive. Quand aucune réponse n'a rapporté de tokens de cache, la ligne se termine par no prompt caching reported by the API à la place.

Les décomptes proviennent des champs de tokens de cache dans les réponses de l'API, donc la ligne fonctionne sur chaque fournisseur et passerelle. Elle couvre la conversation principale uniquement, pas les subagents. /clear la réinitialise avec le reste du bloc Session.

Les scripts de ligne d'état peuvent lire les mêmes nombres à partir de l'objet prompt_cache.

Ventilation de l'utilisation du plan

Sur un plan Pro, Max, Team ou Enterprise, /usage affiche également une ventilation de ce qui compte par rapport à vos limites de plan :

  • Attribution : utilisation récente attribuée aux skills, subagents, plugins et serveurs MCP individuels, chacun affiché en pourcentage du total. La part d'un serveur MCP compte uniquement les demandes qui ont consommé l'un de ses résultats d'outils. Avant la v2.1.222, après un appel à un serveur MCP, Claude Code attribuait chaque demande ultérieure à ce serveur, surestimant sa part.
  • Behavior flags : comportements tels que le contexte long ou les défauts de cache, signalés quand l'un d'eux représente 10 % ou plus de l'utilisation récente.
  • Loops : une ligne pour chacune des tâches /loop ou autres tâches planifiées les plus lourdes qui ont été exécutées récemment, ordonnées par tokens totaux, avec un décompte du reste. Claude Code rapporte la fréquence d'exécution de chaque tâche, le nombre de fois qu'elle a été exécutée, ses tokens totaux et par exécution, et quand elle a été exécutée pour la dernière fois. Claude Code clé une ligne par le prompt de la tâche, donc une boucle que vous arrêtez et recréez reste une ligne. Nécessite Claude Code v2.1.242 ou version ultérieure.

Appuyez sur d ou w pour basculer entre les 24 dernières heures et les 7 derniers jours. Les chiffres sont approximatifs et calculés à partir de l'historique des sessions locales sur cette machine, donc l'utilisation d'autres appareils ou de claude.ai n'est pas incluse.

Dans l'extension VS Code, les parts d'attribution et les drapeaux de comportement apparaissent dans la boîte de dialogue Compte et utilisation avec un bouton bascule Jour et Semaine, sans les lignes Loops.

Vérifier vos dépenses en crédits d'utilisation

/usage affiche également une ligne de crédits d'utilisation tandis que les crédits d'utilisation sont activés. Ce que la ligne affiche dépend de votre plan :

  • Pro et Max : vos dépenses pour le mois en cours, mesurées par rapport à votre limite de dépenses mensuelles quand vous en avez défini une. Quand vous n'avez pas défini de limite, la ligne affiche Unlimited et aucun chiffre de dépenses.
  • Team et Enterprise : vos propres dépenses pour le mois en cours, mesurées par rapport à toute limite que votre organisation a définie qui s'applique à vous. Une limite qui couvre l'ensemble de l'organisation n'apparaît pas dans la ligne. Quand vous n'avez pas de limite qui vous est propre, la ligne affiche vos dépenses sans limite à côté. Tandis que les crédits d'utilisation sont désactivés pour vous, /usage n'affiche aucune ligne de crédits d'utilisation.

Quand vous avez une limite de dépenses, la ligne apparaît dès que les crédits d'utilisation sont activés et affiche 0 % jusqu'à ce que vous dépensez d'abord des crédits d'utilisation. Avant la v2.1.236, /usage affichait la ligne uniquement sur les plans Pro et Max, et une ligne avec une limite de dépenses restait cachée jusqu'à ce que vous ayez dépensé quelque chose.

Quand la demande d'utilisation échoue

Quand la demande de vos limites de plan échoue, le plus souvent parce que le point de terminaison d'utilisation est limité en débit, /usage affiche les dernières barres d'utilisation qu'il a chargées sur cette machine au cours des 60 dernières minutes, ainsi qu'une note « Showing last-known usage » indiquant depuis combien de temps ces données ont été récupérées. Appuyez sur r pour réessayer ; une nouvelle tentative réussie remplace les dernières barres connues par des données actualisées. Sans un instantané des 60 dernières minutes, /usage signale que le point de terminaison d'utilisation est limité en débit et propose le même raccourci de nouvelle tentative. Avant la v2.1.208, une demande limitée en débit dans une session qui n'avait pas encore chargé l'utilisation affichait toujours l'erreur sans barres.

Analyser vos modèles d'utilisation

Exécutez /insights pour un rapport sur votre façon de travailler plutôt que sur le nombre de tokens que vous avez utilisés. Il analyse vos sessions récentes sur cette machine et écrit un rapport HTML couvrant ce sur quoi vous travaillez, les points de friction tels que les demandes mal comprises ou le code bogué, et les suggestions pour utiliser Claude Code plus efficacement. Une seule exécution analyse jusqu'à 200 sessions qu'il n'a pas vues auparavant et ignore les très courtes. Quand des sessions sont omises, l'en-tête du rapport affiche le nombre analysé avec le total entre parenthèses, par exemple 200 sessions (412 total).

Claude Code écrit le dernier rapport dans ~/.claude/usage-data/report.html et enregistre une copie horodatée de chaque exécution dans le même répertoire, donc les rapports antérieurs ne sont pas écrasés. Claude Code supprime les rapports selon le même calendrier que le reste de vos données de session : au démarrage, il supprime les fichiers plus anciens que cleanupPeriodDays, 30 jours par défaut.

Vous pouvez exécuter /insights sur n'importe quel plan et avec n'importe quel fournisseur. L'analyse s'exécute via le même fournisseur et le même compte que vos sessions régulières, et les tokens comptent par rapport à votre utilisation de plan ou d'API. Les sessions d'autres appareils et de claude.ai ne sont pas incluses.

Ajouter des crédits d'utilisation à votre abonnement

Les crédits d'utilisation vous permettent de continuer à travailler au-delà de la limite d'utilisation de votre plan. Pour les gérer, exécutez /usage-credits après vous être connecté avec votre abonnement claude.ai via /login ; la commande n'est pas disponible avec l'authentification par clé API. Dans les organisations Enterprise en libre-service, les essais Enterprise et les organisations Enterprise facturées via AWS Marketplace, la commande nécessite Claude Code v2.1.248 ou version ultérieure ; les versions antérieures la rejettent avec Unknown command: /usage-credits. Ce qu'elle ouvre dépend de votre rôle :

Votre rôle Ce que /usage-credits fait
Abonné Pro ou Max Ouvre Settings > Usage sur claude.ai dans le navigateur. Dans sa section Usage credits vous pouvez activer ou désactiver les crédits d'utilisation et vérifier votre solde de crédit, les dépenses de ce mois et votre limite de dépenses mensuelles
Membre Team ou Enterprise avec accès à la facturation Ouvre les paramètres d'utilisation de votre organisation, Admin settings > Usage, dans le navigateur
Membre Team ou Enterprise sans accès à la facturation Vous demande de confirmer, puis envoie une demande aux administrateurs de votre organisation. Avant la v2.1.211, Claude Code envoyait la demande sans étape de confirmation

Pour les membres Team et Enterprise sans accès à la facturation, la confirmation n'apparaît que dans les sessions interactives : en mode non interactif avec le drapeau -p et depuis Remote Control, la commande n'envoie aucune demande et vous dit de l'exécuter dans une session interactive à la place.

Si vous exécutez /usage-credits à nouveau tandis que votre demande antérieure attend un administrateur, Claude Code vous dit qu'une demande a déjà été envoyée plutôt que d'envoyer un doublon. Après qu'un administrateur rejette votre demande, l'exécution de la commande à nouveau envoie une nouvelle. Avant la v2.1.222, une demande rejetée bloquait également les nouvelles demandes.

Sur les plans Pro et Max, quand vous atteignez votre limite de dépenses avec des crédits d'utilisation toujours disponibles, Claude Code vous invite à augmenter ou supprimer la limite sans quitter la CLI. Si le serveur rejette la modification, consultez Could not update your spend limit.

Gérer les coûts pour votre organisation

Les contrôles dont vous disposez dépendent de la façon dont votre organisation accède à Claude Code : un plan Claude for Teams ou Enterprise, la Claude Console, ou un fournisseur cloud. Sur les plans Teams et Enterprise, l'utilisation est prélevée sur l'allocation de siège de chaque membre. Sur la Console et chez les fournisseurs cloud, l'utilisation est facturée par token à votre organisation. Si votre organisation mélange les méthodes de connexion, chaque développeur est mesuré selon celle avec laquelle il s'est authentifié.

Le tableau mappe chaque configuration à l'endroit où vous voyez les dépenses, où vous les plafonnez, et comment vous extrayez les chiffres par utilisateur. Sur un plan Pro ou Max individuel, vous n'avez pas d'organisation à gérer, donc suivez vos propres dépenses en crédits d'utilisation, y compris le mode rapide, sous Ajouter des crédits d'utilisation à votre abonnement.

Votre configuration Voir les dépenses Plafonner les dépenses Rapports par utilisateur
Claude for Teams ou Enterprise Rapport de dépenses dans l'analyse organisationnelle Limites de dépenses dans les paramètres d'administration CSV du rapport de dépenses ; API d'analyse Enterprise sur Enterprise
Claude Console (API) Page d'utilisation de la Console Limites de dépenses de l'espace de travail Tableau de bord de la Console, API d'analyse Claude Code
Amazon Bedrock, Google Cloud's Agent Platform, ou Microsoft Foundry Votre console de facturation cloud Les contrôles budgétaires de votre cloud OpenTelemetry ou une passerelle LLM

L'export OpenTelemetry fonctionne sur chaque configuration et est la seule option qui diffuse les métriques de tokens et de coûts par utilisateur dans votre propre pile d'observabilité en temps quasi réel.

Signaler les dépenses à vos tarifs contractuels

Par défaut, Claude Code calcule chaque chiffre de coût qu'il affiche aux développeurs au prix catalogue, donc si votre organisation paie des tarifs contractuels, les chiffres dans /usage, la ligne d'état et OpenTelemetry ne correspondent pas à votre facture. Pour les faire correspondre, définissez le paramètre géré modelPricing à vos tarifs. Le paramètre change ce que Claude Code signale, pas ce qu'Anthropic facture. Nécessite Claude Code v2.1.242 ou ultérieur.

1

Prenez les tarifs de votre contrat

Entrez les tarifs par million de tokens de votre contrat. Claude Code ne les récupère pas de la Claude Console, donc mettez à jour le paramètre lorsque le contrat change.

2

Écrivez le paramètre

Définissez multiplier en dessous de 1 pour une réduction forfaitaire ou au-dessus de 1 pour une majoration, listez les quatre tarifs par token de chaque modèle sous overrides, ou faites les deux. Une majoration nécessite Claude Code v2.1.271 ou ultérieur. L'entrée modelPricing a la forme et un exemple prêt à coller.

3

Déployez-le via les paramètres gérés

Livrez-le en tant que paramètres gérés : paramètres gérés par serveur, une politique MDM, managed-settings.json, ou un assistant de politique. Claude Code ignore la clé dans les paramètres utilisateur, projet et locaux et dans --settings.

Pour confirmer que les tarifs sont en vigueur, exécutez /usage dans une session qui a reçu les paramètres gérés : la ligne Total cost du bloc Session porte la note at your organization's configured rates. Les chiffres sont toujours des estimations, pas une facture. Les prix par million de tokens dans le sélecteur /model restent au prix catalogue.

Claude for Teams et Enterprise

Sur les plans Claude for Teams et Enterprise, l'utilisation de Claude Code par chaque membre est prélevée sur une allocation par siège qui se réinitialise sur une fenêtre glissante de cinq heures et une fenêtre hebdomadaire. L'allocation est partagée avec Claude chat et Cowork, et sa taille dépend du niveau de siège (Standard ou Premium). Vos contrôles se trouvent dans la console d'administration claude.ai, pas dans la Claude Console.

  • Voir les dépenses : le rapport de dépenses dans l'analyse organisationnelle affiche les dépenses estimées par utilisateur et par modèle, avec export CSV, mis à jour quotidiennement. Le rapport couvre les dépenses en crédits d'utilisation et apparaît une fois que les crédits d'utilisation sont activés. L'utilisation dans l'allocation de siège n'est pas mesurée en dollars.
  • Voir l'adoption : le tableau de bord d'analyse affiche les utilisateurs actifs quotidiens, les sessions et les métriques de contribution, avec export CSV des données de contribution. Voir suivre l'utilisation de l'équipe avec l'analyse.
  • Plafonner les dépenses : l'allocation de siège est le plafond par défaut. Pour permettre aux membres de continuer au-delà, activez les crédits d'utilisation et définissez les limites de dépenses au niveau de l'organisation, du groupe ou du membre individuel.
  • Extraire les chiffres par utilisateur : sur le plan Enterprise, l'API d'analyse Enterprise retourne les rapports d'utilisation et de coûts par utilisateur sur toutes les surfaces Claude, y compris Claude Code. Un propriétaire principal crée une clé avec la portée read:analytics à claude.ai/analytics/api-keys. Sur le plan Teams, exportez le CSV du rapport de dépenses, qui répertorie l'utilisation des tokens et les dépenses estimées par utilisateur et par modèle.

Le guide de consommation Claude Enterprise est la référence de planification pour les administrateurs. Il explique comment la consommation diffère entre Claude chat, Claude Code et Cowork, et donne des points de départ en dollars par utilisateur pour la budgétisation. Budgétisez davantage pour un siège de codage que pour un siège de chat : chaque tour de Claude Code contient le contenu des fichiers, les appels d'outils et le raisonnement multi-étapes, donc une session de débogage peut consommer plus qu'une journée de chat.

Claude Console

Les organisations API gèrent les dépenses de Claude Code via les espaces de travail. Vous pouvez définir les limites de dépenses de l'espace de travail sur la dépense totale de Claude Code et afficher les rapports de coûts et d'utilisation dans la Console.

Pour les rapports par utilisateur, le tableau de bord de la Console affiche les dépenses et les lignes acceptées par membre, et l'API d'analyse Claude Code retourne les mêmes métriques quotidiennes par utilisateur par programmation avec une clé API Admin. Voir analyse pour les clients API.

Recommandations de limite de débit

Lors de la configuration de Claude Code pour les équipes, tenez compte de ces recommandations de Token Par Minute (TPM) et Requête Par Minute (RPM) par utilisateur en fonction de la taille de votre organisation :

Taille de l'équipe TPM par utilisateur RPM par utilisateur
1-5 utilisateurs 200 000-300 000 5-7
5-20 utilisateurs 100 000-150 000 2,5-3,5
20-50 utilisateurs 50 000-75 000 1,25-1,75
50-100 utilisateurs 25 000-35 000 0,62-0,87
100-500 utilisateurs 15 000-20 000 0,37-0,47
500+ utilisateurs 10 000-15 000 0,25-0,35

Par exemple, si vous avez 200 utilisateurs, vous pourriez demander 20 000 TPM pour chaque utilisateur, soit 4 millions de TPM au total (200 × 20 000 = 4 millions).

Le TPM par utilisateur diminue à mesure que la taille de l'équipe augmente, car moins d'utilisateurs ont tendance à utiliser Claude Code simultanément dans les grandes organisations. Ces limites de débit s'appliquent au niveau de l'organisation, et non par utilisateur individuel, ce qui signifie que les utilisateurs individuels peuvent temporairement consommer plus que leur part calculée lorsque d'autres n'utilisent pas activement le service.

Fournisseurs cloud

Sur Amazon Bedrock, Google Cloud's Agent Platform et Microsoft Foundry, Claude Code est facturé par token à votre compte cloud, et les contrôles de dépenses se trouvent dans la console de facturation de votre fournisseur cloud. Claude Code n'envoie pas de métriques de votre cloud vers Anthropic, donc les tableaux de bord d'analyse et l'API d'analyse Claude Code ne couvrent pas cette utilisation.

Pour l'attribution des coûts par utilisateur, vous avez trois options :

  • OpenTelemetry : exporter les métriques de la machine de chaque développeur vers votre propre pile d'observabilité. Cela vous donne les décomptes de tokens par utilisateur, les coûts et l'activité des outils quel que soit le fournisseur.
  • Une passerelle d'applications Claude : une passerelle d'applications Claude auto-hébergée fournit l'attribution d'utilisation par utilisateur, les métriques OTLP avec les décomptes de tokens, et les limites de dépenses par utilisateur sur ces fournisseurs.
  • Une passerelle LLM : acheminez tout le trafic Claude Code via un proxy qui suit les dépenses par clé. Plusieurs grandes entreprises ont signalé l'utilisation de LiteLLM, un outil open-source qui suit les dépenses par clé. Ce projet n'est pas affilié à Anthropic et n'a pas été audité pour la sécurité.

Quand un développeur pose des questions sur une limite

Les développeurs apportent généralement les questions de limite à leur administrateur, il est donc utile de savoir quel plafond ils ont atteint. Ces situations signifient des choses différentes :

  • « Vous avez atteint votre limite de session » ou « Vous avez atteint votre limite hebdomadaire » : une fenêtre d'utilisation basée sur le siège sur un plan d'abonnement, partagée sur tous les modèles, donc le développeur ne peut pas restaurer l'accès en changeant de modèles avec /model. Le message affiche quand la fenêtre se réinitialise. Après le message spécifique au modèle « Vous avez atteint votre limite Opus » ou « Vous avez atteint votre limite Sonnet », passer à un modèle en dehors de cette famille avec /model permet au développeur de continuer à travailler. Voir erreurs de limite d'utilisation. Ce que le développeur peut faire en attendant :
  • « Vous avez atteint votre limite de dépenses individuelle », « limite de dépenses mensuelle de l'organisation » ou « budget partagé de l'équipe » : la demande du développeur serait facturée aux crédits d'utilisation, et ces crédits ont atteint une limite de dépenses que vous avez définie. Pour permettre au développeur de continuer, allez à Paramètres d'administration > Utilisation et augmentez la limite que le message nomme. Lorsque le message nomme également une heure de réinitialisation du plan, le développeur peut plutôt attendre jusqu'à ce moment. Voir la référence d'erreur pour chaque variante.
  • Un message de limite de dépenses d'une passerelle d'applications Claude : le développeur a dépassé un plafond de dépenses que vous avez défini sur votre passerelle auto-hébergée, et la passerelle bloque ses demandes jusqu'à ce que la période se réinitialise ou que vous augmentiez le plafond. Voir limites de dépenses de la passerelle pour les plafonds, les calendriers de réinitialisation et le message que le développeur voit.
  • Un avertissement de contexte ou d'auto-compactage : pas une limite d'utilisation. La conversation s'est rapprochée de la fenêtre d'auto-compactage de la session, le seuil où Claude Code résume l'historique plus ancien pour libérer de l'espace. Pointez le développeur vers réduire l'utilisation des tokens.
  • Des dépenses inhabituellement élevées sur un plan API ou fournisseur cloud : généralement tracées jusqu'à des sessions longues qui n'ont jamais été effacées ou à Opus laissé comme modèle par défaut. Les habitudes à impact le plus élevé à partager sont l'effacement entre les tâches non liées et l'adaptation du modèle au travail, tous deux couverts dans réduire l'utilisation des tokens.

Coûts en tokens des équipes d'agents

Les équipes d'agents lancent plusieurs instances de Claude Code, chacune avec sa propre fenêtre de contexte. L'utilisation des tokens augmente avec le nombre de coéquipiers actifs et la durée d'exécution de chacun.

Pour maintenir les coûts des équipes d'agents gérables :

  • Utilisez Sonnet pour les coéquipiers. Il équilibre la capacité et le coût pour les tâches de coordination.
  • Gardez les équipes petites. Chaque coéquipier exécute sa propre fenêtre de contexte, donc l'utilisation des tokens est à peu près proportionnelle à la taille de l'équipe.
  • Gardez les invites de génération concentrées. Les coéquipiers chargent CLAUDE.md, les serveurs MCP et les skills automatiquement, mais tout ce qui se trouve dans l'invite de génération s'ajoute à leur contexte dès le départ.
  • Arrêtez les coéquipiers lorsque leur travail est terminé. Chaque coéquipier actif continue à consommer des tokens jusqu'à ce qu'il se termine ou que la session se termine.
  • Les équipes d'agents sont désactivées par défaut. Définissez CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1 dans votre settings.json ou dans l'environnement pour les activer. Voir activer les équipes d'agents.

Réduire l'utilisation des tokens

Les coûts des tokens augmentent avec la taille du contexte : plus Claude traite de contexte, plus vous utilisez de tokens. Claude Code optimise automatiquement les coûts grâce à la mise en cache des invites, qui réduit les coûts pour le contenu répété comme les invites système, et à la compaction automatique, qui résume l'historique des conversations en approchant les limites du contexte.

Les stratégies suivantes vous aident à maintenir le contexte petit et à réduire les coûts par message.

Gérer le contexte de manière proactive

Utilisez /usage pour vérifier votre utilisation actuelle des tokens, ou configurez votre ligne d'état pour l'afficher en continu.

  • Effacer entre les tâches : Utilisez /clear pour recommencer à zéro lorsque vous passez à un travail non lié. Le contexte obsolète gaspille des tokens à chaque message suivant. Utilisez /rename avant d'effacer pour pouvoir facilement retrouver la session plus tard, puis /resume pour y revenir.
  • Ajouter des instructions de compaction personnalisées : /compact Focus on code samples and API usage indique à Claude ce qu'il faut préserver lors de la résumé. Dans une session nouvelle, /compact affiche Not enough messages to compact. car il n'y a pas encore d'historique de conversation à résumer.

Vous pouvez également personnaliser le comportement de compaction dans votre fichier CLAUDE.md à la racine de votre projet :

# Compact instructions

When you are using compact, please focus on test output and code changes

Choisir le bon modèle

Sonnet gère bien la plupart des tâches de codage et coûte moins cher qu'Opus. Réservez Opus pour les décisions architecturales complexes ou le raisonnement multi-étapes. Utilisez /model pour changer de modèle en cours de session, ou définissez une valeur par défaut dans /config. Un changement vers Opus s'applique également aux subagents qui héritent du modèle de votre session. Pour les tâches simples de subagent, spécifiez model: haiku dans votre configuration de subagent.

Réduire la surcharge des serveurs MCP

Les définitions d'outils MCP sont reportées par défaut, donc seuls les noms d'outils et les instructions du serveur entrent en contexte jusqu'à ce que Claude utilise un outil spécifique. Exécutez /context pour voir ce qui consomme de l'espace.

  • Préférez les outils CLI lorsqu'ils sont disponibles : Les outils comme gh, aws, gcloud et sentry-cli sont plus efficaces en contexte que les serveurs MCP car ils n'ajoutent pas de liste d'outils par outil. Claude peut exécuter les commandes CLI directement.
  • Désactiver les serveurs inutilisés : Exécutez /mcp pour voir les serveurs configurés et désactiver ceux que vous n'utilisez pas activement.

Installer des plugins d'intelligence de code pour les langages typés

Les plugins d'intelligence de code donnent à Claude une navigation de symboles précise au lieu d'une recherche basée sur le texte, réduisant les lectures de fichiers inutiles lors de l'exploration de code inconnu. Un seul appel « aller à la définition » remplace ce qui pourrait autrement être une recherche grep suivie de la lecture de plusieurs fichiers candidats. Les serveurs de langage installés signalent également automatiquement les erreurs de type après les modifications, donc Claude détecte les erreurs sans exécuter un compilateur.

Déléguer le traitement aux hooks et aux skills

Les hooks personnalisés peuvent prétraiter les données avant que Claude ne les voie. Au lieu que Claude lise un fichier journal de 10 000 lignes pour trouver les erreurs, un hook peut rechercher ERROR et retourner uniquement les lignes correspondantes, réduisant le contexte de dizaines de milliers de tokens à des centaines.

Une skill peut donner à Claude des connaissances de domaine pour qu'il n'ait pas à explorer. Par exemple, une skill « codebase-overview » pourrait décrire l'architecture de votre projet, les répertoires clés et les conventions de nommage. Lorsque Claude invoque la skill, il obtient ce contexte immédiatement au lieu de dépenser des tokens pour lire plusieurs fichiers pour comprendre la structure.

Par exemple, ce hook PreToolUse filtre la sortie des tests pour afficher uniquement les échecs :

Ajoutez ceci à votre settings.json pour exécuter le hook avant chaque commande Bash :

{
"hooks": {
"PreToolUse": [
{
"matcher": "Bash",
"hooks": [
{
"type": "command",
"command": "~/.claude/hooks/filter-test-output.sh"
}
]
}
]
}
}

Pour vérifier la configuration, exécutez /hooks et vérifiez que le hook apparaît sous PreToolUse. Vous pouvez également démarrer Claude Code avec claude --debug-file ./claude-debug.txt et demander à Claude d'exécuter npm test. Lorsque le hook réécrit la commande, ce fichier journal contient une ligne modified tool input keys listant command et les autres champs d'entrée Bash.

Déplacer les instructions de CLAUDE.md vers les skills

Votre fichier CLAUDE.md est chargé en contexte au démarrage de la session. S'il contient des instructions détaillées pour des flux de travail spécifiques (comme les révisions de PR ou les migrations de base de données), ces tokens sont présents même lorsque vous faites un travail non lié. Les skills se chargent à la demande uniquement lorsqu'elles sont invoquées, donc déplacer les instructions spécialisées dans les skills maintient votre contexte de base plus petit. Visez à garder CLAUDE.md en dessous de 200 lignes en incluant uniquement les éléments essentiels.

Ajuster la réflexion étendue

La réflexion étendue est activée par défaut car elle améliore considérablement les performances sur les tâches complexes de planification et de raisonnement. Les tokens de réflexion sont facturés comme des tokens de sortie, et le budget par défaut peut être des dizaines de milliers de tokens par requête selon le modèle.

Pour les tâches plus simples où un raisonnement approfondi n'est pas nécessaire, vous pouvez réduire les coûts en abaissant le niveau d'effort avec /effort ou dans /model, ou en désactivant la réflexion dans /config. Vous ne pouvez pas désactiver la réflexion sur les modèles Opus 5.5 ou les modèles Fable, qui utilisent toujours la réflexion étendue.

Sur les modèles avec un budget de réflexion fixe, vous pouvez également abaisser le budget en définissant la variable d'environnement MAX_THINKING_TOKENS, par exemple MAX_THINKING_TOKENS=8000. Les modèles de raisonnement adaptatif ignorent les budgets non nuls, donc utilisez plutôt les niveaux d'effort.

Déléguer les opérations détaillées aux subagents

L'exécution de tests, la récupération de documentation ou le traitement de fichiers journaux peuvent consommer un contexte important. Déléguez-les aux subagents pour que la sortie détaillée reste dans le contexte du subagent tandis que seul un résumé revient à votre conversation principale.

Gérer les coûts des équipes d'agents

Les équipes d'agents utilisent environ 7 fois plus de tokens que les sessions standard lorsque les coéquipiers s'exécutent en mode plan, car chaque coéquipier maintient sa propre fenêtre de contexte et s'exécute en tant qu'instance Claude distincte. Gardez les tâches d'équipe petites et autonomes pour limiter l'utilisation des tokens par coéquipier. Voir équipes d'agents pour plus de détails.

Écrire des invites spécifiques

Les demandes vagues comme « améliorer cette base de code » déclenchent une analyse large. Les demandes spécifiques comme « ajouter la validation des entrées à la fonction de connexion dans auth.ts » permettent à Claude de travailler efficacement avec des lectures de fichiers minimales.

Travailler efficacement sur des tâches complexes

Pour un travail plus long ou plus complexe, ces habitudes aident à éviter les tokens gaspillés en prenant la mauvaise direction :

  • Utilisez le mode plan pour les tâches complexes : Appuyez sur Maj+Tab pour entrer en mode plan avant l'implémentation. Claude explore la base de code et propose une approche pour votre approbation, évitant les retouches coûteuses lorsque la direction initiale est mauvaise.
  • Corriger la trajectoire tôt : Si Claude commence à aller dans la mauvaise direction, appuyez sur Échap pour arrêter immédiatement. Utilisez /rewind ou appuyez deux fois sur Échap pour restaurer la conversation et le code à un point de contrôle précédent.
  • Donner des cibles de vérification : Incluez des cas de test, collez des captures d'écran ou définissez la sortie attendue dans votre invite. Lorsque Claude peut vérifier son propre travail, il détecte les problèmes avant que vous ayez besoin de demander des corrections.
  • Tester de manière progressive : Écrivez un fichier, testez-le, puis continuez. Cela détecte les problèmes tôt lorsqu'ils sont bon marché à corriger.

Utilisation des tokens en arrière-plan

Claude Code utilise des tokens pour certaines fonctionnalités en arrière-plan même lorsqu'il est inactif :

  • Résumé des conversations : Les tâches en arrière-plan qui résument les conversations précédentes pour la fonctionnalité claude --resume
  • Traitement des commandes : Certaines commandes comme /usage peuvent générer des requêtes pour vérifier l'état

Ces processus en arrière-plan consomment une petite quantité de tokens (généralement moins de 0,04 $ par session) même sans interaction active.

Lorsque les suggestions de prompt sont activées, Claude Code envoie également une courte requête au modèle utilisé par votre session après que Claude réponde, pour suggérer votre prochain prompt. Cette requête réutilise le cache de prompt de la conversation, il s'agit donc principalement de lectures du cache plus quelques tokens de sortie. Claude Code ignore ces requêtes lorsque votre compte est proche ou à sa limite d'utilisation. Pour arrêter ces requêtes, désactivez les suggestions de prompt.

Pourquoi l'utilisation augmente dans une longue session

Une session qui a été ouverte pendant des heures peut utiliser bien plus de vos limites de plan que votre activité ne le suggère, généralement pour l'une de ces raisons :

  • Contexte long : Claude Code envoie votre conversation complète avec chaque requête, et chaque fois que Claude utilise des outils, il envoie une autre requête contenant ce lot de résultats d'outils. Avec la mise en cache des invites, Claude Code relit cet historique au taux de jetons mis en cache, donc une question d'une ligne dans une session ouverte toute la journée consomme quand même l'utilisation pour toute la conversation. Consultez Gérer le contexte de manière proactive pour découvrir des façons de garder votre contexte petit
  • Absences de cache : votre premier message après une pause plus longue que la durée de vie du cache manque le cache et retraite votre contexte complet. La durée de vie est d'une heure sur un abonnement et tombe à cinq minutes une fois que vous utilisez des crédits d'utilisation ; sur une clé API ou un fournisseur cloud, c'est cinq minutes par défaut. Pour conserver la durée de vie d'une heure tout en utilisant des crédits d'utilisation, choisissez vous-même le TTL. Sur les plans Pro et Max, lorsque vous reprenez une grande session après une longue pause, Claude Code propose de reprendre à partir d'un résumé afin que les requêtes ultérieures ne portent pas l'historique complet
  • Tâches planifiées : une tâche planifiée s'exécute selon son intervalle même pendant que la session est inactive, envoyant votre contexte complet à chaque fois
  • Messages entre sessions : Claude Code livre un message d'une autre de vos sessions comme un nouveau tour lorsque cette session est inactive, envoyant votre contexte complet à chaque fois. Pour retenir les messages entrants au lieu de les livrer, définissez crossSessionInbound sur hold
  • Vérifications d'objectifs : tandis que le travail en arrière-plan maintient un objectif actif en attente, Claude Code demande à Claude de vérifier ce travail même lorsque la session est inactive, en commençant un nouveau tour qui envoie votre contexte complet. Claude Code démarre au maximum trois vérifications inactives par objectif entre vos invites. Avant la v2.1.246, les vérifications inactives n'étaient pas limitées. Pour désactiver les vérifications, définissez CLAUDE_CODE_GOAL_CHECKIN_MINUTES sur 0. Les vérifications inactives nécessitent Claude Code v2.1.236 ou version ultérieure
  • Coéquipiers agents : chaque coéquipier actif continue de consommer des jetons jusqu'à sa sortie
  • Compaction : /compact lit la conversation qu'il résume, donc compacter un grand contexte est en soi une grande requête. Lorsque vous voulez un nouveau départ au lieu de continuité, /clear ne coûte rien

Sur un plan Pro, Max, Team ou Enterprise, la répartition /usage signale les comportements qui représentent 10 % ou plus de votre utilisation récente, comme un contexte long ou des absences de cache, chacun avec un conseil pour le réduire.

Comprendre les changements de comportement de Claude Code

Claude Code reçoit régulièrement des mises à jour qui peuvent modifier le fonctionnement des fonctionnalités, y compris la génération de rapports de coûts. Exécutez claude --version pour vérifier votre version actuelle.

Pour les questions de facturation concernant votre compte spécifique, contactez le support Anthropic via le messenger intégré au produit :

  • Plans d'abonnement (Pro, Max, Team, Enterprise) : connectez-vous sur claude.ai, cliquez sur vos initiales en bas à gauche, et sélectionnez Obtenir de l'aide
  • Facturation Console (API) : connectez-vous sur platform.claude.com, cliquez sur vos initiales, et sélectionnez Obtenir de l'aide

Consultez Comment obtenir du support pour connaître le processus complet, y compris qui peut vous mettre en contact avec un agent humain selon votre plan.