Le paramètre Effort Control, lancé avec Claude Opus 4.8 le 28 mai 2026, vous donne un contrôle direct sur la profondeur de raisonnement de Claude. En choisissant l’un des cinq niveaux disponibles — de low à max — vous arbitrez entre vitesse, coût et qualité de la réponse, sans changer de modèle. J’ai testé ce paramètre sur plusieurs projets API et l’impact sur les coûts est immédiat : à effort medium, Claude Opus 4.5 atteignait le meilleur score de Sonnet 4.5 sur SWE-bench Verified tout en utilisant 76 % moins de tokens en sortie, selon les données publiées par Anthropic lors du lancement d’Opus 4.5.

Pourquoi l’Effort Control a-t-il été créé ?

Avant l’Effort Control, la seule façon d’ajuster la profondeur de raisonnement de Claude passait par le paramètre budget_tokens dans le mode extended thinking — une mécanique technique, peu accessible aux utilisateurs non développeurs et limitée au mode de réflexion explicite.

Anthropic a constaté que la grande majorité des requêtes n’ont pas besoin du même niveau d’effort. Répondre à une question factuelle simple mobilise les mêmes ressources computationnelles qu’analyser une architecture logicielle complexe — c’est inefficace. L’Effort Control corrige cela en exposant directement ce levier à l’utilisateur.

Le paramètre agit sur tous les tokens de la réponse : texte, appels d’outils et raisonnement interne (thinking). C’est là sa principale différence avec budget_tokens, qui ne contrôlait que la partie raisonnement.

Schéma comparatif : grande machine consommant autant pour une petite tâche que pour une grande, versus un curseur à cinq crans calibrant l'effort selon la complexité réelle

Les 5 niveaux d’effort expliqués

Échelle des 5 niveaux Effort Control Claude — low, medium, high, xhigh, max avec cas d'usage et disponibilité par modèle De low (rapide, économe) à max (raisonnement absolu) : chaque niveau correspond à un profil de tâche distinct.

Tableau récapitulatif

NiveauComportementCas d’usage typiqueDisponibilité
lowRéponse rapide, minimum de tokensClassification, tâches simples, sous-agents haute fréquenceTous les modèles compatibles
mediumÉquilibre modéré performance/coûtWorkflows agentiques courants, génération de code standardTous les modèles compatibles
highDéfaut — meilleur équilibre qualité/expérienceRaisonnement complexe, analyse nuancée, code difficileTous les modèles compatibles
xhighExploration étendue, token budget en millionsTâches agentiques longues (+30 min), appels d’outils répétésOpus 4.8 et Opus 4.7 uniquement
maxBudget tokens absolu, raisonnement maximalProblèmes frontières, analyse la plus approfondie possibleOpus 4.8, Opus 4.7, Opus 4.6, Sonnet 4.6 (+ Mythos en accès restreint)

Low — rapidité et économie

Au niveau low, Claude répond en s’appuyant principalement sur ses connaissances intégrées sans engager un raisonnement approfondi. Il traite la requête et génère une réponse concise, avec un minimum de tokens.

Ce qui change concrètement : Claude réduit le nombre d’appels d’outils, passe directement à l’action sans préambule et utilise des messages de confirmation courts. Sur les tâches agentiques, cela se traduit par des séquences d’actions plus directes.

Quand l’utiliser : Tâches de classification, lookups simples, requêtes en volume élevé où la qualité marginale supplémentaire ne justifie pas la latence ou le coût. Également recommandé pour les sous-agents dans des architectures multi-agents où chaque agent gère une tâche bien délimitée.

Medium — l’équilibre pratique

medium engage un raisonnement réel mais s’arrête bien avant d’épuiser la capacité du modèle. C’est le niveau recommandé par Anthropic pour Claude Sonnet 4.6 comme valeur par défaut dans la plupart des applications.

Ce qui change concrètement : Claude fait des économies de tokens mesurables par rapport à high, tout en maintenant une qualité satisfaisante sur la majorité des cas d’usage courants. Sur le benchmark SWE-bench Verified, Opus 4.5 à effort medium égalait Sonnet 4.5 à pleine capacité en consommant 76 % moins de tokens en sortie — une référence utile pour calibrer vos propres évaluations.

Quand l’utiliser : Workflows agentiques qui nécessitent un équilibre vitesse/coût/performance, génération de code standard, tâches où vous avez validé sur vos propres évaluations que le niveau tient la qualité.

High — le défaut raisonnable

high est le niveau appliqué par défaut sur toutes les surfaces : API, Claude.ai, Claude Code. Le passer explicitement produit exactement le même résultat que de ne pas renseigner le paramètre.

Ce qui change concrètement : Claude raisonne en profondeur sur les problèmes complexes. Sur Opus 4.8, il active presque systématiquement l’adaptive thinking (raisonnement interne) à ce niveau. Il explique son plan avant d’agir, fournit des résumés détaillés des modifications et inclut des commentaires de code complets.

Quand l’utiliser : La grande majorité des tâches — raisonnement complexe, analyse nuancée, code difficile, toute situation où la qualité prime sur la vitesse ou le coût.

Xhigh — pour les travaux de longue haleine

xhigh est conçu pour les tâches agentiques longues — typiquement celles qui s’étendent sur plus de 30 minutes — avec des budgets de tokens pouvant atteindre plusieurs millions. Il n’est disponible que sur Claude Opus 4.8 et Claude Opus 4.7.

Ce qui change concrètement : Le modèle explore davantage, effectue des appels d’outils répétés, réalise des recherches approfondies et maintient une cohérence sur de longues séquences d’actions. Anthropic recommande de fixer un max_tokens d’au moins 64 000 tokens pour donner au modèle suffisamment de marge.

Quand l’utiliser : Refactoring de bases de code volumineuses, migrations complexes, recherche web approfondie avec validation multiple, workflows Claude Code avec Dynamic Workflows activé. C’est le point de départ recommandé par Anthropic pour les tâches de code et les cas agentiques sur Opus 4.8.

Max — le raisonnement absolu

max lève toutes les contraintes sur la dépense de tokens. Claude peut raisonner aussi longtemps et aussi profondément que la requête le nécessite.

Ce qui change concrètement : Le modèle traite les problèmes les plus difficiles avec le maximum de rigueur. Attention : Anthropic prévient que sur certaines tâches à structure fixe ou peu sensibles à l’intelligence, max peut entraîner un overthinking — un excès de raisonnement qui ne se traduit pas en gain de qualité.

Quand l’utiliser : Problèmes véritablement complexes où xhigh a montré ses limites sur vos évaluations. Analyses multidisciplinaires exigeantes, problèmes d’optimisation ou de raisonnement formel où chaque point de qualité compte.

Comment activer l’Effort Control

Sur claude.ai

Le sélecteur d’effort apparaît directement dans l’interface de conversation, à côté du sélecteur de modèle. Il est accessible à tous les abonnements, y compris le plan gratuit.

Cliquez sur le sélecteur, choisissez le niveau souhaité, puis envoyez votre message. Le réglage s’applique à la conversation en cours.

Dans Claude Code, l’effort se contrôle via la commande /effort suivie du niveau : /effort low, /effort high, /effort xhigh. Une option supplémentaire appelée ultracode apparaît dans le menu — notez qu’il ne s’agit pas d’un niveau API supplémentaire, mais d’une combinaison de xhigh avec la permission accordée à Claude Code de lancer des workflows multi-agents.

Via l’API Anthropic

Le paramètre s’intègre dans l’objet output_config de votre requête, sans header bêta requis.

Exemple en Python :

import anthropic

client = anthropic.Anthropic()

response = client.messages.create(
    model="claude-opus-4-8",
    max_tokens=4096,
    messages=[
        {
            "role": "user",
            "content": "Analyse les compromis entre une architecture microservices et un monolithe modulaire pour une startup de 10 développeurs.",
        }
    ],
    output_config={"effort": "medium"},
)

print(response.content[0].text)

Exemple en cURL :

curl https://api.anthropic.com/v1/messages \
    --header "x-api-key: $ANTHROPIC_API_KEY" \
    --header "anthropic-version: 2023-06-01" \
    --header "content-type: application/json" \
    --data '{
        "model": "claude-opus-4-8",
        "max_tokens": 4096,
        "messages": [{
            "role": "user",
            "content": "Analyse les compromis entre microservices et monolithe"
        }],
        "output_config": {
            "effort": "medium"
        }
    }'

Les valeurs acceptées par l’API sont : "low", "medium", "high", "xhigh", "max". Passer "high" ou omettre le paramètre produisent exactement le même comportement.

Effort Control et le mode thinking (adaptive thinking)

Sur Claude Opus 4.8, le raisonnement interne fonctionne en mode adaptive thinking : le modèle décide lui-même quand et combien raisonner en fonction de la requête. L’Effort Control est le levier recommandé pour contrôler cette profondeur.

Pour activer le raisonnement interne sur Opus 4.8, ajoutez thinking: {"type": "adaptive"} à votre requête. Sans ce paramètre, les appels s’exécutent sans thinking, quel que soit le niveau d’effort.

response = client.messages.create(
    model="claude-opus-4-8",
    max_tokens=64000,
    thinking={"type": "adaptive"},
    messages=[{"role": "user", "content": "Votre tâche complexe ici"}],
    output_config={"effort": "xhigh"},
)

À high, xhigh et max, Claude active presque systématiquement le raisonnement approfondi. À des niveaux inférieurs, il peut l’ignorer pour les problèmes simples — ce qui est précisément l’objectif d’économie de tokens.

Important : Le mode extended thinking manuel (thinking: {"type": "enabled", "budget_tokens": N}) n’est plus supporté sur Opus 4.8 et Opus 4.7. Toute tentative entraîne une erreur 400. Utilisez uniquement adaptive avec le paramètre effort.

Impact sur les appels d’outils

Comparaison appels d'outils Claude effort low vs high — comportement function calling selon le niveau d'effort Effort faible vs effort élevé : deux logiques opposées pour les appels d’outils et le function calling.

L’Effort Control ne se limite pas au texte : il influence la manière dont Claude utilise les outils (function calling, MCP, etc.).

À effort faible, Claude tend à :

  • Regrouper plusieurs opérations en moins d’appels d’outils
  • Passer directement à l’action sans préambule explicatif
  • Utiliser des messages de confirmation concis

À effort élevé, Claude tend à :

  • Effectuer davantage d’appels d’outils pour une couverture plus complète
  • Expliquer son plan avant d’agir
  • Fournir des résumés détaillés après chaque séquence d’actions
  • Inclure davantage de commentaires dans le code généré

Cette mécanique est particulièrement pertinente pour les architectures multi-agents décrites dans le guide sur Claude Managed Agents : en combinant des sous-agents à faible effort pour les tâches répétitives et un orchestrateur à effort élevé pour la coordination, vous optimisez simultanément le coût et la qualité globale.

Recommandations par profil d’usage

Tableau recommandations Effort Control Claude par profil — Dev API, Claude Code, claude.ai productivité 3 profils, 4 contextes de tâches : quel niveau d’effort appliquer selon votre usage de Claude.

Développeur API — usage général

Commencez par high (le défaut), puis descendez à medium une fois que vos évaluations confirment que la qualité tient sur votre cas d’usage spécifique. Réservez xhigh aux workflows agentiques longs et max aux cas où xhigh a montré ses limites sur vos benchmarks.

Développeur avec Claude Code

Utilisez /effort xhigh pour les vraies sessions de code (refactoring, migration, débogage profond). Descendez à /effort high pour les questions rapides et les petites modifications. Évitez max sauf si vos évaluations montrent un gain mesurable — la différence de coût est significative. Le guide complet Claude Code détaille la configuration de l’environnement et les commandes essentielles pour maximiser votre productivité.

Utilisateur claude.ai — productivité quotidienne

Pour 80 % de vos requêtes, le niveau high par défaut est optimal. Passez à low ou medium pour les tâches répétitives où vous avez besoin de rapidité : reformulations, traductions courtes, réponses à des questions factuelles. Montez à max pour une analyse complexe ponctuelle — un contrat à décortiquer, un sujet technique à approfondir — en sachant que la réponse sera plus longue et plus détaillée.

Utilisation avec Claude Sonnet 4.6

Sur Sonnet 4.6, Anthropic recommande de définir l’effort explicitement pour éviter des latences inattendues. Le niveau medium est conseillé comme valeur par défaut pour les applications à base de Sonnet 4.6, avec low pour les cas sensibles à la latence et high pour les tâches où la qualité prime. Consultez le guide complet sur Claude Opus 4.8 pour une vue d’ensemble des modèles concernés.

Effort Control et rate limits

L’Effort Control a un impact direct sur la consommation des rate limits. Anthropic est explicite sur ce point : à faible effort, Claude utilise sa rate limit plus lentement, ce qui permet de traiter davantage de requêtes dans le même intervalle de temps.

Pour les applications haute fréquence — chatbots, pipelines de traitement de données, systèmes de classification automatisée — descendre d’un ou deux niveaux d’effort peut considérablement augmenter le débit sans changer de modèle ni de tier tarifaire. Les rate limits de Claude Code ont d’ailleurs été augmentées pour s’adapter aux niveaux d’effort élevés.

Pipeline horizontal avec valve partiellement fermée laissant passer un flux dense de requêtes — illustre le gain de débit obtenu en abaissant le niveau d'effort dans les architectures haute fréquence

Ce levier complète les techniques de prompt engineering en vous offrant un contrôle systémique sur la consommation de ressources, indépendamment de la formulation des prompts.

Bonnes pratiques

Définissez toujours l’effort explicitement dans votre code. Le défaut high est raisonnable, mais le préciser dans votre code évite les surprises lors d’une mise à jour de modèle ou d’un changement de comportement par défaut.

Testez sur vos propres données. L’impact des niveaux d’effort varie selon le type de tâche. Ce qui est vrai pour une tâche de code ne l’est pas forcément pour une tâche de rédaction ou d’analyse.

Ajustez max_tokens pour les efforts élevés. À xhigh et max, donnez au modèle suffisamment de marge : démarrez à 64 000 tokens et ajustez selon vos observations.

Envisagez un effort dynamique. Adaptez le niveau en fonction de la complexité détectée de chaque requête. Les requêtes courtes et factuelles n’ont pas besoin du même effort qu’une analyse en profondeur — automatiser cet arbitrage peut diviser vos coûts sur les pipelines mixtes.

Mon verdict

Mon expérience avec l’Effort Control confirme ce qu’Anthropic annonce : c’est le levier le plus direct pour maîtriser le couple coût/qualité sans complexifier votre code. Je commence systématiquement par high sur un nouveau projet, puis je descends à medium dès que les évaluations sur mes propres données valident que la qualité tient.

Le piège le plus courant que j’ai observé : monter trop vite à max par réflexe “plus c’est mieux”. Sur les tâches à structure fixe — génération de résumés courts, classification — le gain de max par rapport à high est souvent nul, pour un coût nettement plus élevé. Évaluez d’abord, ajustez ensuite.