Claude Opus 4.8 : tout savoir sur le nouveau flagship
Claude Opus 4.8 est le nouveau modèle flagship d’Anthropic, lancé le 28 mai 2026. Il succède à Opus 4.7 avec deux grandes nouveautés — l’Effort Control sur quatre niveaux et les Dynamic Workflows pour Claude Code — ainsi qu’une amélioration significative de la qualité du code : le modèle est quatre fois moins susceptible de laisser passer un défaut sans le signaler.
Le pricing reste inchangé à 5 $/MTok en entrée et 25 $/MTok en sortie. C’est la promesse habituelle d’Anthropic : plus de performance au même tarif. Ce guide couvre les benchmarks, les nouveautés fonctionnelles, le comparatif avec GPT-5.5 et la migration depuis Opus 4.7. Les données proviennent de l’annonce officielle d’Anthropic et de la documentation technique.
Benchmarks : Opus 4.8 devance GPT-5.5 sur le code et le raisonnement
Opus 4.8 devance GPT-5.5 sur les 4 domaines cles — ecart maximal de +10,6 points sur le code.
Opus 4.8 améliore son prédécesseur sur tous les benchmarks majeurs et devance GPT-5.5 dans la plupart des domaines testés.
| Benchmark | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-bench Pro (code) | 69,2 % | 64,3 % | 58,6 % | 54,2 % |
| SWE-bench Verified | 88,6 % | 87,6 % | — | 80,6 % |
| Humanity’s Last Exam | 57,9 % | 54,7 % | 52,2 % | 51,4 % |
| GPQA Diamond | 93,6 % | 94,2 % | — | 94,3 % |
| GDPval-AA (knowledge) | 1 890 | 1 753 | 1 769 | 1 314 |
| OSWorld-Verified (computer use) | 83,4 % | 82,8 % | 78,7 % | 76,2 % |
Quatre enseignements ressortent de ces chiffres.
Le code reste le domaine de prédilection d’Anthropic. Avec 69,2 % sur SWE-bench Pro, Opus 4.8 prend 4,9 points supplémentaires par rapport à Opus 4.7 et creuse l’écart avec GPT-5.5 (58,6 %) à 10,6 points. Sur SWE-bench Multilingual, le gain est encore plus net : de 80,5 % à 84,4 %.
La connaissance professionnelle fait un bond remarquable. Le score GDPval-AA passe de 1 753 à 1 890, dépassant GPT-5.5 (1 769) de 121 points. Ce benchmark mesure les performances sur des tâches de knowledge work réelles : analyse juridique, comptabilité, médecine.
Le raisonnement scientifique reste un match nul. Sur GPQA Diamond, les trois modèles se tiennent dans un écart de 0,7 point (93,6 % à 94,3 %). À ce niveau, la différence n’est pas statistiquement significative.
Le computer use progresse modestement. Sur OSWorld-Verified, le gain de 0,6 point par rapport à Opus 4.7 est réel mais limité. L’avantage sur GPT-5.5 (4,7 points) reste confortable.
Claude Opus 4.8 vs Claude Mythos
Claude Mythos reste le modèle le plus puissant d’Anthropic, mais son accès est limité à une cinquantaine d’organisations partenaires dans le cadre de Project Glasswing en raison de ses capacités de sécurité offensive avancées. Anthropic indique qu’Opus 4.8 atteint des niveaux d’alignement comparables à Mythos — ce que la documentation décrit comme “Mythos-class alignment levels” — tout en étant disponible commercialement pour tous les utilisateurs. Opus 4.8 est la version grand public du niveau de capacité le plus élevé ; Mythos reste cantonné aux partenaires de recherche en attendant la mise en place de garde-fous adaptés.
Effort Control : régler la profondeur de réponse sur quatre niveaux
4 niveaux d’effort disponibles via le parametre API effort — high est le defaut recommande pour l’usage quotidien.
L’Effort Control est la nouveauté la plus visible d’Opus 4.8 pour les utilisateurs de Claude.ai. Un sélecteur, placé à côté du sélecteur de modèle, permet de choisir parmi quatre niveaux d’effort.
| Niveau | Identifiant API | Usage recommandé |
|---|---|---|
| Low | low | Réponses rapides, questions simples, économie de tokens et de rate limit |
| Medium | medium | Tâches courantes nécessitant un équilibre performance/coût |
| High | high (défaut) | Usage quotidien, meilleur équilibre qualité/expérience |
| Extra | xhigh | Tâches difficiles, workflows asynchrones longs, codage agentique |
| Max | max | Problèmes complexes nécessitant un raisonnement exhaustif |
Le niveau high est le défaut. Anthropic l’a calibré pour offrir le meilleur équilibre entre qualité de réponse et vitesse sur la majorité des cas d’usage. Il remplace l’ancien comportement non paramétrable d’Opus 4.7.
Le niveau medium est le point d’entrée pour les workflows sensibles au coût. Il offre un équilibre modéré entre performance et consommation de tokens — recommandé pour les tâches agentiques où vous avez mesuré que high est surdimensionné.
Le niveau low est adapté aux sous-agents et aux tâches simples à volume élevé. Il permet d’obtenir des réponses plus rapides tout en consommant moins de tokens — utile pour les requêtes répétitives ou les tâches ne nécessitant pas de raisonnement approfondi.
Les niveaux xhigh et max consomment plus de tokens de sortie. Opus 4.8 génère un raisonnement plus approfondi aux niveaux d’effort élevés. C’est une amélioration qualitative, mais elle a un coût financier à surveiller si vous êtes sur facturation API.
Via l’API, le paramètre se passe dans output_config :
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-4-8",
max_tokens=4096,
thinking={"type": "adaptive"},
output_config={"effort": "extra"}, # low | high | xhigh | max
messages=[{"role": "user", "content": "Analyse cette architecture micro-services."}]
)
Pour aller plus loin sur les techniques d’optimisation des prompts avec Claude, consultez notre guide sur le prompt engineering pour Claude.
Dynamic Workflows : des centaines de sous-agents en parallèle
Dynamic Workflows est la deuxième grande nouveauté d’Opus 4.8, disponible en research preview dans Claude Code pour les plans Enterprise, Team et Max.
Comment ça fonctionne
Dynamic Workflows en research preview — Enterprise, Team et Max uniquement.
Avant Opus 4.8, Claude Code exécutait les tâches de manière séquentielle. Dynamic Workflows introduit un mode orchestration en trois phases :
- Planification — Claude analyse la tâche et décompose le travail en sous-tâches indépendantes.
- Exécution parallèle — Des centaines de sous-agents s’exécutent simultanément dans une même session.
- Vérification — Avant de rendre la main, Claude consolide et vérifie les résultats produits par les sous-agents.
Le cas d’usage phare
Anthropic cite la migration de bases de code à grande échelle comme cas d’usage de référence. Avec Dynamic Workflows, Claude Code peut prendre en charge une migration de plusieurs centaines de milliers de lignes — du lancement à la fusion — en utilisant la suite de tests existante comme critère de validation. C’est une tâche qui prenait des semaines à une équipe de développeurs.
Limites actuelles
Dynamic Workflows est en research preview. Cela signifie que les performances peuvent varier, la fonctionnalité n’est pas encore en disponibilité générale, et l’accès est limité aux plans Enterprise, Team et Max. Les utilisateurs Pro et les développeurs API sans plan Enterprise n’y ont pas encore accès.
Qualité du code : 4x moins de défauts laissés sans commentaire
C’est l’amélioration la plus mesurable d’Opus 4.8 par rapport à Opus 4.7 sur le code. Anthropic indique qu’Opus 4.8 est environ quatre fois moins susceptible de laisser passer un défaut dans le code produit sans le signaler.
En pratique, cela se traduit par deux comportements distincts.
Lors de la génération de code, Opus 4.8 signale proactivement les problèmes potentiels plutôt que de livrer un code qui compile mais contient des failles logiques ou des vulnérabilités. Il émet des avertissements sur les cas limites, les hypothèses non vérifiées et les patterns à risque.
Lors de la revue de code, le modèle résiste davantage à valider du code incorrect. Là où Opus 4.7 pouvait parfois confirmer un code erroné pour satisfaire une demande implicite de validation, Opus 4.8 maintient une position honnête sur les défauts identifiés.
Cette amélioration de l’honnêteté est cohérente avec les progrès d’alignement qu’Anthropic décrit comme proches du niveau Mythos.
Nouvelles fonctionnalités techniques
Messages système en milieu de conversation
Opus 4.8 accepte des messages avec role: "system" après un tour utilisateur dans le tableau messages. Cette fonctionnalité, absente de tous les modèles Claude précédents, permet d’ajouter des instructions mises à jour dans une longue session sans répéter l’intégralité du prompt système — ce qui préserve les hits de cache sur les tours précédents et réduit le coût des boucles agentiques.
Seuil de cache réduit à 1 024 tokens
Sur Opus 4.7, la longueur minimale pour créer une entrée de cache était de 2 048 tokens. Opus 4.8 abaisse ce seuil à 1 024 tokens. Les prompts qui étaient trop courts pour être mis en cache sur Opus 4.7 peuvent désormais bénéficier du prompt caching sans modification de code.
Fast Mode en research preview
Le Fast Mode est désormais disponible pour Opus 4.8 en research preview sur l’API Claude. Il permet d’atteindre jusqu’à 2,5x la vitesse de sortie standard via le paramètre speed: "fast". Le pricing du Fast Mode est de 10 $/MTok en entrée et 50 $/MTok en sortie — soit trois fois moins cher que l’ancien Fast Mode d’Opus 4.7, qui facturait 30 $/150 $ par MTok.
Détails sur les refus
L’objet stop_details sur les réponses de refus est maintenant documenté publiquement. Lorsque Claude refuse de compléter une requête, cet objet décrit la catégorie de refus — ce qui permet aux applications de distinguer différentes classes de demandes refusées et d’orienter l’utilisateur vers la prochaine étape appropriée.
Pricing : inchangé, Fast Mode 3x moins cher
| Composante | Opus 4.8 | Opus 4.7 |
|---|---|---|
| Entrée standard | 5 $ / MTok | 5 $ / MTok |
| Sortie standard | 25 $ / MTok | 25 $ / MTok |
| Cache hit | 0,50 $ / MTok | 0,50 $ / MTok |
| Batch API | 2,50 $ / 12,50 $ | 2,50 $ / 12,50 $ |
| Fast Mode entrée | 10 $ / MTok | 30 $ / MTok |
| Fast Mode sortie | 50 $ / MTok | 150 $ / MTok |
La principale surprise de ce lancement est la réduction du prix du Fast Mode. En passant de 30 $/150 $ à 10 $/50 $ par MTok, Anthropic rend le Fast Mode réellement accessible aux cas d’usage de production nécessitant haute vitesse et haute qualité.
Comparatif Opus 4.8 vs GPT-5.5
| Critère | Opus 4.8 | GPT-5.5 |
|---|---|---|
| SWE-bench Pro (code) | 69,2 % | 58,6 % |
| Humanity’s Last Exam | 57,9 % | 52,2 % |
| GDPval-AA (knowledge) | 1 890 | 1 769 |
| OSWorld-Verified | 83,4 % | 78,7 % |
| Contexte | 1M tokens | 1M tokens |
| Prix entrée | 5 $/MTok | 5 $/MTok |
| Prix sortie | 25 $/MTok | 30 $/MTok |
Si votre priorité est le code, Opus 4.8 est le meilleur modèle disponible sur le marché public. L’écart de 10,6 points sur SWE-bench Pro par rapport à GPT-5.5 est substantiel et reproductible.
Si votre priorité est le raisonnement scientifique, les données actuelles ne permettent pas de trancher. GPQA Diamond n’a pas été publié pour GPT-5.5 dans cette comparaison.
Si le prix est un critère, Opus 4.8 est moins cher en sortie (25 $/MTok contre 30 $/MTok pour GPT-5.5). À volumes égaux, cet écart de 5 $/MTok en sortie joue en faveur d’Anthropic. Les gains de performance d’Opus 4.8 sur le code renforcent encore davantage son avantage économique en réduisant le nombre d’itérations.
Migration depuis Opus 4.7
La migration de claude-opus-4-7 vers claude-opus-4-8 est simple dans la majorité des cas. Voici les points d’attention.
Changement de l’identifiant modèle
# Avant
model = "claude-opus-4-7"
# Après
model = "claude-opus-4-8"
Ce qui ne change pas
Les contraintes d’API héritées d’Opus 4.7 sont inchangées : temperature, top_p et top_k ne sont pas supportés (une valeur non-défaut retourne une erreur 400). Le mode de thinking étendu (budget_tokens) n’est pas non plus supporté — utilisez thinking: {"type": "adaptive"} et le paramètre effort à la place.
Comportements à surveiller
Meilleur déclenchement des outils. Opus 4.8 est moins susceptible de sauter un appel d’outil que la tâche requiert. Si vos prompts contournaient ce problème sur Opus 4.7 via des instructions explicites, ces instructions restent inoffensives mais peuvent devenir redondantes.
Meilleure gestion des longues sessions agentiques. Les traces agentiques longues restent mieux sur cible après une compaction, un problème que certains utilisateurs avaient constaté sur Opus 4.7.
Moins de tokens de raisonnement gaspillés. Avec le thinking adaptatif activé, Opus 4.8 décide au tour par tour s’il doit raisonner. Sur les requêtes simples, il répond directement ; sur les problèmes complexes, il raisonne. Cela réduit les tokens gaspillés sur des workloads bimodaux par rapport à Opus 4.7 au même niveau d’effort.
Pour les développeurs gérant plusieurs modèles en parallèle, consultez notre guide Opus 4.7 qui détaille les changements introduits lors de la version précédente — notamment le changement de tokenizer qui reste d’actualité sur Opus 4.8.
Ce qu’il faut retenir
Opus 4.8 consolide l’avance d’Anthropic sur le codage agentique. Le gain de 4,9 points sur SWE-bench Pro, combiné à la réduction 4x des défauts de code non signalés, fait d’Opus 4.8 le modèle de référence pour les développeurs qui utilisent Claude Code dans des workflows sérieux.
L’Effort Control est une fonctionnalité réellement utile : le niveau low permet de préserver le rate limit sur les requêtes simples, tandis que extra et max débloqueront des capacités de raisonnement supplémentaires pour les cas d’usage les plus exigeants.
Notre avis : la migration depuis Opus 4.7 est recommandée sans réserve. Il n’y a aucune raison de rester sur Opus 4.7, sauf dépendance spécifique non testée. Le prix inchangé, les gains de performance sur le code, et la réduction du seuil de cache à 1 024 tokens sont tous des avantages nets.
Dynamic Workflows, en revanche, est encore en research preview. Attendez la disponibilité générale avant de l’intégrer dans des workflows de production critiques.
Pour comparer Opus 4.8 avec les modèles Sonnet, notre guide Opus vs Sonnet sera mis à jour avec les nouvelles données Opus 4.8 dans les prochains jours.