Claude Opus 4.6

Claude Opus 4.6 est un LLM propriétaire lancé par Anthropic le 5 février 2026. Positionné sur le segment premium, il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de volumes de texte particulièrement importants.

Claude Opus 4.6 est un LLM propriétaire lancé par Anthropic le 5 février 2026. Positionné sur le segment premium, il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de volumes de texte particulièrement importants.

À sa sortie, le modèle figurait dans le top 8% des LLM de sa génération sur GPQA diamond. Son profil associe de solides résultats en programmation et en mathématiques à un niveau maximal sur les évaluations de référence en éthique et en connaissances générales.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie5 février 2026
Multimodaloui
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index43.715ᵉ / 137

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202599,8 %6ᵉ / 108llm-statsAuto-déclaré
Tau2 Telecom99,3 %1ᵉ / 34llm-statsAuto-déclaré
Graphwalks parents >128k95,4 %1ᵉ / 7llm-statsAuto-déclaré
Tau2 Retail91,9 %1ᵉ / 25llm-statsAuto-déclaré
DeepSearchQA91,3 %3ᵉ / 8llm-statsAuto-déclaré
GPQA91,3 %15ᵉ / 219llm-statsAuto-déclaré
MMMLU91,1 %6ᵉ / 49llm-statsAuto-déclaré
BrowseComp84,0 %14ᵉ / 57llm-statsAuto-déclaré
SWE-Bench Verified80,8 %7ᵉ / 102llm-statsAuto-déclaré
FigQA78,3 %2ᵉ / 3llm-statsAuto-déclaré
SWE-bench Multilingual77,8 %5ᵉ / 34llm-statsAuto-déclaré
CharXiv-R77,4 %26ᵉ / 45llm-statsAuto-déclaré
MMMU-Pro77,3 %22ᵉ / 64llm-statsAuto-déclaré
LiveBench76,3 %11ᵉ / 38llm-statsn.d.
MRCR v2 (8-needle)76,0 %3ᵉ / 19llm-statsAuto-déclaré
CyberGym73,8 %4ᵉ / 9llm-statsAuto-déclaré
OSWorld72,7 %3ᵉ / 20llm-statsAuto-déclaré
ARC-AGI v268,8 %5ᵉ / 16llm-statsAuto-déclaré
Terminal-Bench 2.065,4 %17ᵉ / 49llm-statsAuto-déclaré
MCP Atlas62,7 %23ᵉ / 30llm-statsAuto-déclaré
Graphwalks BFS >128k61,5 %6ᵉ / 11llm-statsAuto-déclaré
Finance Agent60,7 %3ᵉ / 8llm-statsAuto-déclaré
FrontierSWE56,0 %7ᵉ / 14llm-statsn.d.
GDPval-AA53,5 %6ᵉ / 39llm-statsAuto-déclaré
Humanity's Last Exam53,1 %13ᵉ / 89llm-statsAuto-déclaré
Legal Agent Benchmark4,2 %5ᵉ / 12llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Claude Opus 4.643.7
DeepSeek V4 Pro40.8

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Image-to-Code15474ᵉ / 31Claude Fable 5 (1627)
Arena Code15429ᵉ / 99Kimi K3 (1679)
Arena Image-to-Code15376ᵉ / 31Claude Fable 5 (1627)
Arena Code153612ᵉ / 99Kimi K3 (1679)
Arena Document15081ᵉ / 32Claude Opus 4.6 (1508)
Arena Document15073ᵉ / 32Claude Opus 4.6 (1508)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Amazon Bedrock5 $25 $0,5 $
anthropic5 $25 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 140 % au-dessus de la moyenne des LLM similaires, et 1,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)47,03 $
Durée d'exécution — PinchBench3 h 46 min
Coût moyen par benchmark — Benchable0,43 $
Latence moyenne par benchmark — Benchable8 min 34 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Claude Opus 4.6 se classe premier sur Ethics (Baseline) et atteint également le score maximal sur General Knowledge (Baseline). Ses résultats en Coding et Mathematics le placent parmi les modèles les plus performants de ces évaluations. Ce niveau se retrouve dans les classements comparatifs participatifs, avec une place dans le haut du tableau en Arena Code et parmi les quatre premiers en Arena image-to-code. Son Intelligence Index le situe également près du premier décile du panel évalué. La fenêtre de contexte de 1 000 000 tokens constitue un autre point fort pour l'analyse de longs documents ou de corpus volumineux.

Limites et points d'attention. Les scores bruts élevés ne correspondent pas toujours à des rangs dominants : General Knowledge, Hallucinations et surtout Email Classification restent plus proches du milieu, voire du bas du classement, signe d'évaluations où de nombreux concurrents obtiennent des résultats comparables ou supérieurs. Le tarif est premium, à 151% au-dessus de la moyenne des LLM similaires, même s'il reste environ 1,1 fois moins cher que les modèles frontière. Ses poids ne sont pas ouverts. Claude Opus 4.6 cible ainsi les usages exigeant un long contexte, du code, des mathématiques ou de l'image-to-code, lorsque le niveau de performance justifie un coût supérieur à la moyenne.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).