Claude Opus 4.6
Claude Opus 4.6 est un LLM propriétaire lancé par Anthropic le 5 février 2026. Positionné sur le segment premium, il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de volumes de texte particulièrement importants.
Claude Opus 4.6 est un LLM propriétaire lancé par Anthropic le 5 février 2026. Positionné sur le segment premium, il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de volumes de texte particulièrement importants.
À sa sortie, le modèle figurait dans le top 8% des LLM de sa génération sur GPQA diamond. Son profil associe de solides résultats en programmation et en mathématiques à un niveau maximal sur les évaluations de référence en éthique et en connaissances générales.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 5 février 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 43.7 | 15ᵉ / 137 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 99,8 % | 6ᵉ / 108 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 99,3 % | 1ᵉ / 34 | llm-stats | Auto-déclaré |
| Graphwalks parents >128k | 95,4 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| Tau2 Retail | 91,9 % | 1ᵉ / 25 | llm-stats | Auto-déclaré |
| DeepSearchQA | 91,3 % | 3ᵉ / 8 | llm-stats | Auto-déclaré |
| GPQA | 91,3 % | 15ᵉ / 219 | llm-stats | Auto-déclaré |
| MMMLU | 91,1 % | 6ᵉ / 49 | llm-stats | Auto-déclaré |
| BrowseComp | 84,0 % | 14ᵉ / 57 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 80,8 % | 7ᵉ / 102 | llm-stats | Auto-déclaré |
| FigQA | 78,3 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 77,8 % | 5ᵉ / 34 | llm-stats | Auto-déclaré |
| CharXiv-R | 77,4 % | 26ᵉ / 45 | llm-stats | Auto-déclaré |
| MMMU-Pro | 77,3 % | 22ᵉ / 64 | llm-stats | Auto-déclaré |
| LiveBench | 76,3 % | 11ᵉ / 38 | llm-stats | n.d. |
| MRCR v2 (8-needle) | 76,0 % | 3ᵉ / 19 | llm-stats | Auto-déclaré |
| CyberGym | 73,8 % | 4ᵉ / 9 | llm-stats | Auto-déclaré |
| OSWorld | 72,7 % | 3ᵉ / 20 | llm-stats | Auto-déclaré |
| ARC-AGI v2 | 68,8 % | 5ᵉ / 16 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 65,4 % | 17ᵉ / 49 | llm-stats | Auto-déclaré |
| MCP Atlas | 62,7 % | 23ᵉ / 30 | llm-stats | Auto-déclaré |
| Graphwalks BFS >128k | 61,5 % | 6ᵉ / 11 | llm-stats | Auto-déclaré |
| Finance Agent | 60,7 % | 3ᵉ / 8 | llm-stats | Auto-déclaré |
| FrontierSWE | 56,0 % | 7ᵉ / 14 | llm-stats | n.d. |
| GDPval-AA | 53,5 % | 6ᵉ / 39 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 53,1 % | 13ᵉ / 89 | llm-stats | Auto-déclaré |
| Legal Agent Benchmark | 4,2 % | 5ᵉ / 12 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Image-to-Code | 1547 | 4ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Code | 1542 | 9ᵉ / 99 | Kimi K3 (1679) |
| Arena Image-to-Code | 1537 | 6ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Code | 1536 | 12ᵉ / 99 | Kimi K3 (1679) |
| Arena Document | 1508 | 1ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Document | 1507 | 3ᵉ / 32 | Claude Opus 4.6 (1508) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Amazon Bedrock | 5 $ | 25 $ | 0,5 $ |
| anthropic | 5 $ | 25 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 140 % au-dessus de la moyenne des LLM similaires, et 1,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 47,03 $ |
| Durée d'exécution — PinchBench | 3 h 46 min |
| Coût moyen par benchmark — Benchable | 0,43 $ |
| Latence moyenne par benchmark — Benchable | 8 min 34 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Claude Opus 4.6 se classe premier sur Ethics (Baseline) et atteint également le score maximal sur General Knowledge (Baseline). Ses résultats en Coding et Mathematics le placent parmi les modèles les plus performants de ces évaluations. Ce niveau se retrouve dans les classements comparatifs participatifs, avec une place dans le haut du tableau en Arena Code et parmi les quatre premiers en Arena image-to-code. Son Intelligence Index le situe également près du premier décile du panel évalué. La fenêtre de contexte de 1 000 000 tokens constitue un autre point fort pour l'analyse de longs documents ou de corpus volumineux.
Limites et points d'attention. Les scores bruts élevés ne correspondent pas toujours à des rangs dominants : General Knowledge, Hallucinations et surtout Email Classification restent plus proches du milieu, voire du bas du classement, signe d'évaluations où de nombreux concurrents obtiennent des résultats comparables ou supérieurs. Le tarif est premium, à 151% au-dessus de la moyenne des LLM similaires, même s'il reste environ 1,1 fois moins cher que les modèles frontière. Ses poids ne sont pas ouverts. Claude Opus 4.6 cible ainsi les usages exigeant un long contexte, du code, des mathématiques ou de l'image-to-code, lorsque le niveau de performance justifie un coût supérieur à la moyenne.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).