Claude Opus 4
Claude Opus 4 est un LLM propriétaire lancé par Anthropic le 22 mai 2025. Âgé d’environ un an, il est déjà très ancien à l’échelle de l’IA. Ses performances sont désormais largement dépassées, et les versions de cet âge sont souvent retirées du catalogue de leur éditeur.
Claude Opus 4 est un LLM propriétaire lancé par Anthropic le 22 mai 2025. Âgé d’environ un an, il est déjà très ancien à l’échelle de l’IA. Ses performances sont désormais largement dépassées, et les versions de cet âge sont souvent retirées du catalogue de leur éditeur.
À sa sortie, il figurait néanmoins dans le top 12% des 56 LLM de sa génération sur GPQA diamond. Il se distingue aussi par une fenêtre de contexte de 200 000 tokens et des connaissances arrêtées au 31 janvier 2025. Son positionnement premium reste particulièrement coûteux face au marché.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 22 mai 2025 |
| Connaissances jusqu'à | 2025-01-31 |
| Multimodal | oui |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 31.0 | 57ᵉ / 137 |
| Math Index | 73.3 | 21ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 97,0 % | 100ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 94,0 % | 32ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 94,0 % | 30ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 90,0 % | 53ᵉ / 155 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 85,0 % | 12ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 76,3 % | 27ᵉ / 85 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 71,0 % | 47ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: SWE-Bench verified | 70,7 % | 9ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 64,4 % | 28ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 4,5 % | 22ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 4,2 % | 10ᵉ / 25 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 0,0 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
| MMMLU | 88,8 % | 16ᵉ / 49 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 81,4 % | 3ᵉ / 24 | llm-stats | Auto-déclaré |
| GPQA | 79,6 % | 80ᵉ / 219 | llm-stats | Auto-déclaré |
| MMMU (validation) | 76,5 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| AIME 2025 | 75,5 % | 72ᵉ / 108 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 72,5 % | 49ᵉ / 102 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 59,6 % | 7ᵉ / 22 | llm-stats | Auto-déclaré |
| Terminal-Bench | 39,2 % | 10ᵉ / 25 | llm-stats | Auto-déclaré |
| ARC-AGI v2 | 8,6 % | 14ᵉ / 16 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1424 | 91ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Text | 1412 | 112ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Vision | 1206 | 58ᵉ / 135 | Claude Fable 5 (1318) |
| Arena Vision | 1188 | 69ᵉ / 135 | Claude Fable 5 (1318) |
| Arena Search | 1126 | 30ᵉ / 32 | Claude Opus 4.6 (1255) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Google Vertex | 15 $ | 75 $ | 1,5 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 619 % au-dessus de la moyenne des LLM similaires, et 2,7 fois plus cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 1,4 $ |
| Latence moyenne par benchmark — Benchable | 9 min 55 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À son époque, Claude Opus 4 appartenait au haut du panier sur GPQA diamond. Les mathématiques constituent son meilleur signal actuel : son Math Index le place dans la première moitié du panel. Ses résultats Benchable en Mathematics et Coding sont également élevés. La fenêtre de 200 000 tokens constitue un autre point marquant pour le traitement de longs contextes.
Limites et points d’attention. Son Intelligence Index se situe en retrait du classement. Dans les deux relevés Arena text, il occupe les 91e et 112e rangs sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. En Arena vision, il se classe 58e sur 135, derrière les mêmes modèles, avec là encore un écart important face au premier. Ses scores Benchable plafonnés sont peu discriminants, plusieurs dizaines de modèles partageant les mêmes places. Son tarif dépasse de 619% la moyenne des LLM similaires et atteint environ 2.7 fois celui des modèles frontière. Claude Opus 4 conserve surtout un intérêt historique. Pour de meilleurs résultats en Arena, Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7 sont préférables.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).