Claude Opus 4.1
Claude Opus 4.1 est un LLM propriétaire lancé par l’éditeur américain Anthropic le 5 août 2025. Cette offre premium dispose d’une fenêtre de contexte de 200 000 tokens et de connaissances arrêtées au 31 janvier 2025.
Claude Opus 4.1 est un LLM propriétaire lancé par l’éditeur américain Anthropic le 5 août 2025. Cette offre premium dispose d’une fenêtre de contexte de 200 000 tokens et de connaissances arrêtées au 31 janvier 2025.
Le modèle se distingue surtout par son niveau en mathématiques et sa capacité à traiter de longues entrées. Son positionnement tarifaire est particulièrement élevé, à 619% au-dessus de la moyenne des LLM similaires et environ 2,7 fois plus cher que les modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 5 août 2025 |
| Connaissances jusqu'à | 2025-01-31 |
| Multimodal | oui |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 28.2 | 69ᵉ / 137 |
| Math Index | 80.3 | 18ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 94,0 % | 32ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 92,9 % | 59ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 92,0 % | 50ᵉ / 155 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 77,3 % | 25ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: SWE-Bench verified | 73,3 % | 7ᵉ / 15 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 69,0 % | 57ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 68,9 % | 26ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 34,8 % | 17ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 12,6 % | 17ᵉ / 17 | epoch | ✅ Mesuré |
| Epoch: EBR-bench | 7,9 % | 6ᵉ / 7 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 7,2 % | 18ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 4,2 % | 10ᵉ / 25 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 2,4 % | 15ᵉ / 18 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
| MMMLU | 89,5 % | 10ᵉ / 49 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 82,4 % | 2ᵉ / 24 | llm-stats | Auto-déclaré |
| GPQA | 80,9 % | 76ᵉ / 219 | llm-stats | Auto-déclaré |
| AIME 2025 | 78,0 % | 69ᵉ / 108 | llm-stats | Auto-déclaré |
| MMMU (validation) | 77,1 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 74,5 % | 35ᵉ / 102 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 56,0 % | 9ᵉ / 22 | llm-stats | Auto-déclaré |
| Terminal-Bench | 43,3 % | 5ᵉ / 25 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1449 | 53ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Text | 1447 | 58ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Code | 1386 | 57ᵉ / 99 | Kimi K3 (1679) |
| Arena Search | 1148 | 23ᵉ / 32 | Claude Opus 4.6 (1255) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Anthropic | 15 $ | 75 $ | 1,5 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 619 % au-dessus de la moyenne des LLM similaires, et 2,7 fois plus cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 1,25 $ |
| Latence moyenne par benchmark — Benchable | 9 min 36 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Claude Opus 4.1 figurait dans le top 12% des 57 LLM de sa génération sur Epoch GPQA diamond. Le Math Index le place dans le premier tiers du classement, son domaine le plus solide. Sa fenêtre de 200 000 tokens convient aussi au traitement de longs volumes de texte.
Limites et points d’attention. Son Intelligence Index se situe au milieu du tableau. Ses scores maximaux sur Hallucinations, General Knowledge et Ethics sont partagés avec de nombreux modèles sur des benchmarks plafonnés, donc peu discriminants. Dans les deux relevés Arena text, il reste derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec Claude Fable 5 demeure modéré. En Arena Code, il se place derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. Kimi K3 est nettement devant. Claude Opus 4.1 reste pertinent pour les tâches mathématiques et les entrées longues, malgré un tarif premium difficile à justifier au regard de ses classements. Pour un résultat textuel plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).