Claude Opus 4.5
Claude Opus 4.5 est un LLM propriétaire américain d’Anthropic, lancé le 24 novembre 2025 et positionné sur le segment premium. Sa fenêtre de contexte de 200 000 tokens constitue l’un de ses principaux attributs, avec des connaissances arrêtées au 31 mars 2025.
Claude Opus 4.5 est un LLM propriétaire américain d’Anthropic, lancé le 24 novembre 2025 et positionné sur le segment premium. Sa fenêtre de contexte de 200 000 tokens constitue l’un de ses principaux attributs, avec des connaissances arrêtées au 31 mars 2025.
À sa sortie, ce modèle haut de gamme se plaçait dans le haut du panier de sa génération sur GPQA diamond. Son profil associe une bonne position dans les évaluations textuelles, un niveau moins distinctif en mathématiques et un classement plus en retrait en code.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 24 novembre 2025 |
| Connaissances jusqu'à | 2025-03-31 |
| Multimodal | oui |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 34.7 | 40ᵉ / 137 |
| Math Index | 62.7 | 25ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 98,0 % | 47ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 98,0 % | 16ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 96,0 % | 8ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 95,0 % | 17ᵉ / 162 | benchable | ✅ Mesuré |
| LiveBench: Mathematics | 90,4 % | 4ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 86,1 % | 14ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 86,0 % | 14ᵉ / 85 | epoch | ✅ Mesuré |
| LiveBench: Language | 81,3 % | 2ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Reasoning | 80,1 % | 4ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Coding | 79,7 % | 1ᵉ / 7 | livebench | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 77,0 % | 34ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: SWE-Bench verified | 76,7 % | 2ᵉ / 15 | epoch | ✅ Mesuré |
| LiveBench: Data Analysis | 74,4 % | 4ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Global average | 72,6 % | 3ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: IF | 62,5 % | 5ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: SimpleQA Verified | 41,8 % | 12ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 40,0 % | 7ᵉ / 33 | epoch | ✅ Mesuré |
| LiveBench: Agentic Coding | 39,7 % | 6ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 34,4 % | 14ᵉ / 17 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 20,7 % | 11ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: EBR-bench | 14,3 % | 3ᵉ / 7 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 12,0 % | 18ᵉ / 20 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 4,9 % | 14ᵉ / 18 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 4,2 % | 10ᵉ / 25 | epoch | ✅ Mesuré |
| Tau2 Telecom | 98,2 % | 5ᵉ / 34 | llm-stats | Auto-déclaré |
| MMMLU | 90,8 % | 7ᵉ / 49 | llm-stats | Auto-déclaré |
| Tau2 Retail | 88,9 % | 3ᵉ / 25 | llm-stats | Auto-déclaré |
| GPQA | 87,0 % | 35ᵉ / 219 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 80,9 % | 6ᵉ / 102 | llm-stats | Auto-déclaré |
| MMMU (validation) | 80,7 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| LiveBench | 76,0 % | 12ᵉ / 38 | llm-stats | n.d. |
| OSWorld | 66,3 % | 6ᵉ / 20 | llm-stats | Auto-déclaré |
| MCP Atlas | 62,3 % | 24ᵉ / 30 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 59,3 % | 21ᵉ / 49 | llm-stats | Auto-déclaré |
| ARC-AGI v2 | 37,6 % | 10ᵉ / 16 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Code | 1490 | 23ᵉ / 99 | Kimi K3 (1679) |
| Arena Text | 1473 | 25ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Text | 1469 | 29ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Code | 1466 | 28ᵉ / 99 | Kimi K3 (1679) |
| Arena Document | 1461 | 14ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Search | 1179 | 17ᵉ / 32 | Claude Opus 4.6 (1255) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Anthropic | 5 $ | 25 $ | 0,5 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 140 % au-dessus de la moyenne des LLM similaires, et 1,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,42 $ |
| Latence moyenne par benchmark — Benchable | 6 min 04 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Claude Opus 4.5 figurait dans le top 8% des LLM de sa génération sur GPQA diamond. Son Intelligence Index le situe dans le premier tiers du classement. Dans les deux évaluations Arena text, il figure dans le premier sixième, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec Claude Fable 5 reste faible : les deux modèles sont proches.
Limites et points d’attention. Le Math Index le place autour du milieu du classement. En Arena Code, il reste derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. Kimi K3 est nettement devant. Les scores presque parfaits obtenus sur Benchable sont plafonnés et partagés avec de nombreux modèles, ce qui les rend peu discriminants. Le tarif dépasse de 140% la moyenne des LLM similaires, même s’il reste environ 1,1 fois moins cher que les modèles frontière. Claude Opus 4.5 reste pertinent pour les usages textuels nécessitant une grande fenêtre de contexte. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Kimi K3.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).