Claude Opus 5
Claude Opus 5 est un LLM propriétaire d’Anthropic, sorti le 24 juillet 2026. Positionné sur le segment premium, il se distingue par une fenêtre de contexte de 1 million de tokens et par des résultats de premier plan en mathématiques, en sciences et dans plusieurs arènes spécialisées.
Claude Opus 5 est un LLM propriétaire d’Anthropic, sorti le 24 juillet 2026. Positionné sur le segment premium, il se distingue par une fenêtre de contexte de 1 million de tokens et par des résultats de premier plan en mathématiques, en sciences et dans plusieurs arènes spécialisées.
Le modèle associe un niveau élevé sur les problèmes complexes à de solides évaluations humaines en génération de code, en conversion d’images en code et en traitement de documents. À sa sortie, il figurait dans le top 7% des LLM de sa génération sur GPQA diamond.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 24 juillet 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: OTIS Mock AIME 2024-2025 | 98,9 % | 7ᵉ / 122 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 93,9 % | 6ᵉ / 143 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 85,6 % | 5ᵉ / 42 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 73,2 % | 5ᵉ / 43 | epoch | ✅ Mesuré |
| Epoch: Mystery Game Puzzles | 59,0 % | 1ᵉ / 21 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 56,7 % | 15ᵉ / 63 | epoch | ✅ Mesuré |
| Epoch: EBR-bench | 45,7 % | 1ᵉ / 18 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 42,0 % | 10ᵉ / 65 | epoch | ✅ Mesuré |
| BrowseComp | 90,8 % | 2ᵉ / 58 | llm-stats | Auto-déclaré |
| OSWorld 2.0 | 70,6 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| DeepSWE 1.1 | 68,8 % | 5ᵉ / 19 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 64,7 % | 1ᵉ / 91 | llm-stats | Auto-déclaré |
| HealthBench Professional | 59,8 % | 3ᵉ / 9 | llm-stats | Auto-déclaré |
| FrontierCode | 53,4 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| FrontierCode 1.1 | 53,4 % | 2ᵉ / 15 | llm-stats | n.d. |
| ARC-AGI-3 | 30,2 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| AutomationBench | 26,0 % | 2ᵉ / 8 | llm-stats | Auto-déclaré |
| Legal Agent Benchmark | 11,7 % | 2ᵉ / 13 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: OTIS Mock AIME 2024-2025
Epoch: GPQA diamond
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Image-to-Code | 1670 | 1ᵉ / 42 | Claude Opus 5 (1670) |
| Arena Code | 1669 | 3ᵉ / 109 | Kimi K3 (1676) |
| Arena Document | 1520 | 1ᵉ / 39 | Claude Opus 5 (1520) |
| Arena Text | 1492 | 7ᵉ / 199 | Claude Fable 5 (1509) |
| Arena Vision | 1295 | 6ᵉ / 145 | Claude Fable 5 (1318) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| anthropic | 5 $ | 25 $ | n.d. |
| Claude Platform on AWS | 5 $ | 25 $ | 0,5 $ |
| Anthropic | 10 $ | 50 $ | 1 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 146 % au-dessus de la moyenne des LLM similaires, et 1,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | United States of America |
Notre analyse
Forces. Claude Opus 5 appartient au top 10 sur OTIS Mock AIME, GPQA diamond et les deux niveaux de FrontierMath, qui couvrent les mathématiques de niveau lycée jusqu’aux problèmes de recherche très difficiles. Il prend aussi la première place sur Mystery Game Puzzles. Dans Arena image-to-code, il devance Qwen3.8 Max, Claude Fable 5 et GPT-5.6 Sol. Il arrive également premier dans Arena document, devant Claude Opus 4.6 et Claude Fable 5. Dans Arena Code, il occupe la troisième place derrière Kimi K3 et Qwen3.8 Max. L’écart avec Kimi K3 est faible, et les deux modèles sont à peu près à parité en duel.
Limites et points d’attention. SimpleQA Verified constitue son principal point faible relatif : le modèle se classe 15e sur 63 sur les questions factuelles vérifiables, loin de ses positions en mathématiques et dans les arènes. Son tarif est premium, à 146% au-dessus de la moyenne des LLM similaires, même s’il reste environ 1,1 fois moins cher que les modèles frontière. Son caractère propriétaire limite aussi son ouverture. Claude Opus 5 vise surtout les tâches exigeantes en mathématiques, en sciences, en code, en conversion d’interfaces visuelles et en analyse de documents volumineux.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.