Claude Opus 4.7
Claude Opus 4.7 est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 16 avril 2026. Positionné sur le segment premium, il se distingue par une fenêtre de contexte de 1 000 000 tokens et par des résultats élevés en raisonnement, en programmation et dans les tâches agentiques.
Claude Opus 4.7 est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 16 avril 2026. Positionné sur le segment premium, il se distingue par une fenêtre de contexte de 1 000 000 tokens et par des résultats élevés en raisonnement, en programmation et dans les tâches agentiques.
À sa sortie, il figurait dans le top 14% des LLM de sa génération sur GPQA diamond. Il occupe aussi la tête de l’Arena image-to-code et se classe dans le top 10 des principaux indices synthétiques, ce qui dessine un modèle polyvalent, particulièrement orienté vers le code et le traitement de contextes très longs.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 16 avril 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 53.5 | 5ᵉ / 137 |
| Code Index | 73.6 | 4ᵉ / 74 |
| Agentic Index | 44.4 | 6ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| GPQA | 94,2 % | 4ᵉ / 219 | llm-stats | Auto-déclaré |
| MMMLU | 91,5 % | 5ᵉ / 49 | llm-stats | Auto-déclaré |
| CharXiv-R | 91,0 % | 3ᵉ / 45 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 87,6 % | 4ᵉ / 102 | llm-stats | Auto-déclaré |
| BrowseComp | 79,3 % | 19ᵉ / 57 | llm-stats | Auto-déclaré |
| OSWorld-Verified | 78,0 % | 8ᵉ / 19 | llm-stats | Auto-déclaré |
| MCP Atlas | 77,3 % | 8ᵉ / 30 | llm-stats | Auto-déclaré |
| LiveBench | 76,9 % | 8ᵉ / 38 | llm-stats | n.d. |
| CyberGym | 73,1 % | 5ᵉ / 9 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 69,4 % | 10ᵉ / 49 | llm-stats | Auto-déclaré |
| Finance Agent | 64,4 % | 1ᵉ / 8 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 64,3 % | 6ᵉ / 41 | llm-stats | Auto-déclaré |
| FrontierSWE | 63,0 % | 6ᵉ / 14 | llm-stats | n.d. |
| Humanity's Last Exam | 54,7 % | 10ᵉ / 89 | llm-stats | Auto-déclaré |
| Finance Agent v2 | 51,5 % | 6ᵉ / 26 | llm-stats | n.d. |
| GDPval-AA | 51,4 % | 10ᵉ / 39 | llm-stats | n.d. |
| Legal Agent Benchmark | 7,1 % | 2ᵉ / 12 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Image-to-Code | 1581 | 2ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Image-to-Code | 1567 | 3ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Code | 1558 | 7ᵉ / 99 | Kimi K3 (1679) |
| Arena Code | 1555 | 8ᵉ / 99 | Kimi K3 (1679) |
| Arena Document | 1504 | 4ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Text | 1503 | 3ᵉ / 200 | Claude Fable 5 (1507) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Amazon Bedrock (US) | 5 $ | 25 $ | 0,5 $ |
| anthropic | 5 $ | 25 $ | n.d. |
| Anthropic | 30 $ | 150 $ | 3 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 140 % au-dessus de la moyenne des LLM similaires, et 1,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 62,5 $ |
| Durée d'exécution — PinchBench | 4 h 31 min |
| Indice valeur/coût — PinchBench | 2,41 |
| Coût moyen par benchmark — Benchable | 0,39 $ |
| Latence moyenne par benchmark — Benchable | 4 min 12 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | United States of America |
Notre analyse
Forces. Claude Opus 4.7 appartient au top 10 de l’Intelligence Index, du Code Index et de l’Agentic Index. Ses scores parfaits en General Knowledge et en Ethics le placent en tête sur ces deux évaluations. Il obtient également un résultat de premier plan sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée). En programmation, sa première place dans l’Arena image-to-code constitue son résultat le plus distinctif, tandis que l’Arena code le maintient parmi les dix meilleurs modèles évalués. La fenêtre d’un million de tokens complète ce profil pour les traitements nécessitant un contexte volumineux.
Limites et points d’attention. Les résultats bruts élevés ne se traduisent pas toujours par des classements dominants. Claude Opus 4.7 reste loin de la tête en Email Classification et en Coding Baseline, malgré des scores respectifs de 98% et 94%. Dans l’Arena code, il se situe aussi derrière le modèle leader. Son principal compromis est tarifaire : son prix est supérieur de 151% à la moyenne des LLM similaires, même s’il reste environ 1,1 fois moins cher que les modèles frontière. Ce positionnement convient surtout aux usages exigeants en code, en raisonnement, en tâches agentiques ou en contexte long, lorsque la performance prime sur le coût.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).