Claude Opus 4.8
Claude Opus 4.8 est un LLM propriétaire d’Anthropic, lancé le 28 mai 2026. Positionné sur le segment premium, il se distingue par une fenêtre de contexte de 1 000 000 tokens et par des résultats de premier plan en raisonnement, en programmation et dans les tâches agentiques.
Claude Opus 4.8 est un LLM propriétaire d’Anthropic, lancé le 28 mai 2026. Positionné sur le segment premium, il se distingue par une fenêtre de contexte de 1 000 000 tokens et par des résultats de premier plan en raisonnement, en programmation et dans les tâches agentiques.
À sa sortie, il appartenait au top 13% des LLM de sa génération sur GPQA diamond. Ses poids ne sont pas ouverts. Son tarif, nettement supérieur à la moyenne des modèles similaires, reste toutefois légèrement inférieur à celui des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 28 mai 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 55.7 | 3ᵉ / 137 |
| Code Index | 74.3 | 3ᵉ / 74 |
| Agentic Index | 47.2 | 3ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| GPQA | 93,6 % | 5ᵉ / 219 | llm-stats | Auto-déclaré |
| DeepSearchQA | 93,1 % | 2ᵉ / 8 | llm-stats | Auto-déclaré |
| CharXiv-R | 89,9 % | 4ᵉ / 45 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 88,6 % | 3ᵉ / 102 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 87,9 % | 1ᵉ / 23 | llm-stats | Auto-déclaré |
| Include | 87,6 % | 1ᵉ / 31 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 84,4 % | 2ᵉ / 34 | llm-stats | Auto-déclaré |
| BrowseComp | 84,3 % | 12ᵉ / 57 | llm-stats | Auto-déclaré |
| OSWorld-Verified | 83,4 % | 2ᵉ / 19 | llm-stats | Auto-déclaré |
| Graphwalks parents >128k | 83,3 % | 2ᵉ / 7 | llm-stats | Auto-déclaré |
| MCP Atlas | 82,2 % | 5ᵉ / 30 | llm-stats | Auto-déclaré |
| CyberGym | 78,8 % | 3ᵉ / 9 | llm-stats | Auto-déclaré |
| LiveBench | 77,2 % | 6ᵉ / 38 | llm-stats | n.d. |
| FrontierSWE | 75,0 % | 3ᵉ / 14 | llm-stats | n.d. |
| Terminal-Bench 2.0 | 74,6 % | 7ᵉ / 49 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 69,2 % | 3ᵉ / 41 | llm-stats | Auto-déclaré |
| Graphwalks BFS >128k | 68,1 % | 5ᵉ / 11 | llm-stats | Auto-déclaré |
| OfficeQA Pro | 66,2 % | 3ᵉ / 7 | llm-stats | Auto-déclaré |
| Toolathlon | 59,9 % | 3ᵉ / 30 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 57,9 % | 5ᵉ / 89 | llm-stats | Auto-déclaré |
| HealthBench Professional | 55,8 % | 5ᵉ / 8 | llm-stats | Auto-déclaré |
| GDPval-AA | 54,6 % | 4ᵉ / 39 | llm-stats | n.d. |
| Finance Agent v2 | 53,9 % | 4ᵉ / 26 | llm-stats | n.d. |
| Finance Agent | 53,9 % | 7ᵉ / 8 | llm-stats | Auto-déclaré |
| SWE-Bench Multimodal | 38,4 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Code | 1562 | 5ᵉ / 99 | Kimi K3 (1679) |
| Arena Code | 1534 | 13ᵉ / 99 | Kimi K3 (1679) |
| Arena Text | 1483 | 12ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Text | 1476 | 17ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Document | 1475 | 9ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Document | 1469 | 11ᵉ / 32 | Claude Opus 4.6 (1508) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Azure | 5 $ | 25 $ | 0,5 $ |
| anthropic | 5 $ | 25 $ | n.d. |
| Anthropic | 10 $ | 50 $ | 1 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 140 % au-dessus de la moyenne des LLM similaires, et 1,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 81,79 $ |
| Durée d'exécution — PinchBench | 4 h 04 min |
| Indice valeur/coût — PinchBench | 1,15 |
| Coût moyen par benchmark — Benchable | 0,41 $ |
| Latence moyenne par benchmark — Benchable | 4 min 32 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Claude Opus 4.8 figure dans le top 10 de l’Intelligence Index, du Code Index et de l’Agentic Index, avec une troisième place dans chacun de ces classements. Les évaluations confirment un niveau particulièrement élevé en mathématiques : il se classe parmi les meilleurs sur LiveBench Mathematics et obtient 98% à OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée). Il atteint aussi la première place sur Ethics (Baseline). Dans les Arena, il se situe près de la tête en code et dans le haut du classement en texte. Sa fenêtre d’un million de tokens constitue un autre trait distinctif pour le traitement de contextes volumineux.
Limites et points d’attention. Le positionnement premium se traduit par un tarif supérieur de 151% à la moyenne des LLM similaires, malgré un coût environ 1.1 fois inférieur à celui des modèles frontière. Certains scores Baseline très élevés sont moins discriminants qu’ils ne le paraissent : le résultat parfait en General Knowledge correspond à la 76e place, tandis que les 98% en Email Classification placent le modèle au 90e rang. Ses résultats Arena restent également derrière le modèle en tête. Claude Opus 4.8 cible ainsi surtout les usages exigeants en mathématiques, en code, en tâches agentiques et en contexte long, lorsque le niveau de performance justifie un coût élevé.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).