Claude Opus 5

Claude Opus 5 est un LLM propriétaire d’Anthropic, sorti le 24 juillet 2026. Positionné sur le segment premium, il se distingue par une fenêtre de contexte de 1 million de tokens et par des résultats de premier plan en mathématiques, en sciences et dans plusieurs arènes spécialisées.

Claude Opus 5 est un LLM propriétaire d’Anthropic, sorti le 24 juillet 2026. Positionné sur le segment premium, il se distingue par une fenêtre de contexte de 1 million de tokens et par des résultats de premier plan en mathématiques, en sciences et dans plusieurs arènes spécialisées.

Le modèle associe un niveau élevé sur les problèmes complexes à de solides évaluations humaines en génération de code, en conversion d’images en code et en traitement de documents. À sa sortie, il figurait dans le top 7% des LLM de sa génération sur GPQA diamond.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie24 juillet 2026
Multimodaloui
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: OTIS Mock AIME 2024-202598,9 %7ᵉ / 122epoch✅ Mesuré
Epoch: GPQA diamond93,9 %6ᵉ / 143epoch✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private85,6 %5ᵉ / 42epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private73,2 %5ᵉ / 43epoch✅ Mesuré
Epoch: Mystery Game Puzzles59,0 %1ᵉ / 21epoch✅ Mesuré
Epoch: SimpleQA Verified56,7 %15ᵉ / 63epoch✅ Mesuré
Epoch: EBR-bench45,7 %1ᵉ / 18epoch✅ Mesuré
Epoch: Chess Puzzles42,0 %10ᵉ / 65epoch✅ Mesuré
BrowseComp90,8 %2ᵉ / 58llm-statsAuto-déclaré
OSWorld 2.070,6 %1ᵉ / 4llm-statsAuto-déclaré
DeepSWE 1.168,8 %5ᵉ / 19llm-statsAuto-déclaré
Humanity's Last Exam64,7 %1ᵉ / 91llm-statsAuto-déclaré
HealthBench Professional59,8 %3ᵉ / 9llm-statsAuto-déclaré
FrontierCode53,4 %1ᵉ / 3llm-statsAuto-déclaré
FrontierCode 1.153,4 %2ᵉ / 15llm-statsn.d.
ARC-AGI-330,2 %1ᵉ / 4llm-statsAuto-déclaré
AutomationBench26,0 %2ᵉ / 8llm-statsAuto-déclaré
Legal Agent Benchmark11,7 %2ᵉ / 13llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: OTIS Mock AIME 2024-2025

▶ Claude Opus 599 %

Epoch: GPQA diamond

▶ Claude Opus 594 %

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Image-to-Code16701ᵉ / 42Claude Opus 5 (1670)
Arena Code16693ᵉ / 109Kimi K3 (1676)
Arena Document15201ᵉ / 39Claude Opus 5 (1520)
Arena Text14927ᵉ / 199Claude Fable 5 (1509)
Arena Vision12956ᵉ / 145Claude Fable 5 (1318)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
anthropic5 $25 $n.d.
Claude Platform on AWS5 $25 $0,5 $
Anthropic10 $50 $1 $

Prix en dollars US par million de tokens.

Sa tarification se situe 146 % au-dessus de la moyenne des LLM similaires, et 1,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Entraînement & empreinte

IndicateurValeur
PaysUnited States of America

Notre analyse

Forces. Claude Opus 5 appartient au top 10 sur OTIS Mock AIME, GPQA diamond et les deux niveaux de FrontierMath, qui couvrent les mathématiques de niveau lycée jusqu’aux problèmes de recherche très difficiles. Il prend aussi la première place sur Mystery Game Puzzles. Dans Arena image-to-code, il devance Qwen3.8 Max, Claude Fable 5 et GPT-5.6 Sol. Il arrive également premier dans Arena document, devant Claude Opus 4.6 et Claude Fable 5. Dans Arena Code, il occupe la troisième place derrière Kimi K3 et Qwen3.8 Max. L’écart avec Kimi K3 est faible, et les deux modèles sont à peu près à parité en duel.

Limites et points d’attention. SimpleQA Verified constitue son principal point faible relatif : le modèle se classe 15e sur 63 sur les questions factuelles vérifiables, loin de ses positions en mathématiques et dans les arènes. Son tarif est premium, à 146% au-dessus de la moyenne des LLM similaires, même s’il reste environ 1,1 fois moins cher que les modèles frontière. Son caractère propriétaire limite aussi son ouverture. Claude Opus 5 vise surtout les tâches exigeantes en mathématiques, en sciences, en code, en conversion d’interfaces visuelles et en analyse de documents volumineux.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.