Claude Opus 4

Claude Opus 4 est un LLM propriétaire lancé par Anthropic le 22 mai 2025. Âgé d’environ un an, il est déjà très ancien à l’échelle de l’IA. Ses performances sont désormais largement dépassées, et les versions de cet âge sont souvent retirées du catalogue de leur éditeur.

Claude Opus 4 est un LLM propriétaire lancé par Anthropic le 22 mai 2025. Âgé d’environ un an, il est déjà très ancien à l’échelle de l’IA. Ses performances sont désormais largement dépassées, et les versions de cet âge sont souvent retirées du catalogue de leur éditeur.

À sa sortie, il figurait néanmoins dans le top 12% des 56 LLM de sa génération sur GPQA diamond. Il se distingue aussi par une fenêtre de contexte de 200 000 tokens et des connaissances arrêtées au 31 janvier 2025. Son positionnement premium reste particulièrement coûteux face au marché.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie22 mai 2025
Connaissances jusqu'à2025-01-31
Multimodaloui
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index31.057ᵉ / 137
Math Index73.321ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)97,0 %100ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)94,0 %32ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)94,0 %30ᵉ / 140benchable✅ Mesuré
Benchable : Reasoning (Baseline)90,0 %53ᵉ / 155benchable✅ Mesuré
Epoch: MATH level 585,0 %12ᵉ / 59epoch✅ Mesuré
Epoch: GPQA diamond76,3 %27ᵉ / 85epoch✅ Mesuré
Benchable : Instruction Following (Baseline)71,0 %47ᵉ / 163benchable✅ Mesuré
Epoch: SWE-Bench verified70,7 %9ᵉ / 15epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202564,4 %28ᵉ / 64epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private4,5 %22ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private4,2 %10ᵉ / 25epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Public0,0 %1ᵉ / 15epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré
MMMLU88,8 %16ᵉ / 49llm-statsAuto-déclaré
TAU-bench Retail81,4 %3ᵉ / 24llm-statsAuto-déclaré
GPQA79,6 %80ᵉ / 219llm-statsAuto-déclaré
MMMU (validation)76,5 %3ᵉ / 4llm-statsAuto-déclaré
AIME 202575,5 %72ᵉ / 108llm-statsAuto-déclaré
SWE-Bench Verified72,5 %49ᵉ / 102llm-statsAuto-déclaré
TAU-bench Airline59,6 %7ᵉ / 22llm-statsAuto-déclaré
Terminal-Bench39,2 %10ᵉ / 25llm-statsAuto-déclaré
ARC-AGI v28,6 %14ᵉ / 16llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Qwen3.5 397B A17B32.0
▶ Claude Opus 431.0

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ Claude Opus 473.3

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text142491ᵉ / 200Claude Fable 5 (1507)
Arena Text1412112ᵉ / 200Claude Fable 5 (1507)
Arena Vision120658ᵉ / 135Claude Fable 5 (1318)
Arena Vision118869ᵉ / 135Claude Fable 5 (1318)
Arena Search112630ᵉ / 32Claude Opus 4.6 (1255)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Google Vertex15 $75 $1,5 $

Prix en dollars US par million de tokens.

Sa tarification se situe 619 % au-dessus de la moyenne des LLM similaires, et 2,7 fois plus cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable1,4 $
Latence moyenne par benchmark — Benchable9 min 55 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À son époque, Claude Opus 4 appartenait au haut du panier sur GPQA diamond. Les mathématiques constituent son meilleur signal actuel : son Math Index le place dans la première moitié du panel. Ses résultats Benchable en Mathematics et Coding sont également élevés. La fenêtre de 200 000 tokens constitue un autre point marquant pour le traitement de longs contextes.

Limites et points d’attention. Son Intelligence Index se situe en retrait du classement. Dans les deux relevés Arena text, il occupe les 91e et 112e rangs sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. En Arena vision, il se classe 58e sur 135, derrière les mêmes modèles, avec là encore un écart important face au premier. Ses scores Benchable plafonnés sont peu discriminants, plusieurs dizaines de modèles partageant les mêmes places. Son tarif dépasse de 619% la moyenne des LLM similaires et atteint environ 2.7 fois celui des modèles frontière. Claude Opus 4 conserve surtout un intérêt historique. Pour de meilleurs résultats en Arena, Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7 sont préférables.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).