Claude Opus 4.5

Claude Opus 4.5 est un LLM propriétaire américain d’Anthropic, lancé le 24 novembre 2025 et positionné sur le segment premium. Sa fenêtre de contexte de 200 000 tokens constitue l’un de ses principaux attributs, avec des connaissances arrêtées au 31 mars 2025.

Claude Opus 4.5 est un LLM propriétaire américain d’Anthropic, lancé le 24 novembre 2025 et positionné sur le segment premium. Sa fenêtre de contexte de 200 000 tokens constitue l’un de ses principaux attributs, avec des connaissances arrêtées au 31 mars 2025.

À sa sortie, ce modèle haut de gamme se plaçait dans le haut du panier de sa génération sur GPQA diamond. Son profil associe une bonne position dans les évaluations textuelles, un niveau moins distinctif en mathématiques et un classement plus en retrait en code.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie24 novembre 2025
Connaissances jusqu'à2025-03-31
Multimodaloui
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index34.740ᵉ / 137
Math Index62.725ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Hallucinations (Baseline)98,0 %47ᵉ / 146benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)98,0 %16ᵉ / 155benchable✅ Mesuré
Benchable : Mathematics (Baseline)96,0 %8ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)95,0 %17ᵉ / 162benchable✅ Mesuré
LiveBench: Mathematics90,4 %4ᵉ / 7livebench✅ Mesuré
Epoch: OTIS Mock AIME 2024-202586,1 %14ᵉ / 64epoch✅ Mesuré
Epoch: GPQA diamond86,0 %14ᵉ / 85epoch✅ Mesuré
LiveBench: Language81,3 %2ᵉ / 7livebench✅ Mesuré
LiveBench: Reasoning80,1 %4ᵉ / 7livebench✅ Mesuré
LiveBench: Coding79,7 %1ᵉ / 7livebench✅ Mesuré
Benchable : Instruction Following (Baseline)77,0 %34ᵉ / 163benchable✅ Mesuré
Epoch: SWE-Bench verified76,7 %2ᵉ / 15epoch✅ Mesuré
LiveBench: Data Analysis74,4 %4ᵉ / 7livebench✅ Mesuré
LiveBench: Global average72,6 %3ᵉ / 7livebench✅ Mesuré
LiveBench: IF62,5 %5ᵉ / 7livebench✅ Mesuré
Epoch: SimpleQA Verified41,8 %12ᵉ / 26epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public40,0 %7ᵉ / 33epoch✅ Mesuré
LiveBench: Agentic Coding39,7 %6ᵉ / 7livebench✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private34,4 %14ᵉ / 17epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private20,7 %11ᵉ / 32epoch✅ Mesuré
Epoch: EBR-bench14,3 %3ᵉ / 7epoch✅ Mesuré
Epoch: Chess Puzzles12,0 %18ᵉ / 20epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private4,9 %14ᵉ / 18epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private4,2 %10ᵉ / 25epoch✅ Mesuré
Tau2 Telecom98,2 %5ᵉ / 34llm-statsAuto-déclaré
MMMLU90,8 %7ᵉ / 49llm-statsAuto-déclaré
Tau2 Retail88,9 %3ᵉ / 25llm-statsAuto-déclaré
GPQA87,0 %35ᵉ / 219llm-statsAuto-déclaré
SWE-Bench Verified80,9 %6ᵉ / 102llm-statsAuto-déclaré
MMMU (validation)80,7 %1ᵉ / 4llm-statsAuto-déclaré
LiveBench76,0 %12ᵉ / 38llm-statsn.d.
OSWorld66,3 %6ᵉ / 20llm-statsAuto-déclaré
MCP Atlas62,3 %24ᵉ / 30llm-statsAuto-déclaré
Terminal-Bench 2.059,3 %21ᵉ / 49llm-statsAuto-déclaré
ARC-AGI v237,6 %10ᵉ / 16llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nemotron 3 Ultra 550B A…37.8
▶ Claude Opus 4.534.7
Qwen3.5 397B A17B32.0

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ Claude Opus 4.562.7

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Code149023ᵉ / 99Kimi K3 (1679)
Arena Text147325ᵉ / 200Claude Fable 5 (1507)
Arena Text146929ᵉ / 200Claude Fable 5 (1507)
Arena Code146628ᵉ / 99Kimi K3 (1679)
Arena Document146114ᵉ / 32Claude Opus 4.6 (1508)
Arena Search117917ᵉ / 32Claude Opus 4.6 (1255)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Anthropic5 $25 $0,5 $

Prix en dollars US par million de tokens.

Sa tarification se situe 140 % au-dessus de la moyenne des LLM similaires, et 1,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,42 $
Latence moyenne par benchmark — Benchable6 min 04 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Claude Opus 4.5 figurait dans le top 8% des LLM de sa génération sur GPQA diamond. Son Intelligence Index le situe dans le premier tiers du classement. Dans les deux évaluations Arena text, il figure dans le premier sixième, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec Claude Fable 5 reste faible : les deux modèles sont proches.

Limites et points d’attention. Le Math Index le place autour du milieu du classement. En Arena Code, il reste derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. Kimi K3 est nettement devant. Les scores presque parfaits obtenus sur Benchable sont plafonnés et partagés avec de nombreux modèles, ce qui les rend peu discriminants. Le tarif dépasse de 140% la moyenne des LLM similaires, même s’il reste environ 1,1 fois moins cher que les modèles frontière. Claude Opus 4.5 reste pertinent pour les usages textuels nécessitant une grande fenêtre de contexte. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Kimi K3.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).