Claude Opus 4.1

Claude Opus 4.1 est un LLM propriétaire lancé par l’éditeur américain Anthropic le 5 août 2025. Cette offre premium dispose d’une fenêtre de contexte de 200 000 tokens et de connaissances arrêtées au 31 janvier 2025.

Claude Opus 4.1 est un LLM propriétaire lancé par l’éditeur américain Anthropic le 5 août 2025. Cette offre premium dispose d’une fenêtre de contexte de 200 000 tokens et de connaissances arrêtées au 31 janvier 2025.

Le modèle se distingue surtout par son niveau en mathématiques et sa capacité à traiter de longues entrées. Son positionnement tarifaire est particulièrement élevé, à 619% au-dessus de la moyenne des LLM similaires et environ 2,7 fois plus cher que les modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie5 août 2025
Connaissances jusqu'à2025-01-31
Multimodaloui
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index28.269ᵉ / 137
Math Index80.318ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)94,0 %32ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)92,9 %59ᵉ / 140benchable✅ Mesuré
Benchable : Reasoning (Baseline)92,0 %50ᵉ / 155benchable✅ Mesuré
Epoch: GPQA diamond77,3 %25ᵉ / 85epoch✅ Mesuré
Epoch: SWE-Bench verified73,3 %7ᵉ / 15epoch✅ Mesuré
Benchable : Instruction Following (Baseline)69,0 %57ᵉ / 163benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202568,9 %26ᵉ / 64epoch✅ Mesuré
Epoch: SimpleQA Verified34,8 %17ᵉ / 26epoch✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private12,6 %17ᵉ / 17epoch✅ Mesuré
Epoch: EBR-bench7,9 %6ᵉ / 7epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private7,2 %18ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private4,2 %10ᵉ / 25epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private2,4 %15ᵉ / 18epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré
MMMLU89,5 %10ᵉ / 49llm-statsAuto-déclaré
TAU-bench Retail82,4 %2ᵉ / 24llm-statsAuto-déclaré
GPQA80,9 %76ᵉ / 219llm-statsAuto-déclaré
AIME 202578,0 %69ᵉ / 108llm-statsAuto-déclaré
MMMU (validation)77,1 %2ᵉ / 4llm-statsAuto-déclaré
SWE-Bench Verified74,5 %35ᵉ / 102llm-statsAuto-déclaré
TAU-bench Airline56,0 %9ᵉ / 22llm-statsAuto-déclaré
Terminal-Bench43,3 %5ᵉ / 25llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Claude Opus 4.128.2
Nova 2.0 Pro Preview21.8

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ Claude Opus 4.180.3

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text144953ᵉ / 200Claude Fable 5 (1507)
Arena Text144758ᵉ / 200Claude Fable 5 (1507)
Arena Code138657ᵉ / 99Kimi K3 (1679)
Arena Search114823ᵉ / 32Claude Opus 4.6 (1255)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Anthropic15 $75 $1,5 $

Prix en dollars US par million de tokens.

Sa tarification se situe 619 % au-dessus de la moyenne des LLM similaires, et 2,7 fois plus cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable1,25 $
Latence moyenne par benchmark — Benchable9 min 36 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Claude Opus 4.1 figurait dans le top 12% des 57 LLM de sa génération sur Epoch GPQA diamond. Le Math Index le place dans le premier tiers du classement, son domaine le plus solide. Sa fenêtre de 200 000 tokens convient aussi au traitement de longs volumes de texte.

Limites et points d’attention. Son Intelligence Index se situe au milieu du tableau. Ses scores maximaux sur Hallucinations, General Knowledge et Ethics sont partagés avec de nombreux modèles sur des benchmarks plafonnés, donc peu discriminants. Dans les deux relevés Arena text, il reste derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec Claude Fable 5 demeure modéré. En Arena Code, il se place derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. Kimi K3 est nettement devant. Claude Opus 4.1 reste pertinent pour les tâches mathématiques et les entrées longues, malgré un tarif premium difficile à justifier au regard de ses classements. Pour un résultat textuel plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).