Claude Sonnet 4.5

Claude Sonnet 4.5 est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 29 septembre 2025. Son positionnement intermédiaire associe de solides résultats en mathématiques et en code à des performances générales plus proches du milieu de tableau.

Claude Sonnet 4.5 est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 29 septembre 2025. Son positionnement intermédiaire associe de solides résultats en mathématiques et en code à des performances générales plus proches du milieu de tableau.

Sa fenêtre de contexte de 200 000 tokens constitue l’un de ses principaux atouts pour traiter de grandes quantités de texte. Ses connaissances s’arrêtent au 31 janvier 2025. Son tarif se situe dans la moyenne, tout en restant sensiblement inférieur à celui des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie29 septembre 2025
Connaissances jusqu'à2025-01-31
Multimodaloui
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text,image,audio,video → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index29.365ᵉ / 137
Code Index52.130ᵉ / 74
Agentic Index24.631ᵉ / 68
Math Index37.040ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Epoch: MATH level 597,7 %4ᵉ / 59epoch✅ Mesuré
Benchable : Coding (Baseline)95,0 %17ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)94,0 %30ᵉ / 140benchable✅ Mesuré
Benchable : Reasoning (Baseline)88,0 %56ᵉ / 155benchable✅ Mesuré
Epoch: GPQA diamond82,3 %21ᵉ / 85epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202577,8 %21ᵉ / 64epoch✅ Mesuré
Epoch: SWE-Bench verified71,3 %8ᵉ / 15epoch✅ Mesuré
Benchable : Instruction Following (Baseline)67,7 %63ᵉ / 163benchable✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private23,9 %15ᵉ / 17epoch✅ Mesuré
Epoch: SimpleQA Verified23,6 %20ᵉ / 26epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private15,2 %13ᵉ / 32epoch✅ Mesuré
Epoch: Chess Puzzles12,0 %18ᵉ / 20epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private4,2 %10ᵉ / 25epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private2,4 %15ᵉ / 18epoch✅ Mesuré
Epoch: EBR-bench2,4 %7ᵉ / 7epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Public0,0 %1ᵉ / 15epoch✅ Mesuré
MMMLU89,1 %13ᵉ / 49llm-statsAuto-déclaré
AIME 202587,0 %51ᵉ / 108llm-statsAuto-déclaré
TAU-bench Retail86,2 %1ᵉ / 24llm-statsAuto-déclaré
GPQA83,4 %58ᵉ / 219llm-statsAuto-déclaré
MMMUval77,8 %3ᵉ / 4llm-statsAuto-déclaré
TAU-bench Airline70,0 %1ᵉ / 22llm-statsAuto-déclaré
OSWorld61,4 %8ᵉ / 20llm-statsAuto-déclaré
Terminal-Bench50,0 %1ᵉ / 25llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Claude Sonnet 4.529.3
Nova 2.0 Pro Preview21.8

Code Index

▶ Claude Sonnet 4.552.1
Grok Build 0.1 061651.5

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text145646ᵉ / 200Claude Fable 5 (1507)
Arena Text145548ᵉ / 200Claude Fable 5 (1507)
Arena Document144616ᵉ / 32Claude Opus 4.6 (1508)
Arena Code138854ᵉ / 99Kimi K3 (1679)
Arena Code138656ᵉ / 99Kimi K3 (1679)
Arena Search115922ᵉ / 32Claude Opus 4.6 (1255)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Amazon Bedrock3 $15 $0,3 $
anthropic3 $15 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 44 % au-dessus de la moyenne des LLM similaires, et 1,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,27 $
Latence moyenne par benchmark — Benchable8 min 22 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Claude Sonnet 4.5 figurait dans le top 7% des LLM de sa génération sur GPQA diamond. Il atteint aussi le top 10 sur MATH level 5 d’Epoch avec 98%, tandis que son Code Index le place dans la première moitié du classement. Sa fenêtre de 200 000 tokens convient aux requêtes longues. Les scores Benchable plafonnés, notamment en connaissances générales, éthique et hallucinations, sont partagés avec de nombreux modèles et restent peu discriminants.

Limites et points d’attention. L’Intelligence Index et l’Agentic Index le situent au milieu du classement, tandis que le Math Index est en retrait malgré son excellent résultat sur MATH level 5. Dans Arena text, ses scores Elo de 1455 à 1456 le placent derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec le premier reste limité, les deux modèles sont proches en duel. Dans Arena document, il occupe le milieu du tableau derrière Claude Opus 4.6 et Claude Fable 5. Son prix est 44% supérieur à la moyenne des LLM similaires, mais environ 1.8 fois inférieur à celui des modèles frontière. Il reste pertinent pour le code, les mathématiques avancées et les longs contextes. Pour un résultat plus abouti, Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7 sont mieux classés.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).