Claude Sonnet 4

Claude Sonnet 4 est un LLM propriétaire d’Anthropic, sorti le 22 mai 2025. Avec près d’un an d’ancienneté, il appartient déjà à une génération très ancienne à l’échelle de l’IA. Ses performances sont aujourd’hui probablement dépassées et ce type de modèle est souvent retiré du catalogue…

Claude Sonnet 4 est un LLM propriétaire d’Anthropic, sorti le 22 mai 2025. Avec près d’un an d’ancienneté, il appartient déjà à une génération très ancienne à l’échelle de l’IA. Ses performances sont aujourd’hui probablement dépassées et ce type de modèle est souvent retiré du catalogue de l’éditeur.

À sa sortie, il figurait pourtant dans le haut du panier de sa génération sur GPQA diamond. Il se caractérise aussi par une fenêtre de contexte de 200 000 tokens et des connaissances arrêtées au 31 janvier 2025. Son prix se situe dans la moyenne du marché.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie22 mai 2025
Connaissances jusqu'à2025-01-31
Multimodaloui
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index28.967ᵉ / 137
Code Index37.651ᵉ / 74
Agentic Index16.644ᵉ / 68
Math Index74.320ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,8 %43ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)93,0 %42ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)93,0 %44ᵉ / 140benchable✅ Mesuré
Benchable : Reasoning (Baseline)88,0 %56ᵉ / 155benchable✅ Mesuré
Epoch: MATH level 584,4 %13ᵉ / 59epoch✅ Mesuré
Epoch: GPQA diamond79,2 %24ᵉ / 85epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202571,1 %25ᵉ / 64epoch✅ Mesuré
Benchable : Instruction Following (Baseline)66,0 %66ᵉ / 163benchable✅ Mesuré
PinchBench : agentique (OpenClaw, 147 tâches)48,8 %18ᵉ / 19pinchbench✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private4,1 %24ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Public0,0 %1ᵉ / 15epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private0,0 %20ᵉ / 25epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré
MMMLU86,5 %23ᵉ / 49llm-statsAuto-déclaré
TAU-bench Retail80,5 %5ᵉ / 24llm-statsAuto-déclaré
GPQA75,4 %94ᵉ / 219llm-statsAuto-déclaré
MMMU74,4 %22ᵉ / 61llm-statsAuto-déclaré
SWE-Bench Verified72,7 %48ᵉ / 102llm-statsAuto-déclaré
AIME 202570,5 %82ᵉ / 108llm-statsAuto-déclaré
TAU-bench Airline60,0 %4ᵉ / 22llm-statsAuto-déclaré
Terminal-Bench35,5 %13ᵉ / 25llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Claude Sonnet 428.9
Nova 2.0 Pro Preview21.8

Code Index

Qwen3.5 122B A10B43.3
▶ Claude Sonnet 437.6
Nova 2.0 Pro Preview34.0

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text1399128ᵉ / 200Claude Fable 5 (1507)
Arena Text1389142ᵉ / 200Claude Fable 5 (1507)
Arena Vision120757ᵉ / 135Claude Fable 5 (1318)
Arena Vision118868ᵉ / 135Claude Fable 5 (1318)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Google Vertex (Global)3 $15 $0,3 $

Prix en dollars US par million de tokens.

Sa tarification se situe 44 % au-dessus de la moyenne des LLM similaires, et 1,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)24,23 $
Durée d'exécution — PinchBench5 h 43 min
Indice valeur/coût — PinchBench2,73
Coût moyen par benchmark — Benchable0,3 $
Latence moyenne par benchmark — Benchable7 min 25 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Claude Sonnet 4 se classait dans le top 9% des 56 LLM de sa génération sur GPQA diamond. Les mathématiques constituent son principal point fort actuel, avec une place dans le top 20 du Math Index. Sa fenêtre de 200 000 tokens offre aussi une capacité de contexte étendue. Les scores de 100% en Hallucinations et Ethics sont toutefois partagés avec respectivement 45 et 71 autres modèles sur des benchmarks plafonnés, donc peu discriminants.

Limites et points d’attention. Claude Sonnet 4 apparaît désormais en retrait dans l’Intelligence Index, le Code Index et l’Agentic Index. Selon les deux évaluations Arena text, il occupe les rangs 128 et 142 sur 200. En Arena vision, il se classe 57e sur 135. Il reste derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Dans chaque cas, le premier est nettement devant. Son tarif est 44% supérieur à la moyenne des LLM similaires, même s’il reste environ 1.8 fois moins cher que les modèles frontière. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).