Claude Sonnet 4
Claude Sonnet 4 est un LLM propriétaire d’Anthropic, sorti le 22 mai 2025. Avec près d’un an d’ancienneté, il appartient déjà à une génération très ancienne à l’échelle de l’IA. Ses performances sont aujourd’hui probablement dépassées et ce type de modèle est souvent retiré du catalogue…
Claude Sonnet 4 est un LLM propriétaire d’Anthropic, sorti le 22 mai 2025. Avec près d’un an d’ancienneté, il appartient déjà à une génération très ancienne à l’échelle de l’IA. Ses performances sont aujourd’hui probablement dépassées et ce type de modèle est souvent retiré du catalogue de l’éditeur.
À sa sortie, il figurait pourtant dans le haut du panier de sa génération sur GPQA diamond. Il se caractérise aussi par une fenêtre de contexte de 200 000 tokens et des connaissances arrêtées au 31 janvier 2025. Son prix se situe dans la moyenne du marché.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 22 mai 2025 |
| Connaissances jusqu'à | 2025-01-31 |
| Multimodal | oui |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 28.9 | 67ᵉ / 137 |
| Code Index | 37.6 | 51ᵉ / 74 |
| Agentic Index | 16.6 | 44ᵉ / 68 |
| Math Index | 74.3 | 20ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,8 % | 43ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 93,0 % | 42ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 93,0 % | 44ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 88,0 % | 56ᵉ / 155 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 84,4 % | 13ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 79,2 % | 24ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 71,1 % | 25ᵉ / 64 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 66,0 % | 66ᵉ / 163 | benchable | ✅ Mesuré |
| PinchBench : agentique (OpenClaw, 147 tâches) | 48,8 % | 18ᵉ / 19 | pinchbench | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 4,1 % | 24ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 0,0 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 0,0 % | 20ᵉ / 25 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
| MMMLU | 86,5 % | 23ᵉ / 49 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 80,5 % | 5ᵉ / 24 | llm-stats | Auto-déclaré |
| GPQA | 75,4 % | 94ᵉ / 219 | llm-stats | Auto-déclaré |
| MMMU | 74,4 % | 22ᵉ / 61 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 72,7 % | 48ᵉ / 102 | llm-stats | Auto-déclaré |
| AIME 2025 | 70,5 % | 82ᵉ / 108 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 60,0 % | 4ᵉ / 22 | llm-stats | Auto-déclaré |
| Terminal-Bench | 35,5 % | 13ᵉ / 25 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1399 | 128ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Text | 1389 | 142ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Vision | 1207 | 57ᵉ / 135 | Claude Fable 5 (1318) |
| Arena Vision | 1188 | 68ᵉ / 135 | Claude Fable 5 (1318) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Google Vertex (Global) | 3 $ | 15 $ | 0,3 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 44 % au-dessus de la moyenne des LLM similaires, et 1,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 24,23 $ |
| Durée d'exécution — PinchBench | 5 h 43 min |
| Indice valeur/coût — PinchBench | 2,73 |
| Coût moyen par benchmark — Benchable | 0,3 $ |
| Latence moyenne par benchmark — Benchable | 7 min 25 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Claude Sonnet 4 se classait dans le top 9% des 56 LLM de sa génération sur GPQA diamond. Les mathématiques constituent son principal point fort actuel, avec une place dans le top 20 du Math Index. Sa fenêtre de 200 000 tokens offre aussi une capacité de contexte étendue. Les scores de 100% en Hallucinations et Ethics sont toutefois partagés avec respectivement 45 et 71 autres modèles sur des benchmarks plafonnés, donc peu discriminants.
Limites et points d’attention. Claude Sonnet 4 apparaît désormais en retrait dans l’Intelligence Index, le Code Index et l’Agentic Index. Selon les deux évaluations Arena text, il occupe les rangs 128 et 142 sur 200. En Arena vision, il se classe 57e sur 135. Il reste derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Dans chaque cas, le premier est nettement devant. Son tarif est 44% supérieur à la moyenne des LLM similaires, même s’il reste environ 1.8 fois moins cher que les modèles frontière. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).