Claude Sonnet 4.5
Claude Sonnet 4.5 est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 29 septembre 2025. Son positionnement intermédiaire associe de solides résultats en mathématiques et en code à des performances générales plus proches du milieu de tableau.
Claude Sonnet 4.5 est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 29 septembre 2025. Son positionnement intermédiaire associe de solides résultats en mathématiques et en code à des performances générales plus proches du milieu de tableau.
Sa fenêtre de contexte de 200 000 tokens constitue l’un de ses principaux atouts pour traiter de grandes quantités de texte. Ses connaissances s’arrêtent au 31 janvier 2025. Son tarif se situe dans la moyenne, tout en restant sensiblement inférieur à celui des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 29 septembre 2025 |
| Connaissances jusqu'à | 2025-01-31 |
| Multimodal | oui |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text,image,audio,video → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 29.3 | 65ᵉ / 137 |
| Code Index | 52.1 | 30ᵉ / 74 |
| Agentic Index | 24.6 | 31ᵉ / 68 |
| Math Index | 37.0 | 40ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 97,7 % | 4ᵉ / 59 | epoch | ✅ Mesuré |
| Benchable : Coding (Baseline) | 95,0 % | 17ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 94,0 % | 30ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 88,0 % | 56ᵉ / 155 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 82,3 % | 21ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 77,8 % | 21ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: SWE-Bench verified | 71,3 % | 8ᵉ / 15 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 67,7 % | 63ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 23,9 % | 15ᵉ / 17 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 23,6 % | 20ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 15,2 % | 13ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 12,0 % | 18ᵉ / 20 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 4,2 % | 10ᵉ / 25 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 2,4 % | 15ᵉ / 18 | epoch | ✅ Mesuré |
| Epoch: EBR-bench | 2,4 % | 7ᵉ / 7 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 0,0 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
| MMMLU | 89,1 % | 13ᵉ / 49 | llm-stats | Auto-déclaré |
| AIME 2025 | 87,0 % | 51ᵉ / 108 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 86,2 % | 1ᵉ / 24 | llm-stats | Auto-déclaré |
| GPQA | 83,4 % | 58ᵉ / 219 | llm-stats | Auto-déclaré |
| MMMUval | 77,8 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 70,0 % | 1ᵉ / 22 | llm-stats | Auto-déclaré |
| OSWorld | 61,4 % | 8ᵉ / 20 | llm-stats | Auto-déclaré |
| Terminal-Bench | 50,0 % | 1ᵉ / 25 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1456 | 46ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Text | 1455 | 48ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Document | 1446 | 16ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Code | 1388 | 54ᵉ / 99 | Kimi K3 (1679) |
| Arena Code | 1386 | 56ᵉ / 99 | Kimi K3 (1679) |
| Arena Search | 1159 | 22ᵉ / 32 | Claude Opus 4.6 (1255) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Amazon Bedrock | 3 $ | 15 $ | 0,3 $ |
| anthropic | 3 $ | 15 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 44 % au-dessus de la moyenne des LLM similaires, et 1,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,27 $ |
| Latence moyenne par benchmark — Benchable | 8 min 22 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Claude Sonnet 4.5 figurait dans le top 7% des LLM de sa génération sur GPQA diamond. Il atteint aussi le top 10 sur MATH level 5 d’Epoch avec 98%, tandis que son Code Index le place dans la première moitié du classement. Sa fenêtre de 200 000 tokens convient aux requêtes longues. Les scores Benchable plafonnés, notamment en connaissances générales, éthique et hallucinations, sont partagés avec de nombreux modèles et restent peu discriminants.
Limites et points d’attention. L’Intelligence Index et l’Agentic Index le situent au milieu du classement, tandis que le Math Index est en retrait malgré son excellent résultat sur MATH level 5. Dans Arena text, ses scores Elo de 1455 à 1456 le placent derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec le premier reste limité, les deux modèles sont proches en duel. Dans Arena document, il occupe le milieu du tableau derrière Claude Opus 4.6 et Claude Fable 5. Son prix est 44% supérieur à la moyenne des LLM similaires, mais environ 1.8 fois inférieur à celui des modèles frontière. Il reste pertinent pour le code, les mathématiques avancées et les longs contextes. Pour un résultat plus abouti, Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7 sont mieux classés.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).