Claude 3.5 Sonnet
Claude 3.5 Sonnet est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 22 octobre 2024. Près de deux ans représentent une très longue période dans l’IA : ce modèle appartient désormais à une génération ancienne, largement dépassée par les systèmes haut de gamme plus récents.
Claude 3.5 Sonnet est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 22 octobre 2024. Près de deux ans représentent une très longue période dans l’IA : ce modèle appartient désormais à une génération ancienne, largement dépassée par les systèmes haut de gamme plus récents.
Sa fenêtre de contexte atteint 200 000 tokens. Son entraînement aurait mobilisé 2,7 × 10²⁵ FLOP, soit environ 7,5 millions d’heures-GPU H100 ou 3 500 GPU H100 pendant trois mois. Son coût estimé s’élève à 25,9 millions de dollars de 2023, un investissement qui reste marquant pour un modèle de cette période.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 22 octobre 2024 |
| Connaissances jusqu'à | 2024-04-30 |
| Multimodal | oui |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 9.9 | 127ᵉ / 137 |
| Code Index | 30.2 | 59ᵉ / 74 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: MATH level 5 | 56,9 % | 22ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 55,3 % | 40ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 8,5 % | 40ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 2,1 % | 26ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 0,0 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 0,0 % | 20ᵉ / 25 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
| GSM8k | 96,4 % | 6ᵉ / 47 | llm-stats | Auto-déclaré |
| DocVQA | 95,2 % | 3ᵉ / 26 | llm-stats | Auto-déclaré |
| AI2D | 94,7 % | 1ᵉ / 32 | llm-stats | Auto-déclaré |
| HumanEval | 93,7 % | 3ᵉ / 65 | llm-stats | Auto-déclaré |
| BIG-Bench Hard | 93,1 % | 1ᵉ / 20 | llm-stats | Auto-déclaré |
| MGSM | 91,6 % | 3ᵉ / 30 | llm-stats | Auto-déclaré |
| ChartQA | 90,8 % | 1ᵉ / 24 | llm-stats | Auto-déclaré |
| MMLU | 90,4 % | 7ᵉ / 98 | llm-stats | Auto-déclaré |
| DROP | 87,1 % | 2ᵉ / 29 | llm-stats | Auto-déclaré |
| MATH | 78,3 % | 21ᵉ / 70 | llm-stats | Auto-déclaré |
| MMLU-Pro | 77,6 % | 60ᵉ / 125 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 69,2 % | 12ᵉ / 24 | llm-stats | Auto-déclaré |
| MMMU | 68,3 % | 33ᵉ / 61 | llm-stats | Auto-déclaré |
| MathVista | 67,7 % | 20ᵉ / 38 | llm-stats | Auto-déclaré |
| GPQA | 67,2 % | 126ᵉ / 219 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 49,0 % | 87ᵉ / 102 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 46,0 % | 15ᵉ / 22 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1373 | 160ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Text | 1342 | 195ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Vision | 1160 | 80ᵉ / 135 | Claude Fable 5 (1318) |
| Arena Vision | 1145 | 91ᵉ / 135 | Claude Fable 5 (1318) |
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 2,7 × 10²⁵ FLOP |
| Jeu de données | Unspecified unreleased |
| Coût d'entraînement estimé | ≈ 25 870 993 $ (USD 2023) |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Claude 3.5 Sonnet figurait dans le top 3% des LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. MATH level 5 constitue aujourd’hui son résultat le plus solide, dans la première moitié du classement. La fenêtre de 200 000 tokens reste également une caractéristique notable.
Limites et points d’attention. Le modèle est désormais en retrait : l’Intelligence Index le place près du bas du classement et le Code Index dans son dernier quart. Ses résultats chutent sur les épreuves mathématiques les plus exigeantes, avec 8% à OTIS Mock AIME et 2% à FrontierMath Private. Les scores de 0% sur FrontierMath Tier 4 sont plafonnés et non discriminants. Dans les classements Arena text et vision, il reste derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant dans les duels attendus. Malgré un entraînement estimé à 7,5 millions d’heures-GPU H100 et 25,9 millions de dollars, Claude 3.5 Sonnet est aujourd’hui largement dépassé et souvent retiré du catalogue de l’éditeur. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.