Claude 3.7 Sonnet
Claude 3.7 Sonnet est un LLM propriétaire lancé par Anthropic le 24 février 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles haut de gamme plus récents.
Claude 3.7 Sonnet est un LLM propriétaire lancé par Anthropic le 24 février 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles haut de gamme plus récents.
Ce modèle américain accepte jusqu’à 200 000 tokens de contexte et ses connaissances s’arrêtent au 31 octobre 2024. Son entraînement reste marquant par son ampleur estimée à 3,4 × 10²⁵ FLOP, soit environ 9,3 millions d’heures-GPU H100, l’équivalent de 4 300 GPU H100 mobilisés pendant trois mois.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 24 février 2025 |
| Connaissances jusqu'à | 2024-10-31 |
| Multimodal | oui |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 23.5 | 87ᵉ / 137 |
| Math Index | 21.0 | 44ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: MATH level 5 | 91,2 % | 10ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 79,7 % | 23ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: SWE-Bench verified | 61,0 % | 13ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 57,8 % | 29ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 4,1 % | 24ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 0,0 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
| MATH-500 | 96,2 % | 13ᵉ / 31 | llm-stats | Auto-déclaré |
| IFEval | 93,2 % | 7ᵉ / 65 | llm-stats | Auto-déclaré |
| MMMLU | 86,1 % | 25ᵉ / 49 | llm-stats | Auto-déclaré |
| GPQA | 84,8 % | 49ᵉ / 219 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 81,2 % | 4ᵉ / 24 | llm-stats | Auto-déclaré |
| AIME 2024 | 80,0 % | 27ᵉ / 52 | llm-stats | Auto-déclaré |
| MMMU | 75,0 % | 20ᵉ / 61 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 70,3 % | 56ᵉ / 102 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 58,4 % | 8ᵉ / 22 | llm-stats | Auto-déclaré |
| AIME 2025 | 54,8 % | 93ᵉ / 108 | llm-stats | Auto-déclaré |
| Terminal-Bench | 35,2 % | 14ᵉ / 25 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1387 | 146ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Text | 1371 | 161ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Vision | 1195 | 65ᵉ / 135 | Claude Fable 5 (1318) |
| Arena Vision | 1175 | 75ᵉ / 135 | Claude Fable 5 (1318) |
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 3,4 × 10²⁵ FLOP |
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Claude 3.7 Sonnet figurait dans le top 4% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Il conserve un résultat solide sur ce benchmark et se classe dans le top 10 sur MATH level 5. Sa fenêtre de 200 000 tokens constitue aussi un atout pour traiter de longs contenus.
Limites et points d’attention. Son Intelligence Index le place aujourd’hui en retrait, tandis que son Math Index figure près du bas du classement. Sur SWE-Bench verified, consacré à la résolution de vrais bugs GitHub, il termine 13e sur 15. Ses résultats sur FrontierMath restent très faibles, et les scores plafonnés de certains tests ne permettent pas de le départager utilement. Dans les Arena textuelles, il occupe les 146e et 161e places sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. En vision, il se classe 65e sur 135, derrière ces mêmes modèles, avec un écart également important face à Claude Fable 5. Ses performances sont désormais largement dépassées, et les modèles de cet âge sont souvent retirés du catalogue de leur éditeur. Pour un résultat plus abouti, Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7 sont préférables.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.