Claude 3 Sonnet
Claude 3 Sonnet est un LLM propriétaire d’Anthropic, d’origine américaine, publié le 29 février 2024. À sa sortie, il se plaçait dans le haut du panier de sa génération pour le raisonnement scientifique.
Claude 3 Sonnet est un LLM propriétaire d’Anthropic, d’origine américaine, publié le 29 février 2024. À sa sortie, il se plaçait dans le haut du panier de sa génération pour le raisonnement scientifique.
Près de deux ans plus tard, son ancienneté est très importante à l’échelle de l’IA. Sa fenêtre de contexte de 200 000 tokens reste l’une de ses caractéristiques marquantes, mais ses connaissances s’arrêtent au 31 août 2023 et ses performances reflètent désormais une génération largement dépassée.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 29 février 2024 |
| Connaissances jusqu'à | 2023-08-31 |
| Multimodal | oui |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: GPQA diamond | 40,6 % | 59ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 18,2 % | 46ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 2,5 % | 55ᵉ / 64 | epoch | ✅ Mesuré |
| ARC-C | 93,2 % | 6ᵉ / 34 | llm-stats | Auto-déclaré |
| GSM8k | 92,3 % | 18ᵉ / 47 | llm-stats | Auto-déclaré |
| HellaSwag | 89,0 % | 5ᵉ / 27 | llm-stats | Auto-déclaré |
| MGSM | 83,5 % | 16ᵉ / 30 | llm-stats | Auto-déclaré |
| BIG-Bench Hard | 82,9 % | 7ᵉ / 20 | llm-stats | Auto-déclaré |
| MMLU | 79,0 % | 65ᵉ / 98 | llm-stats | Auto-déclaré |
| DROP | 78,9 % | 16ᵉ / 29 | llm-stats | Auto-déclaré |
| HumanEval | 73,0 % | 52ᵉ / 65 | llm-stats | Auto-déclaré |
| MMLU-Pro | 56,8 % | 102ᵉ / 125 | llm-stats | Auto-déclaré |
| MATH | 43,1 % | 62ᵉ / 70 | llm-stats | Auto-déclaré |
| GPQA | 40,4 % | 189ᵉ / 219 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: GPQA diamond
Epoch: MATH level 5
Classements Arena (Elo)
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 120ᵉ | amazon-nova-pro-v1.0 | 1019 |
| 121ᵉ | amazon-nova-lite-v1.0 | 1019 |
| 122ᵉ | Claude 3 Sonnet | 1016 |
| 123ᵉ | 01.AI: Yi Vision | 1002 |
| 124ᵉ | Claude 3 Haiku | 1000 |
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Claude 3 Sonnet figurait dans le top 20% des 15 LLM de sa génération sur GPQA diamond, qui mesure le raisonnement scientifique de niveau doctorat. Ce classement le situait parmi les modèles solides de sa période sur ce type de questions. Sa fenêtre de contexte de 200 000 tokens constitue également un atout concret pour traiter de longs contenus.
Limites et points d’attention. Dans les classements plus larges, Claude 3 Sonnet se situe désormais en retrait sur GPQA diamond et MATH level 5. Sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques, il partage la 55e place avec trois autres modèles. Son score y est trop faible et plafonné pour être discriminant. Dans l’Arena vision, il occupe le 122e rang sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. L’écart avec Claude Fable 5 est important, et le premier est nettement devant en préférence humaine. Après près de deux ans, ses performances sont largement dépassées et le modèle n’est souvent plus proposé par Anthropic. Son intérêt est surtout historique. Pour un résultat visuel plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.7 ou Claude Opus 4.6.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.