Claude 3 Sonnet

Claude 3 Sonnet est un LLM propriétaire d’Anthropic, d’origine américaine, publié le 29 février 2024. À sa sortie, il se plaçait dans le haut du panier de sa génération pour le raisonnement scientifique.

Claude 3 Sonnet est un LLM propriétaire d’Anthropic, d’origine américaine, publié le 29 février 2024. À sa sortie, il se plaçait dans le haut du panier de sa génération pour le raisonnement scientifique.

Près de deux ans plus tard, son ancienneté est très importante à l’échelle de l’IA. Sa fenêtre de contexte de 200 000 tokens reste l’une de ses caractéristiques marquantes, mais ses connaissances s’arrêtent au 31 août 2023 et ses performances reflètent désormais une génération largement dépassée.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie29 février 2024
Connaissances jusqu'à2023-08-31
Multimodaloui
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond40,6 %59ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 518,2 %46ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20252,5 %55ᵉ / 64epoch✅ Mesuré
ARC-C93,2 %6ᵉ / 34llm-statsAuto-déclaré
GSM8k92,3 %18ᵉ / 47llm-statsAuto-déclaré
HellaSwag89,0 %5ᵉ / 27llm-statsAuto-déclaré
MGSM83,5 %16ᵉ / 30llm-statsAuto-déclaré
BIG-Bench Hard82,9 %7ᵉ / 20llm-statsAuto-déclaré
MMLU79,0 %65ᵉ / 98llm-statsAuto-déclaré
DROP78,9 %16ᵉ / 29llm-statsAuto-déclaré
HumanEval73,0 %52ᵉ / 65llm-statsAuto-déclaré
MMLU-Pro56,8 %102ᵉ / 125llm-statsAuto-déclaré
MATH43,1 %62ᵉ / 70llm-statsAuto-déclaré
GPQA40,4 %189ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

▶ Claude 3 Sonnet41 %
Hermes 2 Theta Llama-3 …37 %

Epoch: MATH level 5

GPT-598 %
Hermes 2 Theta Llama-3 …23 %
▶ Claude 3 Sonnet18 %
DBRX12 %

Classements Arena (Elo)

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
120ᵉamazon-nova-pro-v1.01019
121ᵉamazon-nova-lite-v1.01019
122ᵉClaude 3 Sonnet1016
123ᵉ01.AI: Yi Vision1002
124ᵉClaude 3 Haiku1000

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Claude 3 Sonnet figurait dans le top 20% des 15 LLM de sa génération sur GPQA diamond, qui mesure le raisonnement scientifique de niveau doctorat. Ce classement le situait parmi les modèles solides de sa période sur ce type de questions. Sa fenêtre de contexte de 200 000 tokens constitue également un atout concret pour traiter de longs contenus.

Limites et points d’attention. Dans les classements plus larges, Claude 3 Sonnet se situe désormais en retrait sur GPQA diamond et MATH level 5. Sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques, il partage la 55e place avec trois autres modèles. Son score y est trop faible et plafonné pour être discriminant. Dans l’Arena vision, il occupe le 122e rang sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. L’écart avec Claude Fable 5 est important, et le premier est nettement devant en préférence humaine. Après près de deux ans, ses performances sont largement dépassées et le modèle n’est souvent plus proposé par Anthropic. Son intérêt est surtout historique. Pour un résultat visuel plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.7 ou Claude Opus 4.6.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.