Claude 3.5 Sonnet

Claude 3.5 Sonnet est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 22 octobre 2024. Près de deux ans représentent une très longue période dans l’IA : ce modèle appartient désormais à une génération ancienne, largement dépassée par les systèmes haut de gamme plus récents.

Claude 3.5 Sonnet est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 22 octobre 2024. Près de deux ans représentent une très longue période dans l’IA : ce modèle appartient désormais à une génération ancienne, largement dépassée par les systèmes haut de gamme plus récents.

Sa fenêtre de contexte atteint 200 000 tokens. Son entraînement aurait mobilisé 2,7 × 10²⁵ FLOP, soit environ 7,5 millions d’heures-GPU H100 ou 3 500 GPU H100 pendant trois mois. Son coût estimé s’élève à 25,9 millions de dollars de 2023, un investissement qui reste marquant pour un modèle de cette période.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie22 octobre 2024
Connaissances jusqu'à2024-04-30
Multimodaloui
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index9.9127ᵉ / 137
Code Index30.259ᵉ / 74

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: MATH level 556,9 %22ᵉ / 59epoch✅ Mesuré
Epoch: GPQA diamond55,3 %40ᵉ / 85epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20258,5 %40ᵉ / 64epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private2,1 %26ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Public0,0 %1ᵉ / 15epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private0,0 %20ᵉ / 25epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré
GSM8k96,4 %6ᵉ / 47llm-statsAuto-déclaré
DocVQA95,2 %3ᵉ / 26llm-statsAuto-déclaré
AI2D94,7 %1ᵉ / 32llm-statsAuto-déclaré
HumanEval93,7 %3ᵉ / 65llm-statsAuto-déclaré
BIG-Bench Hard93,1 %1ᵉ / 20llm-statsAuto-déclaré
MGSM91,6 %3ᵉ / 30llm-statsAuto-déclaré
ChartQA90,8 %1ᵉ / 24llm-statsAuto-déclaré
MMLU90,4 %7ᵉ / 98llm-statsAuto-déclaré
DROP87,1 %2ᵉ / 29llm-statsAuto-déclaré
MATH78,3 %21ᵉ / 70llm-statsAuto-déclaré
MMLU-Pro77,6 %60ᵉ / 125llm-statsAuto-déclaré
TAU-bench Retail69,2 %12ᵉ / 24llm-statsAuto-déclaré
MMMU68,3 %33ᵉ / 61llm-statsAuto-déclaré
MathVista67,7 %20ᵉ / 38llm-statsAuto-déclaré
GPQA67,2 %126ᵉ / 219llm-statsAuto-déclaré
SWE-Bench Verified49,0 %87ᵉ / 102llm-statsAuto-déclaré
TAU-bench Airline46,0 %15ᵉ / 22llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Claude 3.5 Sonnet9.9

Code Index

Nova 2.0 Pro Preview34.0
▶ Claude 3.5 Sonnet30.2

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text1373160ᵉ / 200Claude Fable 5 (1507)
Arena Text1342195ᵉ / 200Claude Fable 5 (1507)
Arena Vision116080ᵉ / 135Claude Fable 5 (1318)
Arena Vision114591ᵉ / 135Claude Fable 5 (1318)

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement2,7 × 10²⁵ FLOP
Jeu de donnéesUnspecified unreleased
Coût d'entraînement estimé≈ 25 870 993 $ (USD 2023)
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Claude 3.5 Sonnet figurait dans le top 3% des LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. MATH level 5 constitue aujourd’hui son résultat le plus solide, dans la première moitié du classement. La fenêtre de 200 000 tokens reste également une caractéristique notable.

Limites et points d’attention. Le modèle est désormais en retrait : l’Intelligence Index le place près du bas du classement et le Code Index dans son dernier quart. Ses résultats chutent sur les épreuves mathématiques les plus exigeantes, avec 8% à OTIS Mock AIME et 2% à FrontierMath Private. Les scores de 0% sur FrontierMath Tier 4 sont plafonnés et non discriminants. Dans les classements Arena text et vision, il reste derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant dans les duels attendus. Malgré un entraînement estimé à 7,5 millions d’heures-GPU H100 et 25,9 millions de dollars, Claude 3.5 Sonnet est aujourd’hui largement dépassé et souvent retiré du catalogue de l’éditeur. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.