Claude 3.7 Sonnet

Claude 3.7 Sonnet est un LLM propriétaire lancé par Anthropic le 24 février 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles haut de gamme plus récents.

Claude 3.7 Sonnet est un LLM propriétaire lancé par Anthropic le 24 février 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles haut de gamme plus récents.

Ce modèle américain accepte jusqu’à 200 000 tokens de contexte et ses connaissances s’arrêtent au 31 octobre 2024. Son entraînement reste marquant par son ampleur estimée à 3,4 × 10²⁵ FLOP, soit environ 9,3 millions d’heures-GPU H100, l’équivalent de 4 300 GPU H100 mobilisés pendant trois mois.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie24 février 2025
Connaissances jusqu'à2024-10-31
Multimodaloui
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index23.587ᵉ / 137
Math Index21.044ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: MATH level 591,2 %10ᵉ / 59epoch✅ Mesuré
Epoch: GPQA diamond79,7 %23ᵉ / 85epoch✅ Mesuré
Epoch: SWE-Bench verified61,0 %13ᵉ / 15epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202557,8 %29ᵉ / 64epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private4,1 %24ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Public0,0 %1ᵉ / 15epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré
MATH-50096,2 %13ᵉ / 31llm-statsAuto-déclaré
IFEval93,2 %7ᵉ / 65llm-statsAuto-déclaré
MMMLU86,1 %25ᵉ / 49llm-statsAuto-déclaré
GPQA84,8 %49ᵉ / 219llm-statsAuto-déclaré
TAU-bench Retail81,2 %4ᵉ / 24llm-statsAuto-déclaré
AIME 202480,0 %27ᵉ / 52llm-statsAuto-déclaré
MMMU75,0 %20ᵉ / 61llm-statsAuto-déclaré
SWE-Bench Verified70,3 %56ᵉ / 102llm-statsAuto-déclaré
TAU-bench Airline58,4 %8ᵉ / 22llm-statsAuto-déclaré
AIME 202554,8 %93ᵉ / 108llm-statsAuto-déclaré
Terminal-Bench35,2 %14ᵉ / 25llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Claude 3.7 Sonnet23.5
Nova 2.0 Pro Preview21.8

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ Claude 3.7 Sonnet21.0

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text1387146ᵉ / 200Claude Fable 5 (1507)
Arena Text1371161ᵉ / 200Claude Fable 5 (1507)
Arena Vision119565ᵉ / 135Claude Fable 5 (1318)
Arena Vision117575ᵉ / 135Claude Fable 5 (1318)

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement3,4 × 10²⁵ FLOP
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Claude 3.7 Sonnet figurait dans le top 4% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Il conserve un résultat solide sur ce benchmark et se classe dans le top 10 sur MATH level 5. Sa fenêtre de 200 000 tokens constitue aussi un atout pour traiter de longs contenus.

Limites et points d’attention. Son Intelligence Index le place aujourd’hui en retrait, tandis que son Math Index figure près du bas du classement. Sur SWE-Bench verified, consacré à la résolution de vrais bugs GitHub, il termine 13e sur 15. Ses résultats sur FrontierMath restent très faibles, et les scores plafonnés de certains tests ne permettent pas de le départager utilement. Dans les Arena textuelles, il occupe les 146e et 161e places sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. En vision, il se classe 65e sur 135, derrière ces mêmes modèles, avec un écart également important face à Claude Fable 5. Ses performances sont désormais largement dépassées, et les modèles de cet âge sont souvent retirés du catalogue de leur éditeur. Pour un résultat plus abouti, Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7 sont préférables.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.