Claude 2

Sorti le 11 juillet 2023, Claude 2 est un LLM propriétaire développé aux États-Unis par Anthropic. Âgé de près de trois ans, il appartient à une génération désormais très ancienne à l’échelle de l’IA. Ses performances actuelles le situent nettement derrière les modèles plus récents.

Sorti le 11 juillet 2023, Claude 2 est un LLM propriétaire développé aux États-Unis par Anthropic. Âgé de près de trois ans, il appartient à une génération désormais très ancienne à l’échelle de l’IA. Ses performances actuelles le situent nettement derrière les modèles plus récents.

Son entraînement reste marquant par son ampleur : 3,9 × 10²⁴ FLOP, soit environ 1,1 million d’heures-GPU H100 ou 500 GPU H100 mobilisés pendant trois mois. Son coût est estimé à 4,9 millions de dollars de 2023.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie11 juillet 2023

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond34,7 %67ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 511,7 %51ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20252,5 %55ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

Hermes 2 Theta Llama-3 …37 %
▶ Claude 235 %
Eurus-2-7B-PRIME34 %

Epoch: MATH level 5

GPT-598 %
Hermes 2 Theta Llama-3 …23 %
▶ Claude 212 %
DBRX12 %

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement3,9 × 10²⁴ FLOP
Jeu de donnéesUnspecified unreleased
Coût d'entraînement estimé≈ 4 902 644 $ (USD 2023)
PaysUnited States of America

Notre analyse

Forces. GPQA constitue le principal point fort relatif de Claude 2. Le modèle obtient 35 % à cette évaluation de questions scientifiques de niveau doctorat. Ce résultat montre une capacité à résoudre une partie de problèmes scientifiques avancés, même s’il le place aujourd’hui dans le bas du classement. À sa sortie, Claude 2 se distinguait surtout par l’échelle de son entraînement, considérable pour un modèle de sa période.

Limites et points d’attention. Claude 2 est en retrait sur les trois benchmarks fournis. Il atteint 12 % sur MATH level 5 et figure près du bas du classement. Sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, son score de 2 % lui fait partager la 55e place avec trois autres modèles. Ce benchmark plafonné reste peu discriminant. Après près de trois ans, ses performances sont largement dépassées et le modèle n’est souvent plus proposé par Anthropic. L’effort initial demeure notable : environ 1,1 million d’heures-GPU H100 pour un coût estimé à 4,9 millions de dollars.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.