Claude 2
Sorti le 11 juillet 2023, Claude 2 est un LLM propriétaire développé aux États-Unis par Anthropic. Âgé de près de trois ans, il appartient à une génération désormais très ancienne à l’échelle de l’IA. Ses performances actuelles le situent nettement derrière les modèles plus récents.
Sorti le 11 juillet 2023, Claude 2 est un LLM propriétaire développé aux États-Unis par Anthropic. Âgé de près de trois ans, il appartient à une génération désormais très ancienne à l’échelle de l’IA. Ses performances actuelles le situent nettement derrière les modèles plus récents.
Son entraînement reste marquant par son ampleur : 3,9 × 10²⁴ FLOP, soit environ 1,1 million d’heures-GPU H100 ou 500 GPU H100 mobilisés pendant trois mois. Son coût est estimé à 4,9 millions de dollars de 2023.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 11 juillet 2023 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: GPQA diamond | 34,7 % | 67ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 11,7 % | 51ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 2,5 % | 55ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: GPQA diamond
Epoch: MATH level 5
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 3,9 × 10²⁴ FLOP |
| Jeu de données | Unspecified unreleased |
| Coût d'entraînement estimé | ≈ 4 902 644 $ (USD 2023) |
| Pays | United States of America |
Notre analyse
Forces. GPQA constitue le principal point fort relatif de Claude 2. Le modèle obtient 35 % à cette évaluation de questions scientifiques de niveau doctorat. Ce résultat montre une capacité à résoudre une partie de problèmes scientifiques avancés, même s’il le place aujourd’hui dans le bas du classement. À sa sortie, Claude 2 se distinguait surtout par l’échelle de son entraînement, considérable pour un modèle de sa période.
Limites et points d’attention. Claude 2 est en retrait sur les trois benchmarks fournis. Il atteint 12 % sur MATH level 5 et figure près du bas du classement. Sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, son score de 2 % lui fait partager la 55e place avec trois autres modèles. Ce benchmark plafonné reste peu discriminant. Après près de trois ans, ses performances sont largement dépassées et le modèle n’est souvent plus proposé par Anthropic. L’effort initial demeure notable : environ 1,1 million d’heures-GPU H100 pour un coût estimé à 4,9 millions de dollars.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.