Claude 2.1
Claude 2.1 est un LLM propriétaire d’Anthropic, éditeur américain. Sorti le 21 novembre 2023, il approche déjà trois ans d’ancienneté, une durée très longue à l’échelle de l’IA. Ses performances doivent donc être replacées dans le contexte de sa génération.
Claude 2.1 est un LLM propriétaire d’Anthropic, éditeur américain. Sorti le 21 novembre 2023, il approche déjà trois ans d’ancienneté, une durée très longue à l’échelle de l’IA. Ses performances doivent donc être replacées dans le contexte de sa génération.
À son lancement, Claude 2.1 appartenait au top 43% des sept LLM sortis au cours des 18 mois précédents sur GPQA diamond. Il occupait ainsi une position honorable parmi les modèles de sa période, sans dominer ce groupe.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 21 novembre 2023 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: GPQA diamond | 33,0 % | 70ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 1,9 % | 59ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: GPQA diamond
Epoch: OTIS Mock AIME 2024-2025
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Claude 2.1 figurait dans la partie haute de sa génération sur GPQA diamond, un benchmark consacré aux questions scientifiques de niveau doctorat. Ce classement témoignait alors de capacités scientifiques compétitives face aux autres LLM contemporains.
Limites et points d’attention. Claude 2.1 apparaît désormais largement dépassé dans les classements disponibles. Sur GPQA diamond, il se situe en retrait, au 70e rang sur 85. Son résultat sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, est particulièrement faible : 2%, avec une 59e place sur 64 partagée avec un autre modèle. Ce benchmark étant plafonné, ce résultat départage mal les modèles concernés. Son ancienneté réduit aussi sa pertinence actuelle, les modèles de cette période étant souvent retirés du catalogue de leur éditeur.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.