Claude 2.1

Claude 2.1 est un LLM propriétaire d’Anthropic, éditeur américain. Sorti le 21 novembre 2023, il approche déjà trois ans d’ancienneté, une durée très longue à l’échelle de l’IA. Ses performances doivent donc être replacées dans le contexte de sa génération.

Claude 2.1 est un LLM propriétaire d’Anthropic, éditeur américain. Sorti le 21 novembre 2023, il approche déjà trois ans d’ancienneté, une durée très longue à l’échelle de l’IA. Ses performances doivent donc être replacées dans le contexte de sa génération.

À son lancement, Claude 2.1 appartenait au top 43% des sept LLM sortis au cours des 18 mois précédents sur GPQA diamond. Il occupait ainsi une position honorable parmi les modèles de sa période, sans dominer ce groupe.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie21 novembre 2023

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond33,0 %70ᵉ / 85epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20251,9 %59ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

Eurus-2-7B-PRIME34 %
▶ Claude 2.133 %
DBRX33 %

Epoch: OTIS Mock AIME 2024-2025

Hermes 2 Theta Llama-3 …2 %
▶ Claude 2.12 %

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Claude 2.1 figurait dans la partie haute de sa génération sur GPQA diamond, un benchmark consacré aux questions scientifiques de niveau doctorat. Ce classement témoignait alors de capacités scientifiques compétitives face aux autres LLM contemporains.

Limites et points d’attention. Claude 2.1 apparaît désormais largement dépassé dans les classements disponibles. Sur GPQA diamond, il se situe en retrait, au 70e rang sur 85. Son résultat sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, est particulièrement faible : 2%, avec une 59e place sur 64 partagée avec un autre modèle. Ce benchmark étant plafonné, ce résultat départage mal les modèles concernés. Son ancienneté réduit aussi sa pertinence actuelle, les modèles de cette période étant souvent retirés du catalogue de leur éditeur.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.