Claude 3 Opus

Claude 3 Opus est un LLM propriétaire d’Anthropic, lancé le 29 février 2024. Âgé d’environ deux ans, il est désormais très ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents, alors qu’il se classait à sa sortie dans le top 6% de sa génération sur GPQA diamond.

Claude 3 Opus est un LLM propriétaire d’Anthropic, lancé le 29 février 2024. Âgé d’environ deux ans, il est désormais très ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents, alors qu’il se classait à sa sortie dans le top 6% de sa génération sur GPQA diamond.

Le modèle se distingue par une fenêtre de contexte de 200 000 tokens et des connaissances arrêtées au 31 août 2023. Son positionnement premium reste particulièrement coûteux, avec une tarification supérieure de 653% à la moyenne des LLM similaires et environ 2,7 fois plus élevée que celle des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie29 février 2024
Connaissances jusqu'à2023-08-31
Multimodaloui
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index11.8124ᵉ / 137
Code Index19.566ᵉ / 74

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond47,2 %49ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 537,5 %36ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20254,7 %49ᵉ / 64epoch✅ Mesuré
ARC-C96,4 %3ᵉ / 34llm-statsAuto-déclaré
HellaSwag95,4 %1ᵉ / 27llm-statsAuto-déclaré
GSM8k95,0 %11ᵉ / 47llm-statsAuto-déclaré
MGSM90,7 %6ᵉ / 30llm-statsAuto-déclaré
BIG-Bench Hard86,8 %4ᵉ / 20llm-statsAuto-déclaré
MMLU86,8 %26ᵉ / 98llm-statsAuto-déclaré
HumanEval84,9 %35ᵉ / 65llm-statsAuto-déclaré
DROP83,1 %8ᵉ / 29llm-statsAuto-déclaré
MMLU-Pro68,5 %85ᵉ / 125llm-statsAuto-déclaré
MATH60,1 %46ᵉ / 70llm-statsAuto-déclaré
GPQA50,4 %162ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Claude 3 Opus11.8

Code Index

Nova 2.0 Pro Preview34.0
▶ Claude 3 Opus19.5

Classements Arena (Elo)

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
110ᵉgemini-1.5-flash-8b-0011071
111ᵉstep-1v-32k1064
112ᵉClaude 3 Opus1062
113ᵉgemini-1.5-flash-0011060
114ᵉmolmo-72b-09241045

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Claude 3 Opus figurait dans le haut du panier de sa génération en raisonnement scientifique avancé, selon GPQA diamond (questions scientifiques de niveau doctorat). Sa fenêtre de contexte de 200 000 tokens constituait également une caractéristique notable. Avec le recul, ses résultats en mathématiques générales restent plus solides que ceux obtenus sur les problèmes d’olympiades, tandis que son Code Index le place plutôt dans le bas du classement observé.

Limites et points d’attention. Les classements actuels situent Claude 3 Opus près du bas de tableau pour l’Intelligence Index, le Code Index, GPQA diamond et la vision. Son résultat sur OTIS Mock AIME 2024-2025 confirme une faiblesse marquée face aux problèmes de mathématiques de niveau olympiade. Son Arena vision est également très éloigné du modèle en tête. Son ancienneté et l’arrêt des connaissances en août 2023 réduisent encore sa pertinence actuelle. À cet âge, les modèles sont souvent retirés du catalogue de leur éditeur. Enfin, son prix premium paraît difficile à justifier aujourd’hui au regard de performances largement dépassées et d’un coût très supérieur aux offres comparables.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.