Claude 3.5 Haiku

Claude 3.5 Haiku est un LLM propriétaire d’Anthropic, sorti le 4 novembre 2024. Près de deux ans représentent une ancienneté très importante dans l’IA générative : le modèle appartient désormais à une génération largement dépassée par les systèmes récents.

Claude 3.5 Haiku est un LLM propriétaire d’Anthropic, sorti le 4 novembre 2024. Près de deux ans représentent une ancienneté très importante dans l’IA générative : le modèle appartient désormais à une génération largement dépassée par les systèmes récents.

Sa fenêtre de contexte de 200 000 tokens reste notable, avec des connaissances arrêtées au 31 juillet 2024. À sa sortie, Claude 3.5 Haiku se situait dans la première moitié des LLM de sa génération sur les questions scientifiques de niveau doctorat.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie4 novembre 2024
Connaissances jusqu'à2024-07-31
Multimodalnon
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index12.3122ᵉ / 137
Code Index15.969ᵉ / 74
Agentic Index1.960ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: MATH level 546,4 %29ᵉ / 59epoch✅ Mesuré
Epoch: GPQA diamond38,1 %62ᵉ / 85epoch✅ Mesuré
Epoch: SimpleQA Verified6,7 %25ᵉ / 26epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20254,3 %51ᵉ / 64epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private0,3 %31ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré
HumanEval88,1 %24ᵉ / 65llm-statsAuto-déclaré
MGSM85,6 %14ᵉ / 30llm-statsAuto-déclaré
DROP83,1 %8ᵉ / 29llm-statsAuto-déclaré
MATH69,4 %40ᵉ / 70llm-statsAuto-déclaré
MMLU-Pro65,0 %96ᵉ / 125llm-statsAuto-déclaré
TAU-bench Retail51,0 %23ᵉ / 24llm-statsAuto-déclaré
GPQA41,6 %187ᵉ / 219llm-statsAuto-déclaré
SWE-Bench Verified40,6 %93ᵉ / 102llm-statsAuto-déclaré
TAU-bench Airline22,8 %21ᵉ / 22llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Claude 3.5 Haiku12.3

Code Index

▶ Claude 3.5 Haiku15.9

Classements Arena (Elo)

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
95ᵉLlama 4 Scout1128
96ᵉMistral Small 3.1 24B Instruct1127
97ᵉClaude 3.5 Haiku1127
98ᵉstep-1o-vision-32k-highres1125
99ᵉQwen2.5 VL 72B Instruct1121

Notre analyse

Forces. À son époque, Claude 3.5 Haiku obtenait des résultats honorables sur GPQA diamond et se plaçait dans la première moitié du classement de sa génération. MATH level 5 constitue son autre résultat solide, également dans la première moitié des modèles évalués. Sa fenêtre de contexte de 200 000 tokens autorise le traitement de volumes de texte importants.

Limites et points d’attention. Les classements actuels placent Claude 3.5 Haiku très en retrait sur l’Intelligence Index, le Code Index et l’Agentic Index. SimpleQA Verified révèle une faiblesse marquée sur les questions factuelles vérifiables, avec 7% et l’avant-dernière place. Les scores nuls sur les deux versions de FrontierMath confirment ses limites en mathématiques de recherche. Dans Arena vision, il occupe la 97e place sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Claude Fable 5 est nettement devant. Ses performances sont aujourd’hui largement dépassées, et cette génération est souvent retirée des catalogues. Son intérêt est surtout historique. Pour un résultat plus abouti, Claude Fable 5, Claude Opus 4.7 ou Claude Opus 4.6 sont mieux classés.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.