Claude 3 Haiku

Claude 3 Haiku est un LLM propriétaire d’Anthropic, lancé le 13 mars 2024. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA et probablement dépassée. Sa fenêtre de contexte atteint 200 000 tokens, mais ses connaissances s’arrêtent au 31…

Claude 3 Haiku est un LLM propriétaire d’Anthropic, lancé le 13 mars 2024. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA et probablement dépassée. Sa fenêtre de contexte atteint 200 000 tokens, mais ses connaissances s’arrêtent au 31 août 2023.

Son principal trait distinctif reste son positionnement très économique. Sa tarification se situe 88% sous la moyenne des LLM similaires et environ 22 fois sous celle des modèles frontière, avec un écart marqué entre le prix des tokens d’entrée et de sortie.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie13 mars 2024
Connaissances jusqu'à2023-08-31
Multimodaloui
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)98,0 %105ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : General Knowledge (Baseline)96,5 %106ᵉ / 161benchable✅ Mesuré
Benchable : Hallucinations (Baseline)86,0 %102ᵉ / 146benchable✅ Mesuré
Benchable : Coding (Baseline)72,0 %130ᵉ / 162benchable✅ Mesuré
Benchable : Instruction Following (Baseline)61,0 %83ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)58,0 %120ᵉ / 140benchable✅ Mesuré
Epoch: GPQA diamond36,3 %65ᵉ / 85epoch✅ Mesuré
Benchable : Reasoning (Baseline)36,0 %133ᵉ / 155benchable✅ Mesuré
Epoch: MATH level 514,9 %49ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20251,8 %61ᵉ / 64epoch✅ Mesuré
ARC-C89,2 %12ᵉ / 34llm-statsAuto-déclaré
GSM8k88,9 %28ᵉ / 47llm-statsAuto-déclaré
HellaSwag85,9 %11ᵉ / 27llm-statsAuto-déclaré
DROP78,4 %17ᵉ / 29llm-statsAuto-déclaré
HumanEval75,9 %47ᵉ / 65llm-statsAuto-déclaré
MMLU75,2 %73ᵉ / 98llm-statsAuto-déclaré
MGSM75,1 %19ᵉ / 30llm-statsAuto-déclaré
BIG-Bench Hard73,7 %9ᵉ / 20llm-statsAuto-déclaré
MATH38,9 %66ᵉ / 70llm-statsAuto-déclaré
GPQA33,3 %202ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

▶ Claude 3 Haiku98 %

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
skyfall-36b-v298 %
▶ Claude 3 Haiku98 %

Classements Arena (Elo)

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
122ᵉClaude 3 Sonnet1016
123ᵉ01.AI: Yi Vision1002
124ᵉClaude 3 Haiku1000
125ᵉc4ai-aya-vision-32b1000
126ᵉmolmo-7b-d-0924994

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Amazon Bedrock0,25 $1,25 $0,03 $

Prix en dollars US par million de tokens.

Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 22 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable2 min 21 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, Claude 3 Haiku figurait dans le top 35% des 17 LLM de sa génération sur GPQA diamond. Il obtient aussi des scores élevés en Ethics et Email Classification, tous deux à 98%. Ces résultats sont toutefois partagés avec respectivement 19 et 42 autres modèles, ce qui limite leur pouvoir de distinction. Sa fenêtre de 200 000 tokens et son tarif très inférieur à la moyenne constituent ses avantages les plus concrets.

Limites et points d’attention. Après près de deux ans, ses performances sont largement dépassées et le modèle est souvent retiré du catalogue de son éditeur. Il reste en retrait en Coding, avec 72%, et en Instruction Following, avec 61%. Son classement en Hallucinations se situe également dans la partie basse. Dans l’Arena vision, il occupe le 124e rang sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Claude Fable 5 est nettement devant. Son faible coût conserve un intérêt pour les usages fortement contraints par le budget. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.7 ou Claude Opus 4.6.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).