Claude 3 Haiku
Claude 3 Haiku est un LLM propriétaire d’Anthropic, lancé le 13 mars 2024. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA et probablement dépassée. Sa fenêtre de contexte atteint 200 000 tokens, mais ses connaissances s’arrêtent au 31…
Claude 3 Haiku est un LLM propriétaire d’Anthropic, lancé le 13 mars 2024. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA et probablement dépassée. Sa fenêtre de contexte atteint 200 000 tokens, mais ses connaissances s’arrêtent au 31 août 2023.
Son principal trait distinctif reste son positionnement très économique. Sa tarification se situe 88% sous la moyenne des LLM similaires et environ 22 fois sous celle des modèles frontière, avec un écart marqué entre le prix des tokens d’entrée et de sortie.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 13 mars 2024 |
| Connaissances jusqu'à | 2023-08-31 |
| Multimodal | oui |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 98,0 % | 105ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 96,5 % | 106ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 86,0 % | 102ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 72,0 % | 130ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 61,0 % | 83ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 58,0 % | 120ᵉ / 140 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 36,3 % | 65ᵉ / 85 | epoch | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 36,0 % | 133ᵉ / 155 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 14,9 % | 49ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 1,8 % | 61ᵉ / 64 | epoch | ✅ Mesuré |
| ARC-C | 89,2 % | 12ᵉ / 34 | llm-stats | Auto-déclaré |
| GSM8k | 88,9 % | 28ᵉ / 47 | llm-stats | Auto-déclaré |
| HellaSwag | 85,9 % | 11ᵉ / 27 | llm-stats | Auto-déclaré |
| DROP | 78,4 % | 17ᵉ / 29 | llm-stats | Auto-déclaré |
| HumanEval | 75,9 % | 47ᵉ / 65 | llm-stats | Auto-déclaré |
| MMLU | 75,2 % | 73ᵉ / 98 | llm-stats | Auto-déclaré |
| MGSM | 75,1 % | 19ᵉ / 30 | llm-stats | Auto-déclaré |
| BIG-Bench Hard | 73,7 % | 9ᵉ / 20 | llm-stats | Auto-déclaré |
| MATH | 38,9 % | 66ᵉ / 70 | llm-stats | Auto-déclaré |
| GPQA | 33,3 % | 202ᵉ / 219 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Benchable : Email Classification (Baseline)
Classements Arena (Elo)
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 122ᵉ | Claude 3 Sonnet | 1016 |
| 123ᵉ | 01.AI: Yi Vision | 1002 |
| 124ᵉ | Claude 3 Haiku | 1000 |
| 125ᵉ | c4ai-aya-vision-32b | 1000 |
| 126ᵉ | molmo-7b-d-0924 | 994 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Amazon Bedrock | 0,25 $ | 1,25 $ | 0,03 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 22 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 2 min 21 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, Claude 3 Haiku figurait dans le top 35% des 17 LLM de sa génération sur GPQA diamond. Il obtient aussi des scores élevés en Ethics et Email Classification, tous deux à 98%. Ces résultats sont toutefois partagés avec respectivement 19 et 42 autres modèles, ce qui limite leur pouvoir de distinction. Sa fenêtre de 200 000 tokens et son tarif très inférieur à la moyenne constituent ses avantages les plus concrets.
Limites et points d’attention. Après près de deux ans, ses performances sont largement dépassées et le modèle est souvent retiré du catalogue de son éditeur. Il reste en retrait en Coding, avec 72%, et en Instruction Following, avec 61%. Son classement en Hallucinations se situe également dans la partie basse. Dans l’Arena vision, il occupe le 124e rang sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Claude Fable 5 est nettement devant. Son faible coût conserve un intérêt pour les usages fortement contraints par le budget. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.7 ou Claude Opus 4.6.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).