Claude 3.5 Haiku
Claude 3.5 Haiku est un LLM propriétaire d’Anthropic, sorti le 4 novembre 2024. Près de deux ans représentent une ancienneté très importante dans l’IA générative : le modèle appartient désormais à une génération largement dépassée par les systèmes récents.
Claude 3.5 Haiku est un LLM propriétaire d’Anthropic, sorti le 4 novembre 2024. Près de deux ans représentent une ancienneté très importante dans l’IA générative : le modèle appartient désormais à une génération largement dépassée par les systèmes récents.
Sa fenêtre de contexte de 200 000 tokens reste notable, avec des connaissances arrêtées au 31 juillet 2024. À sa sortie, Claude 3.5 Haiku se situait dans la première moitié des LLM de sa génération sur les questions scientifiques de niveau doctorat.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 4 novembre 2024 |
| Connaissances jusqu'à | 2024-07-31 |
| Multimodal | non |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 12.3 | 122ᵉ / 137 |
| Code Index | 15.9 | 69ᵉ / 74 |
| Agentic Index | 1.9 | 60ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: MATH level 5 | 46,4 % | 29ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 38,1 % | 62ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 6,7 % | 25ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 4,3 % | 51ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 0,3 % | 31ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
| HumanEval | 88,1 % | 24ᵉ / 65 | llm-stats | Auto-déclaré |
| MGSM | 85,6 % | 14ᵉ / 30 | llm-stats | Auto-déclaré |
| DROP | 83,1 % | 8ᵉ / 29 | llm-stats | Auto-déclaré |
| MATH | 69,4 % | 40ᵉ / 70 | llm-stats | Auto-déclaré |
| MMLU-Pro | 65,0 % | 96ᵉ / 125 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 51,0 % | 23ᵉ / 24 | llm-stats | Auto-déclaré |
| GPQA | 41,6 % | 187ᵉ / 219 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 40,6 % | 93ᵉ / 102 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 22,8 % | 21ᵉ / 22 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 95ᵉ | Llama 4 Scout | 1128 |
| 96ᵉ | Mistral Small 3.1 24B Instruct | 1127 |
| 97ᵉ | Claude 3.5 Haiku | 1127 |
| 98ᵉ | step-1o-vision-32k-highres | 1125 |
| 99ᵉ | Qwen2.5 VL 72B Instruct | 1121 |
Notre analyse
Forces. À son époque, Claude 3.5 Haiku obtenait des résultats honorables sur GPQA diamond et se plaçait dans la première moitié du classement de sa génération. MATH level 5 constitue son autre résultat solide, également dans la première moitié des modèles évalués. Sa fenêtre de contexte de 200 000 tokens autorise le traitement de volumes de texte importants.
Limites et points d’attention. Les classements actuels placent Claude 3.5 Haiku très en retrait sur l’Intelligence Index, le Code Index et l’Agentic Index. SimpleQA Verified révèle une faiblesse marquée sur les questions factuelles vérifiables, avec 7% et l’avant-dernière place. Les scores nuls sur les deux versions de FrontierMath confirment ses limites en mathématiques de recherche. Dans Arena vision, il occupe la 97e place sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Claude Fable 5 est nettement devant. Ses performances sont aujourd’hui largement dépassées, et cette génération est souvent retirée des catalogues. Son intérêt est surtout historique. Pour un résultat plus abouti, Claude Fable 5, Claude Opus 4.7 ou Claude Opus 4.6 sont mieux classés.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.