Claude Haiku 4.5
Claude Haiku 4.5 est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 15 octobre 2025. Son positionnement associe une fenêtre de contexte de 200 000 tokens à une tarification très économique. Ses connaissances s’arrêtent au 1er février 2025.
Claude Haiku 4.5 est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 15 octobre 2025. Son positionnement associe une fenêtre de contexte de 200 000 tokens à une tarification très économique. Ses connaissances s’arrêtent au 1er février 2025.
À sa sortie, il appartenait au haut du classement de sa génération sur GPQA diamond. Son profil ressort surtout sur une épreuve mathématique difficile, tandis que ses résultats globaux, en code et dans les tâches agentiques, sont plus modestes. Cette combinaison en fait un modèle abordable à contexte étendu.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Anthropic |
| Poids | 🔒 Propriétaire |
| Date de sortie | 15 octobre 2025 |
| Connaissances jusqu'à | 2025-02-01 |
| Multimodal | oui |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 23.7 | 86ᵉ / 137 |
| Code Index | 43.9 | 40ᵉ / 74 |
| Agentic Index | 16.4 | 45ᵉ / 68 |
| Math Index | 39.0 | 38ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,0 % | 75ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 97,0 % | 100ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 96,4 % | 6ᵉ / 59 | epoch | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 93,0 % | 44ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 91,0 % | 66ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 76,0 % | 81ᵉ / 155 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 71,2 % | 30ᵉ / 85 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 70,0 % | 52ᵉ / 163 | benchable | ✅ Mesuré |
| PinchBench : agentique (OpenClaw, 147 tâches) | 67,7 % | 13ᵉ / 19 | pinchbench | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 66,7 % | 27ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 5,9 % | 20ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 5,9 % | 26ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 2,1 % | 15ᵉ / 25 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
| Tau2 Retail | 83,2 % | 5ᵉ / 25 | llm-stats | Auto-déclaré |
| MMMLU | 83,0 % | 36ᵉ / 49 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 83,0 % | 20ᵉ / 34 | llm-stats | Auto-déclaré |
| AIME 2025 | 80,7 % | 65ᵉ / 108 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 73,3 % | 44ᵉ / 102 | llm-stats | Auto-déclaré |
| MMMU (validation) | 73,2 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| GPQA | 73,0 % | 109ᵉ / 219 | llm-stats | Auto-déclaré |
| Tau2 Airline | 63,6 % | 9ᵉ / 22 | llm-stats | Auto-déclaré |
| OSWorld | 50,7 % | 9ᵉ / 20 | llm-stats | Auto-déclaré |
| Cybersecurity CTFs | 46,9 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| Terminal-Bench | 41,0 % | 7ᵉ / 25 | llm-stats | Auto-déclaré |
| Finance Agent v2 | 31,0 % | 23ᵉ / 26 | llm-stats | n.d. |
| GDPval-AA | 30,1 % | 38ᵉ / 39 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Document · 32 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Opus 4.6 | 1508 |
| 2ᵉ | Claude Fable 5 | 1507 |
| 3ᵉ | Claude Opus 4.6 | 1507 |
| ⋯ | ⋯ | |
| 23ᵉ | Gemma 4 31B | 1424 |
| 24ᵉ | Gemini 2.5 Pro | 1422 |
| 25ᵉ | Claude Haiku 4.5 | 1421 |
| 26ᵉ | GLM-5V-Turbo | 1418 |
| 27ᵉ | Grok-4.20 Beta | 1413 |
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 112ᵉ | Claude Opus 4 | 1412 |
| 113ᵉ | Tencent: Hy3 preview | 1412 |
| 114ᵉ | Claude Haiku 4.5 | 1412 |
| 115ᵉ | grok-3-preview-02-24 | 1412 |
| 116ᵉ | GLM-4.5 | 1411 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 75ᵉ | GPT-5.1 Codex | 1330 |
| 76ᵉ | Kimi K2 0905 | 1330 |
| 77ᵉ | Claude Haiku 4.5 | 1327 |
| 78ᵉ | MiniMax M2 | 1305 |
| 79ᵉ | laguna-xs.2 | 1303 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Google Vertex | 1 $ | 5 $ | 0,1 $ |
| anthropic | 1 $ | 5 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 52 % en dessous de la moyenne des LLM similaires, et 5,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 12,19 $ |
| Durée d'exécution — PinchBench | 3 h 53 min |
| Indice valeur/coût — PinchBench | 53,49 |
| Coût moyen par benchmark — Benchable | 0,09 $ |
| Latence moyenne par benchmark — Benchable | 3 min 18 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. Le résultat le plus convaincant vient de MATH level 5, avec 96 % et une place dans le top 10. À sa sortie, Claude Haiku 4.5 figurait aussi dans le top 27 % des LLM de sa génération sur GPQA diamond. Son prix constitue un autre avantage concret : 52 % sous la moyenne des LLM similaires et environ 5.5 fois inférieur à celui des modèles frontière.
Limites et points d’attention. L’Intelligence Index, l’Agentic Index et le Math Index le placent dans la moitié basse de leurs classements. Le Code Index reste en milieu de tableau. Les scores Benchable plafonnés, notamment 100 % en Hallucinations et Ethics, sont peu discriminants. Dans l’Arena document, il se classe 25e sur 32, derrière Claude Opus 4.6 et Claude Fable 5. Le premier est nettement devant. En Arena text, il est 114e sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. En Arena code, il est 77e sur 99, derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. L’écart avec Kimi K3 est important. Il reste pertinent pour des tâches sensibles au coût nécessitant un contexte étendu. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Kimi K3.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).