Claude Haiku 4.5

Claude Haiku 4.5 est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 15 octobre 2025. Son positionnement associe une fenêtre de contexte de 200 000 tokens à une tarification très économique. Ses connaissances s’arrêtent au 1er février 2025.

Claude Haiku 4.5 est un LLM propriétaire d’Anthropic, éditeur américain, sorti le 15 octobre 2025. Son positionnement associe une fenêtre de contexte de 200 000 tokens à une tarification très économique. Ses connaissances s’arrêtent au 1er février 2025.

À sa sortie, il appartenait au haut du classement de sa génération sur GPQA diamond. Son profil ressort surtout sur une épreuve mathématique difficile, tandis que ses résultats globaux, en code et dans les tâches agentiques, sont plus modestes. Cette combinaison en fait un modèle abordable à contexte étendu.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie15 octobre 2025
Connaissances jusqu'à2025-02-01
Multimodaloui
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index23.786ᵉ / 137
Code Index43.940ᵉ / 74
Agentic Index16.445ᵉ / 68
Math Index39.038ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,0 %75ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)97,0 %100ᵉ / 163benchable✅ Mesuré
Epoch: MATH level 596,4 %6ᵉ / 59epoch✅ Mesuré
Benchable : Mathematics (Baseline)93,0 %44ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)91,0 %66ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)76,0 %81ᵉ / 155benchable✅ Mesuré
Epoch: GPQA diamond71,2 %30ᵉ / 85epoch✅ Mesuré
Benchable : Instruction Following (Baseline)70,0 %52ᵉ / 163benchable✅ Mesuré
PinchBench : agentique (OpenClaw, 147 tâches)67,7 %13ᵉ / 19pinchbench✅ Mesuré
Epoch: OTIS Mock AIME 2024-202566,7 %27ᵉ / 64epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private5,9 %20ᵉ / 32epoch✅ Mesuré
Epoch: SimpleQA Verified5,9 %26ᵉ / 26epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private2,1 %15ᵉ / 25epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré
Tau2 Retail83,2 %5ᵉ / 25llm-statsAuto-déclaré
MMMLU83,0 %36ᵉ / 49llm-statsAuto-déclaré
Tau2 Telecom83,0 %20ᵉ / 34llm-statsAuto-déclaré
AIME 202580,7 %65ᵉ / 108llm-statsAuto-déclaré
SWE-Bench Verified73,3 %44ᵉ / 102llm-statsAuto-déclaré
MMMU (validation)73,2 %4ᵉ / 4llm-statsAuto-déclaré
GPQA73,0 %109ᵉ / 219llm-statsAuto-déclaré
Tau2 Airline63,6 %9ᵉ / 22llm-statsAuto-déclaré
OSWorld50,7 %9ᵉ / 20llm-statsAuto-déclaré
Cybersecurity CTFs46,9 %2ᵉ / 3llm-statsAuto-déclaré
Terminal-Bench41,0 %7ᵉ / 25llm-statsAuto-déclaré
Finance Agent v231,0 %23ᵉ / 26llm-statsn.d.
GDPval-AA30,1 %38ᵉ / 39llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Claude Haiku 4.523.7
Nova 2.0 Pro Preview21.8

Code Index

▶ Claude Haiku 4.543.9
Qwen3.5 122B A10B43.3

Classements Arena (Elo)

Arena Document · 32 modèles classés

RangModèleElo
1ᵉClaude Opus 4.61508
2ᵉClaude Fable 51507
3ᵉClaude Opus 4.61507
23ᵉGemma 4 31B1424
24ᵉGemini 2.5 Pro1422
25ᵉClaude Haiku 4.51421
26ᵉGLM-5V-Turbo1418
27ᵉGrok-4.20 Beta1413

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
112ᵉClaude Opus 41412
113ᵉTencent: Hy3 preview1412
114ᵉClaude Haiku 4.51412
115ᵉgrok-3-preview-02-241412
116ᵉGLM-4.51411

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
75ᵉGPT-5.1 Codex1330
76ᵉKimi K2 09051330
77ᵉClaude Haiku 4.51327
78ᵉMiniMax M21305
79ᵉlaguna-xs.21303

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Google Vertex1 $5 $0,1 $
anthropic1 $5 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 52 % en dessous de la moyenne des LLM similaires, et 5,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)12,19 $
Durée d'exécution — PinchBench3 h 53 min
Indice valeur/coût — PinchBench53,49
Coût moyen par benchmark — Benchable0,09 $
Latence moyenne par benchmark — Benchable3 min 18 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. Le résultat le plus convaincant vient de MATH level 5, avec 96 % et une place dans le top 10. À sa sortie, Claude Haiku 4.5 figurait aussi dans le top 27 % des LLM de sa génération sur GPQA diamond. Son prix constitue un autre avantage concret : 52 % sous la moyenne des LLM similaires et environ 5.5 fois inférieur à celui des modèles frontière.

Limites et points d’attention. L’Intelligence Index, l’Agentic Index et le Math Index le placent dans la moitié basse de leurs classements. Le Code Index reste en milieu de tableau. Les scores Benchable plafonnés, notamment 100 % en Hallucinations et Ethics, sont peu discriminants. Dans l’Arena document, il se classe 25e sur 32, derrière Claude Opus 4.6 et Claude Fable 5. Le premier est nettement devant. En Arena text, il est 114e sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. En Arena code, il est 77e sur 99, derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. L’écart avec Kimi K3 est important. Il reste pertinent pour des tâches sensibles au coût nécessitant un contexte étendu. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Kimi K3.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).