Claude Sonnet 4.6

Claude Sonnet 4.6 est un LLM propriétaire d’Anthropic, lancé le 17 février 2026. Il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de volumes importants de code ou de documents, ainsi que par un positionnement solide sur les tâches agentiques et la…

Claude Sonnet 4.6 est un LLM propriétaire d’Anthropic, lancé le 17 février 2026. Il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de volumes importants de code ou de documents, ainsi que par un positionnement solide sur les tâches agentiques et la programmation.

À sa sortie, il figurait dans le top 13% des LLM de sa génération sur GPQA diamond. Son tarif se situe dans la moyenne générale, malgré un coût supérieur à celui des modèles similaires, tout en restant nettement inférieur à celui des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAnthropic
Poids🔒 Propriétaire
Date de sortie17 février 2026
Multimodaloui
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text,image,audio,video → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index35.936ᵉ / 137
Code Index63.013ᵉ / 74
Agentic Index40.810ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Tau2 Telecom97,9 %7ᵉ / 34llm-statsAuto-déclaré
Tau2 Retail91,7 %2ᵉ / 25llm-statsAuto-déclaré
GPQA89,9 %23ᵉ / 219llm-statsAuto-déclaré
MMMLU89,3 %12ᵉ / 49llm-statsAuto-déclaré
SWE-Bench Verified79,6 %15ᵉ / 102llm-statsAuto-déclaré
MMMU-Pro75,6 %30ᵉ / 64llm-statsAuto-déclaré
LiveBench75,5 %13ᵉ / 38llm-statsn.d.
BrowseComp74,7 %26ᵉ / 57llm-statsAuto-déclaré
OSWorld72,5 %4ᵉ / 20llm-statsAuto-déclaré
Finance Agent63,3 %2ᵉ / 8llm-statsAuto-déclaré
MCP Atlas61,3 %25ᵉ / 30llm-statsAuto-déclaré
Terminal-Bench 2.059,1 %23ᵉ / 49llm-statsAuto-déclaré
ARC-AGI v258,3 %6ᵉ / 16llm-statsAuto-déclaré
Finance Agent v251,0 %7ᵉ / 26llm-statsn.d.
Humanity's Last Exam49,0 %20ᵉ / 89llm-statsAuto-déclaré
GDPval-AA47,2 %14ᵉ / 39llm-statsn.d.
Legal Agent Benchmark5,4 %4ᵉ / 12llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nemotron 3 Ultra 550B A…37.8
▶ Claude Sonnet 4.635.9
Qwen3.5 397B A17B32.0

Code Index

▶ Claude Sonnet 4.663.0

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Image-to-Code15445ᵉ / 31Claude Fable 5 (1627)
Arena Code152216ᵉ / 99Kimi K3 (1679)
Arena Document14867ᵉ / 32Claude Opus 4.6 (1508)
Arena Text147126ᵉ / 200Claude Fable 5 (1507)
Arena Vision127617ᵉ / 135Claude Fable 5 (1318)
Arena Search12226ᵉ / 32Claude Opus 4.6 (1255)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Claude Platform on AWS3 $15 $0,3 $
anthropic3 $15 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 44 % au-dessus de la moyenne des LLM similaires, et 1,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)31,4 $
Durée d'exécution — PinchBench5 h 24 min
Indice valeur/coût — PinchBench5,57
Coût moyen par benchmark — Benchable0,23 $
Latence moyenne par benchmark — Benchable4 min 36 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Claude Sonnet 4.6 atteint la première place sur les tests General Knowledge et Ethics de Benchable. Il se classe aussi dans le top 10 de l’Agentic Index, ce qui constitue son principal point fort, et occupe une place élevée au Code Index. Ses résultats en image-to-code sont particulièrement compétitifs, avec la deuxième place de l’arène concernée. Il reste également bien positionné sur les documents et obtient des scores élevés en Coding et Mathematics. Sa fenêtre de contexte de 1 000 000 tokens renforce son intérêt pour les corpus volumineux. Son prix demeure environ 1,8 fois inférieur à celui des modèles frontière.

Limites et points d’attention. Son Intelligence Index le place seulement dans le premier tiers du classement, loin de ses meilleurs rangs agentiques. Dans l’Arena code, il n’occupe que la quinzième place, malgré un Code Index favorable. Les résultats Benchable sur les hallucinations, la classification d’e-mails, le code et les mathématiques affichent des scores bruts élevés, mais des rangs plus modestes face au nombre de modèles évalués. Enfin, sa tarification est 51% supérieure à la moyenne des LLM similaires. Claude Sonnet 4.6 cible donc surtout les usages agentiques, l’image-to-code, l’analyse documentaire et les tâches nécessitant un très long contexte.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).