GPT-5 mini

GPT-5 mini est un LLM propriétaire d’OpenAI, lancé le 7 août 2025 aux États-Unis. Il se distingue par une fenêtre de contexte de 400 000 tokens, adaptée aux entrées très longues, et par des connaissances arrêtées au 30 mai 2024.

GPT-5 mini est un LLM propriétaire d’OpenAI, lancé le 7 août 2025 aux États-Unis. Il se distingue par une fenêtre de contexte de 400 000 tokens, adaptée aux entrées très longues, et par des connaissances arrêtées au 30 mai 2024.

Son positionnement tarifaire est très économique, avec une entrée à 0,25 $ et une sortie à 2 $ par million de tokens. Cette tarification se situe 88% sous la moyenne des LLM similaires et environ 22 fois sous celle des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie7 août 2025
Connaissances jusqu'à2024-05-30
Multimodaloui
Fenêtre de contexte400 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index30.958ᵉ / 137
Code Index15.670ᵉ / 74
Agentic Index19.441ᵉ / 68
Math Index85.015ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 161benchable✅ Mesuré
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : Ethics (Baseline)98,0 %105ᵉ / 159benchable✅ Mesuré
Epoch: MATH level 597,8 %2ᵉ / 59epoch✅ Mesuré
Benchable : Email Classification (Baseline)97,0 %100ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)96,0 %32ᵉ / 155benchable✅ Mesuré
Benchable : Coding (Baseline)95,0 %17ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)94,0 %30ᵉ / 140benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202586,7 %13ᵉ / 64epoch✅ Mesuré
Epoch: GPQA diamond75,0 %28ᵉ / 85epoch✅ Mesuré
Benchable : Instruction Following (Baseline)75,0 %42ᵉ / 163benchable✅ Mesuré
Epoch: SWE-Bench verified64,7 %11ᵉ / 15epoch✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private46,7 %10ᵉ / 17epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public40,0 %7ᵉ / 33epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private27,2 %7ᵉ / 32epoch✅ Mesuré
Epoch: SimpleQA Verified21,0 %22ᵉ / 26epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private12,2 %13ᵉ / 18epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private6,2 %9ᵉ / 25epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Public0,0 %1ᵉ / 15epoch✅ Mesuré
AIME 202591,1 %38ᵉ / 108llm-statsAuto-déclaré
HMMT 202587,8 %20ᵉ / 33llm-statsAuto-déclaré
GPQA82,3 %66ᵉ / 219llm-statsAuto-déclaré
FrontierMath22,1 %11ᵉ / 16llm-statsAuto-déclaré
Humanity's Last Exam16,7 %64ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Qwen3.5 397B A17B32.0
▶ GPT-5 mini30.9

Code Index

▶ GPT-5 mini15.6

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
138ᵉMiMo-V2-Flash1393
139ᵉMiniMax M2.51391
140ᵉGPT-5 mini1390
141ᵉo4-mini1390
142ᵉClaude Sonnet 41389

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
71ᵉQwen: Qwen VL Max1186
72ᵉgrok-4-07091182
73ᵉGPT-5 mini1181
74ᵉgemini-1.5-pro-0021179
75ᵉClaude 3.7 Sonnet1175

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI0,25 $2 $0,025 $
openai0,25 $2 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 22 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,09 $
Latence moyenne par benchmark — Benchable8 min 15 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
PaysUnited States of America

Notre analyse

Forces. GPT-5 mini se distingue surtout en mathématiques. Il atteint 98% sur MATH level 5 et se classe deuxième sur 59 modèles, tandis que son Math Index le situe également dans le haut du classement. À sa sortie, il figurait dans le top 18% des LLM de sa génération sur GPQA diamond. Sa fenêtre de 400 000 tokens constitue un autre atout concret pour traiter de longues entrées à faible coût.

Limites et points d’attention. Le bilan général est moins favorable. L’Intelligence Index le place dans une position intermédiaire, le Code Index près du bas du classement et l’Agentic Index dans sa moitié inférieure. Les Benchable Baseline, souvent plafonnés et partagés par de nombreux modèles, sont peu discriminants. Dans Arena text, GPT-5 mini est 140e sur 200, et 73e sur 135 dans Arena vision. Il reste derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Dans les deux arènes, le premier est nettement devant. GPT-5 mini reste pertinent pour les usages mathématiques, les longues entrées et les budgets contraints. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).