GPT-4o mini

GPT-4o mini est un LLM propriétaire lancé par OpenAI le 18 juillet 2024. Près de deux ans après sa sortie, il est déjà très ancien à l’échelle de l’IA et largement distancé par les modèles plus récents.

GPT-4o mini est un LLM propriétaire lancé par OpenAI le 18 juillet 2024. Près de deux ans après sa sortie, il est déjà très ancien à l’échelle de l’IA et largement distancé par les modèles plus récents.

Son positionnement repose sur un tarif très économique et une fenêtre de contexte de 128 000 tokens. Ses connaissances s’arrêtent au 1er octobre 2023. Sa tarification se situe 93% sous la moyenne des LLM similaires et environ 36.7 fois sous celle des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie18 juillet 2024
Connaissances jusqu'à2023-10-01
Multimodaloui
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index6.9135ᵉ / 137
Code Index11.472ᵉ / 74
Agentic Index1.066ᵉ / 68
Math Index14.748ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)87,0 %87ᵉ / 162benchable✅ Mesuré
Benchable : Hallucinations (Baseline)76,0 %113ᵉ / 146benchable✅ Mesuré
Benchable : Mathematics (Baseline)71,0 %111ᵉ / 140benchable✅ Mesuré
Benchable : Instruction Following (Baseline)60,5 %87ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)56,0 %109ᵉ / 155benchable✅ Mesuré
Epoch: MATH level 552,6 %26ᵉ / 59epoch✅ Mesuré
Epoch: GPQA diamond37,7 %63ᵉ / 85epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20256,9 %43ᵉ / 64epoch✅ Mesuré
HumanEval87,2 %28ᵉ / 65llm-statsAuto-déclaré
MGSM87,0 %12ᵉ / 30llm-statsAuto-déclaré
MMLU82,0 %48ᵉ / 98llm-statsAuto-déclaré
DROP79,7 %12ᵉ / 29llm-statsAuto-déclaré
MATH70,2 %37ᵉ / 70llm-statsAuto-déclaré
MMMU59,4 %43ᵉ / 61llm-statsAuto-déclaré
MathVista56,7 %29ᵉ / 38llm-statsAuto-déclaré
GPQA40,2 %191ᵉ / 219llm-statsAuto-déclaré
SWE-Bench Verified8,7 %102ᵉ / 102llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ GPT-4o mini6.9

Code Index

▶ GPT-4o mini11.4

Classements Arena (Elo)

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
103ᵉGPT-4 Turbo1112
104ᵉAllenAI: Molmo2 8B1107
105ᵉGPT-4o mini1098
106ᵉPixtral Large1095
107ᵉGPT-4.1 nano1089

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Azure0,15 $0,6 $0,075 $

Prix en dollars US par million de tokens.

Sa tarification se situe 93 % en dessous de la moyenne des LLM similaires, et 36,7 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable2 min 09 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À sa sortie, GPT-4o mini figurait dans le top 34% des 29 LLM de sa génération sur GPQA diamond. Il atteint aussi le plafond des benchmarks Ethics et General Knowledge, mais partage ces résultats avec de nombreux modèles, ce qui limite leur portée comparative. Sa fenêtre de contexte étendue et son prix très bas constituaient ses principaux atouts pratiques.

Limites et points d’attention. Les Intelligence Index, Code Index et Agentic Index le placent presque en fin de classement. Le Math Index reste également en retrait. Les résultats en hallucinations et en mathématiques se situent dans le bas des classements Benchable. Dans l’Arena vision, GPT-4o mini occupe la 105e place sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. L’écart avec le premier est important. Après près de deux ans, ses performances sont largement dépassées et le modèle est souvent absent du catalogue actuel de l’éditeur. Son principal intérêt résiduel tient à son faible coût. Pour un résultat plus abouti en vision, on lui préférera Claude Fable 5, Claude Opus 4.7 ou Claude Opus 4.6.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).