GPT-4 Turbo

GPT-4 Turbo est un LLM propriétaire d’OpenAI, lancé le 9 avril 2024. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée et souvent retirée des catalogues. À sa sortie, il figurait néanmoins dans le top 15% des LLM de sa…

GPT-4 Turbo est un LLM propriétaire d’OpenAI, lancé le 9 avril 2024. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée et souvent retirée des catalogues. À sa sortie, il figurait néanmoins dans le top 15% des LLM de sa génération sur GPQA diamond.

Le modèle associe une fenêtre de contexte de 128 000 tokens à des connaissances arrêtées au 31 décembre 2023. Son positionnement premium tranche avec son ancienneté : sa tarification dépasse très largement la moyenne des LLM similaires et reste supérieure à celle des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie9 avril 2024
Connaissances jusqu'à2023-12-31
Multimodalnon
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MGSM88,5 %10ᵉ / 30llm-statsAuto-déclaré
HumanEval87,1 %29ᵉ / 65llm-statsAuto-déclaré
MMLU86,5 %27ᵉ / 98llm-statsAuto-déclaré
DROP86,0 %4ᵉ / 29llm-statsAuto-déclaré
MATH72,6 %33ᵉ / 70llm-statsAuto-déclaré
GPQA48,0 %169ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
101ᵉgemini-1.5-pro-0011119
102ᵉGPT-4o1119
103ᵉGPT-4 Turbo1112
104ᵉAllenAI: Molmo2 8B1107
105ᵉGPT-4o mini1098

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI10 $30 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 380 % au-dessus de la moyenne des LLM similaires, et 1,8 fois plus cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,42 $
Latence moyenne par benchmark — Benchable4 min 04 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À son époque, GPT-4 Turbo se situait dans le haut du panier de sa génération. Les évaluations Benchable le placent en tête sur Hallucinations, Ethics et Email Classification, trois résultats concordants qui signalent une bonne maîtrise de ces tests ciblés. Sa fenêtre de 128 000 tokens constitue aussi un trait distinctif pour le traitement de contenus longs. Le classement obtenu sur GPQA diamond à sa sortie confirme qu’il comptait alors parmi les modèles les plus solides de sa cohorte.

Limites et points d’attention. Près de deux ans après sa sortie, ses performances sont aujourd’hui largement dépassées. Les résultats en Coding et en General Knowledge se situent dans le bas des classements Benchable, tandis que l’Instruction Following reste seulement intermédiaire. En vision, son classement dans l’Arena est également faible par rapport aux modèles évalués. Ses connaissances s’arrêtent fin 2023, ce qui limite sa pertinence sur les événements ultérieurs. Son prix accentue ce décalage : la tarification est 402% supérieure à la moyenne des LLM similaires et environ 1,8 fois plus élevée que celle des modèles frontière. Ce niveau de coût est difficile à justifier pour un modèle de cette ancienneté.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).