GPT-4 Turbo
GPT-4 Turbo est un LLM propriétaire d’OpenAI, lancé le 9 avril 2024. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée et souvent retirée des catalogues. À sa sortie, il figurait néanmoins dans le top 15% des LLM de sa…
GPT-4 Turbo est un LLM propriétaire d’OpenAI, lancé le 9 avril 2024. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée et souvent retirée des catalogues. À sa sortie, il figurait néanmoins dans le top 15% des LLM de sa génération sur GPQA diamond.
Le modèle associe une fenêtre de contexte de 128 000 tokens à des connaissances arrêtées au 31 décembre 2023. Son positionnement premium tranche avec son ancienneté : sa tarification dépasse très largement la moyenne des LLM similaires et reste supérieure à celle des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 9 avril 2024 |
| Connaissances jusqu'à | 2023-12-31 |
| Multimodal | non |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MGSM | 88,5 % | 10ᵉ / 30 | llm-stats | Auto-déclaré |
| HumanEval | 87,1 % | 29ᵉ / 65 | llm-stats | Auto-déclaré |
| MMLU | 86,5 % | 27ᵉ / 98 | llm-stats | Auto-déclaré |
| DROP | 86,0 % | 4ᵉ / 29 | llm-stats | Auto-déclaré |
| MATH | 72,6 % | 33ᵉ / 70 | llm-stats | Auto-déclaré |
| GPQA | 48,0 % | 169ᵉ / 219 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 101ᵉ | gemini-1.5-pro-001 | 1119 |
| 102ᵉ | GPT-4o | 1119 |
| 103ᵉ | GPT-4 Turbo | 1112 |
| 104ᵉ | AllenAI: Molmo2 8B | 1107 |
| 105ᵉ | GPT-4o mini | 1098 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 10 $ | 30 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 380 % au-dessus de la moyenne des LLM similaires, et 1,8 fois plus cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,42 $ |
| Latence moyenne par benchmark — Benchable | 4 min 04 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À son époque, GPT-4 Turbo se situait dans le haut du panier de sa génération. Les évaluations Benchable le placent en tête sur Hallucinations, Ethics et Email Classification, trois résultats concordants qui signalent une bonne maîtrise de ces tests ciblés. Sa fenêtre de 128 000 tokens constitue aussi un trait distinctif pour le traitement de contenus longs. Le classement obtenu sur GPQA diamond à sa sortie confirme qu’il comptait alors parmi les modèles les plus solides de sa cohorte.
Limites et points d’attention. Près de deux ans après sa sortie, ses performances sont aujourd’hui largement dépassées. Les résultats en Coding et en General Knowledge se situent dans le bas des classements Benchable, tandis que l’Instruction Following reste seulement intermédiaire. En vision, son classement dans l’Arena est également faible par rapport aux modèles évalués. Ses connaissances s’arrêtent fin 2023, ce qui limite sa pertinence sur les événements ultérieurs. Son prix accentue ce décalage : la tarification est 402% supérieure à la moyenne des LLM similaires et environ 1,8 fois plus élevée que celle des modèles frontière. Ce niveau de coût est difficile à justifier pour un modèle de cette ancienneté.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).