OpenAI: GPT-4 Turbo Preview
OpenAI: GPT-4 Turbo Preview est un LLM propriétaire lancé le 25 janvier 2024. Avec environ deux ans d’ancienneté, il appartient déjà à une génération ancienne à l’échelle de l’IA, désormais largement dépassée et souvent retirée des catalogues.
OpenAI: GPT-4 Turbo Preview est un LLM propriétaire lancé le 25 janvier 2024. Avec environ deux ans d’ancienneté, il appartient déjà à une génération ancienne à l’échelle de l’IA, désormais largement dépassée et souvent retirée des catalogues.
À sa sortie, le modèle se situait dans le haut du panier de sa génération. Sa fenêtre de contexte de 128 000 tokens constituait un trait marquant. Ses connaissances s’arrêtent au 31 décembre 2023, ce qui limite sa pertinence sur les événements et informations ultérieurs.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 25 janvier 2024 |
| Connaissances jusqu'à | 2023-12-31 |
| Multimodal | non |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 94,0 % | 78ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 69,0 % | 57ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 42,4 % | 55ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 40,0 % | 33ᵉ / 59 | epoch | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 0,0 % | 153ᵉ / 161 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Email Classification (Baseline)
Benchable : Hallucinations (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 10 $ | 30 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 380 % au-dessus de la moyenne des LLM similaires, et 1,8 fois plus cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,16 $ |
| Latence moyenne par benchmark — Benchable | 3 min 24 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, OpenAI: GPT-4 Turbo Preview figurait dans le top 17% des LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. La classification d’e-mails atteint un niveau très élevé, même si le modèle partage sa place avec 40 autres concurrents sur un benchmark plafonné et peu discriminant. La fenêtre de 128 000 tokens lui donne aussi la capacité de traiter de longs volumes de texte dans une même séquence.
Limites et points d’attention. Les classements disponibles le placent aujourd’hui en retrait sur GPQA diamond et dans le milieu de tableau sur MATH level 5. Le suivi d’instructions reste également moyen. Le résultat nul en General Knowledge est très faible, mais ce benchmark plafonné départage mal les modèles. Cette génération est désormais largement dépassée et souvent retirée des catalogues. Le tarif constitue un autre frein majeur : ce modèle premium coûte 380% de plus que la moyenne des LLM similaires et environ 1,8 fois plus cher que les modèles frontière.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).