OpenAI: GPT-4 Turbo Preview

OpenAI: GPT-4 Turbo Preview est un LLM propriétaire lancé le 25 janvier 2024. Avec environ deux ans d’ancienneté, il appartient déjà à une génération ancienne à l’échelle de l’IA, désormais largement dépassée et souvent retirée des catalogues.

OpenAI: GPT-4 Turbo Preview est un LLM propriétaire lancé le 25 janvier 2024. Avec environ deux ans d’ancienneté, il appartient déjà à une génération ancienne à l’échelle de l’IA, désormais largement dépassée et souvent retirée des catalogues.

À sa sortie, le modèle se situait dans le haut du panier de sa génération. Sa fenêtre de contexte de 128 000 tokens constituait un trait marquant. Ses connaissances s’arrêtent au 31 décembre 2023, ce qui limite sa pertinence sur les événements et informations ultérieurs.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie25 janvier 2024
Connaissances jusqu'à2023-12-31
Multimodalnon
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : Hallucinations (Baseline)94,0 %78ᵉ / 146benchable✅ Mesuré
Benchable : Instruction Following (Baseline)69,0 %57ᵉ / 163benchable✅ Mesuré
Epoch: GPQA diamond42,4 %55ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 540,0 %33ᵉ / 59epoch✅ Mesuré
Benchable : General Knowledge (Baseline)0,0 %153ᵉ / 161benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
▶ GPT-4 Turbo Pre…99 %

Benchable : Hallucinations (Baseline)

▶ GPT-4 Turbo Pre…94 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI10 $30 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 380 % au-dessus de la moyenne des LLM similaires, et 1,8 fois plus cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,16 $
Latence moyenne par benchmark — Benchable3 min 24 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, OpenAI: GPT-4 Turbo Preview figurait dans le top 17% des LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. La classification d’e-mails atteint un niveau très élevé, même si le modèle partage sa place avec 40 autres concurrents sur un benchmark plafonné et peu discriminant. La fenêtre de 128 000 tokens lui donne aussi la capacité de traiter de longs volumes de texte dans une même séquence.

Limites et points d’attention. Les classements disponibles le placent aujourd’hui en retrait sur GPQA diamond et dans le milieu de tableau sur MATH level 5. Le suivi d’instructions reste également moyen. Le résultat nul en General Knowledge est très faible, mais ce benchmark plafonné départage mal les modèles. Cette génération est désormais largement dépassée et souvent retirée des catalogues. Le tarif constitue un autre frein majeur : ce modèle premium coûte 380% de plus que la moyenne des LLM similaires et environ 1,8 fois plus cher que les modèles frontière.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).