gpt-4o-search-preview-2025-03-11

Publié par OpenAI le 12 mars 2025, gpt-4o-search-preview-2025-03-11 est un LLM propriétaire au positionnement économique. Âgé d’environ un an, il appartient déjà à une génération très ancienne à l’échelle de l’IA, probablement dépassée par les modèles actuels et souvent retirée des…

Publié par OpenAI le 12 mars 2025, gpt-4o-search-preview-2025-03-11 est un LLM propriétaire au positionnement économique. Âgé d’environ un an, il appartient déjà à une génération très ancienne à l’échelle de l’IA, probablement dépassée par les modèles actuels et souvent retirée des catalogues.

Sa fenêtre de contexte de 128 000 tokens constitue son principal atout structurel. Ses connaissances s’arrêtent au 31 octobre 2023. Son tarif reste environ 2,2 fois inférieur à celui des modèles frontière, tout en dépassant de 20 % la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie12 mars 2025
Connaissances jusqu'à2023-10-31
Multimodalnon
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)99,0 %73ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)96,0 %112ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)96,0 %123ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)92,0 %61ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)89,0 %77ᵉ / 162benchable✅ Mesuré
Benchable : Instruction Following (Baseline)0,0 %145ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

ui-tars-1.5-7b99 %
▶ gpt-4o-search-preview-2…99 %
uncensored99 %

Benchable : General Knowledge (Baseline)

▶ gpt-4o-search-preview-2…96 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAIAdapter2,5 $10 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 20 % au-dessus de la moyenne des LLM similaires, et 2,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,15 $
Latence moyenne par benchmark — Benchable7 min 41 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, gpt-4o-search-preview-2025-03-11 affichait des scores Baseline élevés en Ethics, General Knowledge et Email Classification. Les résultats en Mathematics et Coding restent également solides en valeur absolue. Ces benchmarks sont toutefois plafonnés et départagent mal les modèles : en Ethics, il partage par exemple la 73e place avec 30 autres références. Sa fenêtre de 128 000 tokens offre une capacité de contexte importante. Son prix demeure économique face aux modèles haut de gamme.

Limites et points d’attention. Le résultat nul en Instruction Following constitue la faiblesse la plus nette : le modèle partage la 145e place sur 163 avec 18 autres modèles. Ses scores élevés sur les autres tests masquent aussi des classements en milieu ou en retrait de tableau, notamment en General Knowledge, Email Classification et Coding. La saturation des benchmarks limite donc leur portée comparative. Ses connaissances, arrêtées au 31 octobre 2023, sont anciennes. À environ un an, cette génération est probablement largement dépassée, et les modèles de cette période sont aujourd’hui souvent retirés du catalogue de leur éditeur.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).