gpt-5-chat-2025-08-07

gpt-5-chat-2025-08-07 est un LLM propriétaire d’OpenAI, sorti le 7 août 2025. Sa fenêtre de contexte de 128 000 tokens offre une capacité étendue, avec des connaissances arrêtées au 30 septembre 2024.

gpt-5-chat-2025-08-07 est un LLM propriétaire d’OpenAI, sorti le 7 août 2025. Sa fenêtre de contexte de 128 000 tokens offre une capacité étendue, avec des connaissances arrêtées au 30 septembre 2024.

Son principal trait distinctif est son positionnement très économique. Sa tarification se situe 40% sous la moyenne des LLM similaires et environ 4,4 fois sous celle des modèles frontière, avec un écart marqué entre le coût des tokens d’entrée et de sortie.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie7 août 2025
Connaissances jusqu'à2024-09-30
Multimodaloui
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)file,image,text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)93,0 %42ᵉ / 162benchable✅ Mesuré
Benchable : Hallucinations (Baseline)92,0 %84ᵉ / 146benchable✅ Mesuré
Benchable : Instruction Following (Baseline)75,0 %42ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

▶ gpt-5-chat-2025-08-07100 %
command-r-plus-08-202499 %

Benchable : General Knowledge (Baseline)

▶ gpt-5-chat-2025-08-07100 %

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
85ᵉMistral Medium 3.51427
86ᵉamazon-nova-experimental-chat-26-02-101427
87ᵉgpt-5-chat-2025-08-071427
88ᵉGLM-4.61425
89ᵉDeepSeek-V3.21425

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
45ᵉQwen3.5-122B-A10B1228
46ᵉOpenAI: GPT-4.5 (Preview)1225
47ᵉgpt-5-chat-2025-08-071225
48ᵉGemini 2.5 Flash Preview1225
49ᵉQwen3.5-27B1220

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI1,25 $10 $0,125 $

Prix en dollars US par million de tokens.

Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,09 $
Latence moyenne par benchmark — Benchable2 min 31 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Les tests Benchable montrent des résultats solides en Email Classification et en Coding. Le score élevé en Hallucinations constitue aussi un point favorable sur ce test précis. En Ethics et en General Knowledge, le modèle atteint le plafond du benchmark, mais partage sa place avec respectivement 71 et 24 autres modèles. Ces résultats sont donc peu discriminants. La fenêtre de 128 000 tokens complète ce profil à un tarif inférieur à celui des LLM comparables.

Limites et points d’attention. Instruction Following est son résultat Benchable le plus faible. Dans l’Arena text, le modèle occupe le 87e rang sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. Dans l’Arena vision, il atteint le 47e rang sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Le premier est également nettement devant. Le modèle reste pertinent lorsque le coût et la taille du contexte priment. Pour un résultat plus abouti selon les préférences humaines, Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7 sont mieux classés.


Sources des données : OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).