gpt-5-chat-2025-08-07
gpt-5-chat-2025-08-07 est un LLM propriétaire d’OpenAI, sorti le 7 août 2025. Sa fenêtre de contexte de 128 000 tokens offre une capacité étendue, avec des connaissances arrêtées au 30 septembre 2024.
gpt-5-chat-2025-08-07 est un LLM propriétaire d’OpenAI, sorti le 7 août 2025. Sa fenêtre de contexte de 128 000 tokens offre une capacité étendue, avec des connaissances arrêtées au 30 septembre 2024.
Son principal trait distinctif est son positionnement très économique. Sa tarification se situe 40% sous la moyenne des LLM similaires et environ 4,4 fois sous celle des modèles frontière, avec un écart marqué entre le coût des tokens d’entrée et de sortie.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 7 août 2025 |
| Connaissances jusqu'à | 2024-09-30 |
| Multimodal | oui |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | file,image,text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 93,0 % | 42ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 92,0 % | 84ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 75,0 % | 42ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Benchable : General Knowledge (Baseline)
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 85ᵉ | Mistral Medium 3.5 | 1427 |
| 86ᵉ | amazon-nova-experimental-chat-26-02-10 | 1427 |
| 87ᵉ | gpt-5-chat-2025-08-07 | 1427 |
| 88ᵉ | GLM-4.6 | 1425 |
| 89ᵉ | DeepSeek-V3.2 | 1425 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 45ᵉ | Qwen3.5-122B-A10B | 1228 |
| 46ᵉ | OpenAI: GPT-4.5 (Preview) | 1225 |
| 47ᵉ | gpt-5-chat-2025-08-07 | 1225 |
| 48ᵉ | Gemini 2.5 Flash Preview | 1225 |
| 49ᵉ | Qwen3.5-27B | 1220 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 1,25 $ | 10 $ | 0,125 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,09 $ |
| Latence moyenne par benchmark — Benchable | 2 min 31 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Les tests Benchable montrent des résultats solides en Email Classification et en Coding. Le score élevé en Hallucinations constitue aussi un point favorable sur ce test précis. En Ethics et en General Knowledge, le modèle atteint le plafond du benchmark, mais partage sa place avec respectivement 71 et 24 autres modèles. Ces résultats sont donc peu discriminants. La fenêtre de 128 000 tokens complète ce profil à un tarif inférieur à celui des LLM comparables.
Limites et points d’attention. Instruction Following est son résultat Benchable le plus faible. Dans l’Arena text, le modèle occupe le 87e rang sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. Dans l’Arena vision, il atteint le 47e rang sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Le premier est également nettement devant. Le modèle reste pertinent lorsque le coût et la taille du contexte priment. Pour un résultat plus abouti selon les préférences humaines, Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7 sont mieux classés.
Sources des données : OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).