GPT-5.2
GPT-5.2 est un LLM propriétaire d’OpenAI, lancé le 11 décembre 2025 aux États-Unis. Il se caractérise par de solides résultats en mathématiques et par une fenêtre de contexte de 400 000 tokens. Ses connaissances s’arrêtent au 25 août 2025.
GPT-5.2 est un LLM propriétaire d’OpenAI, lancé le 11 décembre 2025 aux États-Unis. Il se caractérise par de solides résultats en mathématiques et par une fenêtre de contexte de 400 000 tokens. Ses connaissances s’arrêtent au 25 août 2025.
Le modèle adopte un positionnement économique. Sa tarification se situe 16% sous la moyenne des LLM similaires et environ 3,1 fois sous celle des modèles frontière. Ce rapport entre capacités, contexte et coût constitue son principal argument.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 11 décembre 2025 |
| Connaissances jusqu'à | 2025-08-25 |
| Multimodal | oui |
| Fenêtre de contexte | 400 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 42.2 | 18ᵉ / 137 |
| Math Index | 99.0 | 1ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 96,1 % | 6ᵉ / 64 | epoch | ✅ Mesuré |
| Benchable : Coding (Baseline) | 96,0 % | 7ᵉ / 162 | benchable | ✅ Mesuré |
| LiveBench: Mathematics | 93,2 % | 1ᵉ / 7 | livebench | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 92,0 % | 61ᵉ / 140 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 91,4 % | 7ᵉ / 85 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 86,0 % | 15ᵉ / 163 | benchable | ✅ Mesuré |
| LiveBench: Reasoning | 83,2 % | 2ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Language | 79,8 % | 3ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Data Analysis | 78,2 % | 2ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Coding | 76,1 % | 4ᵉ / 7 | livebench | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 76,0 % | 81ᵉ / 155 | benchable | ✅ Mesuré |
| LiveBench: Global average | 74,6 % | 2ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: SWE-Bench verified | 73,8 % | 5ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 67,4 % | 5ᵉ / 17 | epoch | ✅ Mesuré |
| LiveBench: IF | 61,8 % | 7ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 60,0 % | 3ᵉ / 33 | epoch | ✅ Mesuré |
| LiveBench: Agentic Coding | 50,3 % | 1ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: Chess Puzzles | 49,0 % | 5ᵉ / 20 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 40,7 % | 2ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 38,9 % | 14ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 31,7 % | 6ᵉ / 18 | epoch | ✅ Mesuré |
| Epoch: EBR-bench | 23,0 % | 2ᵉ / 7 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 18,8 % | 3ᵉ / 25 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 0,0 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
| AIME 2025 | 100,0 % | 1ᵉ / 108 | llm-stats | Auto-déclaré |
| HMMT 2025 | 99,4 % | 2ᵉ / 33 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 98,7 % | 4ᵉ / 34 | llm-stats | Auto-déclaré |
| Graphwalks BFS <128k | 94,0 % | 1ᵉ / 10 | llm-stats | Auto-déclaré |
| GPQA | 92,4 % | 11ᵉ / 219 | llm-stats | Auto-déclaré |
| BrowseComp Long Context 128k | 92,0 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| MMMLU | 89,6 % | 9ᵉ / 49 | llm-stats | Auto-déclaré |
| Graphwalks parents <128k | 89,0 % | 1ᵉ / 10 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 86,3 % | 2ᵉ / 23 | llm-stats | Auto-déclaré |
| ARC-AGI | 86,2 % | 5ᵉ / 7 | llm-stats | Auto-déclaré |
| VideoMMMU | 85,9 % | 4ᵉ / 26 | llm-stats | Auto-déclaré |
| CharXiv-R | 82,1 % | 13ᵉ / 45 | llm-stats | Auto-déclaré |
| Tau2 Retail | 82,0 % | 6ᵉ / 25 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 80,0 % | 14ᵉ / 102 | llm-stats | Auto-déclaré |
| MMMU-Pro | 79,5 % | 14ᵉ / 64 | llm-stats | Auto-déclaré |
| LiveBench | 74,8 % | 16ᵉ / 38 | llm-stats | n.d. |
| SWE-Lancer (IC-Diamond subset) | 74,6 % | 3ᵉ / 6 | llm-stats | Auto-déclaré |
| BrowseComp | 65,8 % | 30ᵉ / 57 | llm-stats | Auto-déclaré |
| MCP Atlas | 60,6 % | 26ᵉ / 30 | llm-stats | Auto-déclaré |
| ARC-AGI v2 | 52,9 % | 8ᵉ / 16 | llm-stats | Auto-déclaré |
| Toolathlon | 46,3 % | 19ᵉ / 30 | llm-stats | Auto-déclaré |
| FrontierMath | 40,3 % | 5ᵉ / 16 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 34,5 % | 39ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1437 | 73ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Text | 1435 | 75ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Code | 1406 | 46ᵉ / 99 | Kimi K3 (1679) |
| Arena Document | 1405 | 29ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Document | 1401 | 32ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Vision | 1244 | 35ᵉ / 135 | Claude Fable 5 (1318) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 1,75 $ | 14 $ | 0,175 $ |
| openai | 1,75 $ | 14 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 16 % en dessous de la moyenne des LLM similaires, et 3,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,18 $ |
| Latence moyenne par benchmark — Benchable | 3 min 00 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | United States of America |
Notre analyse
Forces. GPT-5.2 occupe la première place du Math Index parmi 54 modèles. Il figure aussi dans le top 10 sur OTIS Mock AIME 2024-2025, qui mesure les performances en olympiades de mathématiques de niveau lycée. À sa sortie, son résultat sur GPQA diamond le plaçait dans le top 2% des LLM de sa génération. L’Intelligence Index le situe également dans le haut du classement. Son prix renforce cet ensemble, avec un coût inférieur à celui des modèles similaires et nettement inférieur à celui des modèles frontière.
Limites et points d’attention. Les résultats Benchable sont peu discriminants, car plusieurs scores plafonnent et sont partagés par de nombreux modèles. Dans Arena text, GPT-5.2 se classe aux 73e et 75e places sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant GPT-5.2. Dans Arena Code, il occupe la 46e place sur 99, derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. Kimi K3 est nettement devant GPT-5.2. Le modèle reste pertinent pour les tâches mathématiques et les traitements exigeant un contexte étendu. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Kimi K3.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).