GDPval-AA
GDPval-AA évalue la capacité des modèles d’IA à accomplir un travail intellectuel ayant une valeur économique réelle. Le benchmark original GDPval a été créé par OpenAI, tandis que cette variante est exécutée indépendamment par Artificial Analysis.
GDPval-AA évalue la capacité des modèles d’IA à accomplir un travail intellectuel ayant une valeur économique réelle. Le benchmark original GDPval a été créé par OpenAI, tandis que cette variante est exécutée indépendamment par Artificial Analysis.
L’évaluation repose sur des tâches professionnelles ouvertes, comme la production de documents, de présentations, de diagrammes ou de tableurs, dans plusieurs domaines. Son classement Elo vise à comparer les performances des modèles sur des livrables proches de situations de travail concrètes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI (benchmark GDPval) ; variante GDPval-AA executee independamment par Artificial Analysis |
| Capacités mesurées | Travail intellectuel a valeur economique reelle sur 44 metiers couvrant 9 secteurs (finance, sante, juridique, etc.) |
| Modalité | Texte |
| Type de questions | taches professionnelles ouvertes (production de documents, slides, diagrammes, tableurs) |
| Métrique d'évaluation | classement Elo derive de comparaisons aveugles par paires jugees par un LLM |
| Accès | Public |
| Licence | propriétaire |
| Langues | anglais |
| Taille du jeu | 220 taches (sous-ensemble GDPval gold ; 1 320 taches au total) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (39)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 1 815 | 9 juin 2026 | n.d. |
| 2 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 1 748 | 9 juillet 2026 | Auto-déclaré |
| 3 | Kimi K3 | Moonshot AI | ▫ n.d. | 1 668 | 16 juillet 2026 | n.d. |
| 4 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 1 638 | 28 mai 2026 | n.d. |
| 5 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 1 618 | 30 juin 2026 | n.d. |
| 6 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 1 606 | 5 février 2026 | Auto-déclaré |
| 7 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 1 593 | 9 juillet 2026 | Auto-déclaré |
| 8 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 1 592 | 9 juillet 2026 | Auto-déclaré |
| 9 | Grok 4.5 | xAI | 🔒 Propriétaire | 1 543 | 16 juillet 2026 | n.d. |
| 10 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 1 542 | 16 avril 2026 | n.d. |
| 11 | MiniMax M3 | MiniMax | 🟢 Ouvert | 1 431 | 1 juin 2026 | n.d. |
| 12 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 1 429 | 5 mars 2026 | n.d. |
| 13 | MiMo-V2-Pro | Xiaomi | 🔒 Propriétaire | 1 426 | 18 mars 2026 | Auto-déclaré |
| 14 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 1 417 | 17 février 2026 | n.d. |
| 15 | MiMo-V2-Omni | Xiaomi | 🔒 Propriétaire | 1 410 | 18 mars 2026 | Auto-déclaré |
| 16 | Gemini 3.5 Flash | 🔒 Propriétaire | 1 370 | 19 mai 2026 | n.d. | |
| 17 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 1 332 | 23 avril 2026 | n.d. |
| 18 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 1 308 | 19 mai 2026 | n.d. |
| 19 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 1 286 | 27 avril 2026 | n.d. |
| 20 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 1 281 | 7 avril 2026 | n.d. |
| 21 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 1 203 | 23 avril 2026 | n.d. |
| 22 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 1 202 | 20 avril 2026 | n.d. |
| 23 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 1 190 | 17 mars 2026 | n.d. |
| 24 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 1 183 | 4 juin 2026 | n.d. |
| 25 | MiniMax M2.7 | MiniMax | 🟢 Ouvert | 1 178 | 18 mars 2026 | n.d. |
| 26 | Muse Spark | Meta | 🔒 Propriétaire | 1 164 | 8 avril 2026 | n.d. |
| 27 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 1 160 | 31 mars 2026 | n.d. |
| 28 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 1 158 | 21 avril 2026 | n.d. |
| 29 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 1 135 | 23 avril 2026 | n.d. |
| 30 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 1 115 | 17 mars 2026 | n.d. |
| 31 | Grok 4.3 | xAI | 🔒 Propriétaire | 1 100 | 6 mai 2026 | n.d. |
| 32 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 1 056 | 16 avril 2026 | n.d. |
| 33 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 985 | 24 février 2026 | n.d. |
| 34 | Gemini 3.1 Pro Preview | ▫ n.d. | 976 | 19 février 2026 | n.d. | |
| 35 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 961 | 16 février 2026 | n.d. |
| 36 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 946 | 31 mai 2026 | n.d. |
| 37 | Mistral Medium 3.5 | Mistral AI | 🟢 Ouvert | 926 | 29 avril 2026 | n.d. |
| 38 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 902 | 15 octobre 2025 | n.d. |
| 39 | Gemma 4 31B | 🟢 Ouvert | 783 | 2 avril 2026 | n.d. |
Classement établi sur 39 modèles évalués, dont 24 de grands éditeurs. Ce benchmark n'étant pas exprimé en pourcentage, la barre prend le score du premier comme référence (100 %). « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle est plus souvent préféré lors de comparaisons aveugles par paires, jugées par un LLM. Il traduit donc une meilleure performance relative sur les tâches professionnelles retenues, plutôt qu’une mesure exhaustive de toutes les aptitudes utiles au travail. Le protocole apporte de la rigueur grâce à l’évaluation à l’aveugle et au classement Elo. L’interprétation demande toutefois de la prudence, car les scores recensés dans la base sont majoritairement auto-déclarés par les éditeurs.
Le meilleur résultat, obtenu par Claude Fable 5 à 60 %, contre une médiane de 40 %, met en évidence un écart entre le modèle de tête et le niveau central de l’ensemble évalué, sans signaler une saturation générale au sommet. La portée reste circonscrite aux 220 tâches en anglais du sous-ensemble GDPval gold, réparties entre 44 métiers et 9 secteurs. Enfin, le caractère public du benchmark invite à surveiller le risque de contamination au fil du temps. Le classement révèle avant tout une hiérarchie comparative sur ce périmètre précis.
Sources des scores : llm-stats.