GDPval-AA

GDPval-AA évalue la capacité des modèles d’IA à accomplir un travail intellectuel ayant une valeur économique réelle. Le benchmark original GDPval a été créé par OpenAI, tandis que cette variante est exécutée indépendamment par Artificial Analysis.

GDPval-AA évalue la capacité des modèles d’IA à accomplir un travail intellectuel ayant une valeur économique réelle. Le benchmark original GDPval a été créé par OpenAI, tandis que cette variante est exécutée indépendamment par Artificial Analysis.

L’évaluation repose sur des tâches professionnelles ouvertes, comme la production de documents, de présentations, de diagrammes ou de tableurs, dans plusieurs domaines. Son classement Elo vise à comparer les performances des modèles sur des livrables proches de situations de travail concrètes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI (benchmark GDPval) ; variante GDPval-AA executee independamment par Artificial Analysis
Capacités mesuréesTravail intellectuel a valeur economique reelle sur 44 metiers couvrant 9 secteurs (finance, sante, juridique, etc.)
ModalitéTexte
Type de questionstaches professionnelles ouvertes (production de documents, slides, diagrammes, tableurs)
Métrique d'évaluationclassement Elo derive de comparaisons aveugles par paires jugees par un LLM
AccèsPublic
Licencepropriétaire
Languesanglais
Taille du jeu220 taches (sous-ensemble GDPval gold ; 1 320 taches au total)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (39)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Fable 5Anthropic🔒 Propriétaire1 8159 juin 2026n.d.
2GPT-5.6 SolOpenAI🔒 Propriétaire1 7489 juillet 2026Auto-déclaré
3Kimi K3Moonshot AI▫ n.d.1 66816 juillet 2026n.d.
4Claude Opus 4.8Anthropic🔒 Propriétaire1 63828 mai 2026n.d.
5Claude Sonnet 5Anthropic🔒 Propriétaire1 61830 juin 2026n.d.
6Claude Opus 4.6Anthropic🔒 Propriétaire1 6065 février 2026Auto-déclaré
7GPT-5.6 TerraOpenAI🔒 Propriétaire1 5939 juillet 2026Auto-déclaré
8GPT-5.6 LunaOpenAI🔒 Propriétaire1 5929 juillet 2026Auto-déclaré
9Grok 4.5xAI🔒 Propriétaire1 54316 juillet 2026n.d.
10Claude Opus 4.7Anthropic🔒 Propriétaire1 54216 avril 2026n.d.
11MiniMax M3MiniMax🟢 Ouvert1 4311 juin 2026n.d.
12GPT-4.5OpenAI🔒 Propriétaire1 4295 mars 2026n.d.
13MiMo-V2-ProXiaomi🔒 Propriétaire1 42618 mars 2026Auto-déclaré
14Claude Sonnet 4.6Anthropic🔒 Propriétaire1 41717 février 2026n.d.
15MiMo-V2-OmniXiaomi🔒 Propriétaire1 41018 mars 2026Auto-déclaré
16Gemini 3.5 FlashGoogle🔒 Propriétaire1 37019 mai 2026n.d.
17DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert1 33223 avril 2026n.d.
18Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire1 30819 mai 2026n.d.
19MiMo-V2.5-ProXiaomi🟢 Ouvert1 28627 avril 2026n.d.
20GLM-5.1Zhipu AI🟢 Ouvert1 2817 avril 2026n.d.
21DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert1 20323 avril 2026n.d.
22Kimi K2.6Moonshot AI🟢 Ouvert1 20220 avril 2026n.d.
23GPT-5.4 miniOpenAI🔒 Propriétaire1 19017 mars 2026n.d.
24Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert1 1834 juin 2026n.d.
25MiniMax M2.7MiniMax🟢 Ouvert1 17818 mars 2026n.d.
26Muse SparkMeta🔒 Propriétaire1 1648 avril 2026n.d.
27Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire1 16031 mars 2026n.d.
28Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert1 15821 avril 2026n.d.
29GPT-5.5OpenAI🔒 Propriétaire1 13523 avril 2026n.d.
30GPT-5.4 nanoOpenAI🔒 Propriétaire1 11517 mars 2026n.d.
31Grok 4.3xAI🔒 Propriétaire1 1006 mai 2026n.d.
32Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert1 05616 avril 2026n.d.
33Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert98524 février 2026n.d.
34Gemini 3.1 Pro PreviewGoogle▫ n.d.97619 février 2026n.d.
35Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert96116 février 2026n.d.
36Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire94631 mai 2026n.d.
37Mistral Medium 3.5Mistral AI🟢 Ouvert92629 avril 2026n.d.
38Claude Haiku 4.5Anthropic🔒 Propriétaire90215 octobre 2025n.d.
39Gemma 4 31BGoogle🟢 Ouvert7832 avril 2026n.d.

Classement établi sur 39 modèles évalués, dont 24 de grands éditeurs. Ce benchmark n'étant pas exprimé en pourcentage, la barre prend le score du premier comme référence (100 %). « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle est plus souvent préféré lors de comparaisons aveugles par paires, jugées par un LLM. Il traduit donc une meilleure performance relative sur les tâches professionnelles retenues, plutôt qu’une mesure exhaustive de toutes les aptitudes utiles au travail. Le protocole apporte de la rigueur grâce à l’évaluation à l’aveugle et au classement Elo. L’interprétation demande toutefois de la prudence, car les scores recensés dans la base sont majoritairement auto-déclarés par les éditeurs.

Le meilleur résultat, obtenu par Claude Fable 5 à 60 %, contre une médiane de 40 %, met en évidence un écart entre le modèle de tête et le niveau central de l’ensemble évalué, sans signaler une saturation générale au sommet. La portée reste circonscrite aux 220 tâches en anglais du sous-ensemble GDPval gold, réparties entre 44 métiers et 9 secteurs. Enfin, le caractère public du benchmark invite à surveiller le risque de contamination au fil du temps. Le classement révèle avant tout une hiérarchie comparative sur ce périmètre précis.


Sources des scores : llm-stats.