DROP

DROP est un benchmark de compréhension écrite conçu par l’Allen Institute for AI (AI2), UC Irvine et Dheeru Dua et al. Il évalue la capacité des modèles à raisonner à partir du contenu de paragraphes, au-delà de la simple reformulation ou de l’identification d’entités.

DROP est un benchmark de compréhension écrite conçu par l’Allen Institute for AI (AI2), UC Irvine et Dheeru Dua et al. Il évalue la capacité des modèles à raisonner à partir du contenu de paragraphes, au-delà de la simple reformulation ou de l’identification d’entités.

Ses questions ouvertes exigent notamment de résoudre des références et d’effectuer des opérations discrètes, comme compter, additionner, comparer ou trier. DROP sert ainsi à mesurer conjointement la compréhension globale d’un passage et la production d’une réponse courte exacte.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAllen Institute for AI (AI2) et UC Irvine; Dheeru Dua et al.
Capacités mesuréesmathématiques, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes à réponse courte
Métrique d'évaluationF1 et exact match
AccèsJeu de test privé (réponses non divulguées)
LicenceCC-BY-4.0
Languesanglais
Taille du jeuenviron 96 000 questions sur 6 700 paragraphes
Année de publication2019
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (29)

#ModèleÉditeurLicenceScoreSortieFiabilité
1DeepSeek-V3DeepSeek🟢 Ouvert91,6 %25 décembre 2024Auto-déclaré
2Claude 3.5 SonnetAnthropic🔒 Propriétaire87,1 %22 octobre 2024Auto-déclaré
3MiMo-V2.5-ProXiaomi🟢 Ouvert86,3 %27 avril 2026Auto-déclaré
4GPT-4 TurboOpenAI🔒 Propriétaire86,0 %9 avril 2024Auto-déclaré
5Nova ProAmazon🔒 Propriétaire85,4 %20 novembre 2024Auto-déclaré
6Llama 3.1 405B InstructMeta🟢 Ouvert84,8 %23 juillet 2024Auto-déclaré
7GPT-4oOpenAI🔒 Propriétaire83,4 %27 mars 2025Auto-déclaré
8Claude 3 OpusAnthropic🔒 Propriétaire83,1 %29 février 2024Auto-déclaré
9Claude 3.5 HaikuAnthropic🔒 Propriétaire83,1 %4 novembre 2024Auto-déclaré
10GPT-4OpenAI🔒 Propriétaire80,9 %28 août 2023Auto-déclaré
11Nova LiteAmazon🔒 Propriétaire80,2 %20 novembre 2024Auto-déclaré
12GPT-4o miniOpenAI🔒 Propriétaire79,7 %18 juillet 2024Auto-déclaré
13Llama 3.1 70B InstructMeta🟢 Ouvert79,6 %23 juillet 2024Auto-déclaré
14Nova MicroAmazon🔒 Propriétaire79,3 %20 novembre 2024Auto-déclaré
15LongCat-Flash-ChatMeituan🟢 Ouvert79,1 %29 août 2025Auto-déclaré
16Claude 3 SonnetAnthropic🔒 Propriétaire78,9 %29 février 2024Auto-déclaré
17Claude 3 HaikuAnthropic🔒 Propriétaire78,4 %13 mars 2024Auto-déclaré
18Phi 4Microsoft🟢 Ouvert75,5 %12 décembre 2024Auto-déclaré
19Gemini 1.5 ProGoogle🔒 Propriétaire74,9 %1 mai 2024Auto-déclaré
20GPT-3.5 TurboOpenAI🔒 Propriétaire70,2 %21 mars 2023n.d.
21Gemma 3n E4BGoogle🔒 Propriétaire60,8 %26 juin 2025Auto-déclaré
22Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert60,8 %20 mai 2025Auto-déclaré
23Llama 3.1 8B InstructMeta🟢 Ouvert59,5 %23 juillet 2024Auto-déclaré
24Granite 3.3 8B InstructIBM🟢 Ouvert59,4 %16 avril 2025Auto-déclaré
25Gemma 3n E2BGoogle🔒 Propriétaire53,9 %26 juin 2025Auto-déclaré
26Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert53,9 %20 mai 2025Auto-déclaré
27IBM Granite 4.0 Tiny PreviewIBM🟢 Ouvert46,2 %2 mai 2025Auto-déclaré
28Granite 3.3 8B BaseIBM🟢 Ouvert36,1 %16 avril 2025Auto-déclaré
29ERNIE 4.5Baidu🔒 Propriétaire28,6 %25 juin 2025Auto-déclaré

Classement établi sur 29 modèles évalués, dont 23 de grands éditeurs. Score médian de l'ensemble : 79,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur DROP indique qu’un modèle parvient fréquemment à extraire les informations pertinentes d’un paragraphe, à relier correctement les références et à exécuter les opérations discrètes nécessaires. Les métriques F1 et exact match distinguent la proximité avec la réponse attendue de sa reproduction exacte.

La lecture du classement demande toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre unique. Le jeu de test privé, dont les réponses ne sont pas divulguées, limite l’accès direct aux solutions. Il ne supprime pas pour autant la nécessité d’interpréter avec précaution des résultats provenant de déclarations distinctes.

Avec 29 modèles évalués, un score médian de 79 % et DeepSeek-V3 en tête à 92 %, le classement montre que plusieurs systèmes atteignent déjà un niveau élevé sur cette tâche. Cet écart laisse encore une marge de différenciation, même si la concentration vers des scores élevés peut réduire progressivement le pouvoir discriminant du benchmark. Sa portée reste centrée sur des paragraphes en anglais, des réponses courtes et des formes ciblées de raisonnement discret.


Sources des scores : llm-stats.