DROP
DROP est un benchmark de compréhension écrite conçu par l’Allen Institute for AI (AI2), UC Irvine et Dheeru Dua et al. Il évalue la capacité des modèles à raisonner à partir du contenu de paragraphes, au-delà de la simple reformulation ou de l’identification d’entités.
DROP est un benchmark de compréhension écrite conçu par l’Allen Institute for AI (AI2), UC Irvine et Dheeru Dua et al. Il évalue la capacité des modèles à raisonner à partir du contenu de paragraphes, au-delà de la simple reformulation ou de l’identification d’entités.
Ses questions ouvertes exigent notamment de résoudre des références et d’effectuer des opérations discrètes, comme compter, additionner, comparer ou trier. DROP sert ainsi à mesurer conjointement la compréhension globale d’un passage et la production d’une réponse courte exacte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Allen Institute for AI (AI2) et UC Irvine; Dheeru Dua et al. |
| Capacités mesurées | mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes à réponse courte |
| Métrique d'évaluation | F1 et exact match |
| Accès | Jeu de test privé (réponses non divulguées) |
| Licence | CC-BY-4.0 |
| Langues | anglais |
| Taille du jeu | environ 96 000 questions sur 6 700 paragraphes |
| Année de publication | 2019 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (29)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 91,6 % | 25 décembre 2024 | Auto-déclaré |
| 2 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 87,1 % | 22 octobre 2024 | Auto-déclaré |
| 3 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 86,3 % | 27 avril 2026 | Auto-déclaré |
| 4 | GPT-4 Turbo | OpenAI | 🔒 Propriétaire | 86,0 % | 9 avril 2024 | Auto-déclaré |
| 5 | Nova Pro | Amazon | 🔒 Propriétaire | 85,4 % | 20 novembre 2024 | Auto-déclaré |
| 6 | Llama 3.1 405B Instruct | Meta | 🟢 Ouvert | 84,8 % | 23 juillet 2024 | Auto-déclaré |
| 7 | GPT-4o | OpenAI | 🔒 Propriétaire | 83,4 % | 27 mars 2025 | Auto-déclaré |
| 8 | Claude 3 Opus | Anthropic | 🔒 Propriétaire | 83,1 % | 29 février 2024 | Auto-déclaré |
| 9 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 83,1 % | 4 novembre 2024 | Auto-déclaré |
| 10 | GPT-4 | OpenAI | 🔒 Propriétaire | 80,9 % | 28 août 2023 | Auto-déclaré |
| 11 | Nova Lite | Amazon | 🔒 Propriétaire | 80,2 % | 20 novembre 2024 | Auto-déclaré |
| 12 | GPT-4o mini | OpenAI | 🔒 Propriétaire | 79,7 % | 18 juillet 2024 | Auto-déclaré |
| 13 | Llama 3.1 70B Instruct | Meta | 🟢 Ouvert | 79,6 % | 23 juillet 2024 | Auto-déclaré |
| 14 | Nova Micro | Amazon | 🔒 Propriétaire | 79,3 % | 20 novembre 2024 | Auto-déclaré |
| 15 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 79,1 % | 29 août 2025 | Auto-déclaré |
| 16 | Claude 3 Sonnet | Anthropic | 🔒 Propriétaire | 78,9 % | 29 février 2024 | Auto-déclaré |
| 17 | Claude 3 Haiku | Anthropic | 🔒 Propriétaire | 78,4 % | 13 mars 2024 | Auto-déclaré |
| 18 | Phi 4 | Microsoft | 🟢 Ouvert | 75,5 % | 12 décembre 2024 | Auto-déclaré |
| 19 | Gemini 1.5 Pro | 🔒 Propriétaire | 74,9 % | 1 mai 2024 | Auto-déclaré | |
| 20 | GPT-3.5 Turbo | OpenAI | 🔒 Propriétaire | 70,2 % | 21 mars 2023 | n.d. |
| 21 | Gemma 3n E4B | 🔒 Propriétaire | 60,8 % | 26 juin 2025 | Auto-déclaré | |
| 22 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 60,8 % | 20 mai 2025 | Auto-déclaré | |
| 23 | Llama 3.1 8B Instruct | Meta | 🟢 Ouvert | 59,5 % | 23 juillet 2024 | Auto-déclaré |
| 24 | Granite 3.3 8B Instruct | IBM | 🟢 Ouvert | 59,4 % | 16 avril 2025 | Auto-déclaré |
| 25 | Gemma 3n E2B | 🔒 Propriétaire | 53,9 % | 26 juin 2025 | Auto-déclaré | |
| 26 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 53,9 % | 20 mai 2025 | Auto-déclaré | |
| 27 | IBM Granite 4.0 Tiny Preview | IBM | 🟢 Ouvert | 46,2 % | 2 mai 2025 | Auto-déclaré |
| 28 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 36,1 % | 16 avril 2025 | Auto-déclaré |
| 29 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 28,6 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 29 modèles évalués, dont 23 de grands éditeurs. Score médian de l'ensemble : 79,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur DROP indique qu’un modèle parvient fréquemment à extraire les informations pertinentes d’un paragraphe, à relier correctement les références et à exécuter les opérations discrètes nécessaires. Les métriques F1 et exact match distinguent la proximité avec la réponse attendue de sa reproduction exacte.
La lecture du classement demande toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre unique. Le jeu de test privé, dont les réponses ne sont pas divulguées, limite l’accès direct aux solutions. Il ne supprime pas pour autant la nécessité d’interpréter avec précaution des résultats provenant de déclarations distinctes.
Avec 29 modèles évalués, un score médian de 79 % et DeepSeek-V3 en tête à 92 %, le classement montre que plusieurs systèmes atteignent déjà un niveau élevé sur cette tâche. Cet écart laisse encore une marge de différenciation, même si la concentration vers des scores élevés peut réduire progressivement le pouvoir discriminant du benchmark. Sa portée reste centrée sur des paragraphes en anglais, des réponses courtes et des formes ciblées de raisonnement discret.
Sources des scores : llm-stats.