AI2D
AI2D est un benchmark créé en 2016 par l’Allen Institute for Artificial Intelligence (AI2) et Kembhavi et al. Il repose sur des diagrammes illustratifs issus des sciences naturelles de niveau scolaire, notamment des réseaux alimentaires, des éléments de physiologie humaine et des cycles…
AI2D est un benchmark créé en 2016 par l’Allen Institute for Artificial Intelligence (AI2) et Kembhavi et al. Il repose sur des diagrammes illustratifs issus des sciences naturelles de niveau scolaire, notamment des réseaux alimentaires, des éléments de physiologie humaine et des cycles de vie.
À travers des questions à choix multiples, AI2D évalue la compréhension des schémas et le raisonnement visuel. Les modèles doivent interpréter les éléments graphiques, leur organisation ainsi que leurs relations spatiales, structurelles et sémantiques afin d’identifier les concepts scientifiques représentés.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Allen Institute for Artificial Intelligence (AI2) / Kembhavi et al. |
| Capacités mesurées | multimodal, raisonnement, vision |
| Modalité | Multimodal |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 4 903 diagrammes et plus de 15 000 questions à choix multiples |
| Année de publication | 2016 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (32)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 94,7 % | 22 octobre 2024 | Auto-déclaré |
| 2 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 94,4 % | 31 mars 2026 | Auto-déclaré |
| 3 | GPT-4o | OpenAI | 🔒 Propriétaire | 94,2 % | 27 mars 2025 | Auto-déclaré |
| 4 | Pixtral Large | Mistral AI | 🟢 Ouvert | 93,8 % | 18 novembre 2024 | Auto-déclaré |
| 5 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,3 % | 24 février 2026 | Auto-déclaré |
| 6 | Mistral Small 3.2 24B Instruct | Mistral AI | 🟢 Ouvert | 92,9 % | 20 juin 2025 | Auto-déclaré |
| 7 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,9 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,7 % | 16 avril 2026 | Auto-déclaré |
| 9 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,6 % | 24 février 2026 | Auto-déclaré |
| 10 | Llama 3.2 90B Instruct | Meta | 🟢 Ouvert | 92,3 % | 25 septembre 2024 | Auto-déclaré |
| 11 | Llama 3.2 11B Instruct | Meta | 🟢 Ouvert | 91,1 % | 25 septembre 2024 | Auto-déclaré |
| 12 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,7 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,5 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,2 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,9 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,4 % | 26 janvier 2025 | Auto-déclaré |
| 17 | Grok-1.5V | xAI | 🔒 Propriétaire | 88,3 % | 12 avril 2024 | Auto-déclaré |
| 18 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,9 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,7 % | 22 septembre 2025 | Auto-déclaré |
| 20 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,0 % | 22 septembre 2025 | Auto-déclaré |
| 21 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,9 % | 22 septembre 2025 | Auto-déclaré |
| 22 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,9 % | 22 septembre 2025 | Auto-déclaré |
| 23 | Gemma 3 27B | 🟢 Ouvert | 84,5 % | 12 mars 2025 | Auto-déclaré | |
| 24 | Gemma 3 12B | 🟢 Ouvert | 84,2 % | 12 mars 2025 | Auto-déclaré | |
| 25 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,1 % | 22 septembre 2025 | Auto-déclaré |
| 26 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,2 % | 27 mars 2025 | Auto-déclaré |
| 27 | Phi-4-multimodal-instruct | Microsoft | 🟢 Ouvert | 82,3 % | 1 février 2025 | Auto-déclaré |
| 28 | DeepSeek VL2 | DeepSeek | 🟢 Ouvert | 81,4 % | 13 décembre 2024 | Auto-déclaré |
| 29 | DeepSeek VL2 Small | DeepSeek | 🟢 Ouvert | 80,0 % | 13 décembre 2024 | Auto-déclaré |
| 30 | Phi-3.5-vision-instruct | Microsoft | 🟢 Ouvert | 78,1 % | 23 août 2024 | Auto-déclaré |
| 31 | Gemma 3 4B | 🟢 Ouvert | 74,8 % | 12 mars 2025 | Auto-déclaré | |
| 32 | DeepSeek VL2 Tiny | DeepSeek | 🟢 Ouvert | 71,6 % | 13 décembre 2024 | Auto-déclaré |
Classement établi sur 32 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 88,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur AI2D indique qu’un modèle répond correctement à une forte proportion de questions portant sur des diagrammes scientifiques. Il traduit donc une bonne capacité à relier les éléments visuels, la structure du schéma et les concepts exprimés. La mesure par accuracy fournit un indicateur simple, mais la fiabilité du classement doit être nuancée, car les résultats recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune.
Le niveau médian élevé parmi les 32 modèles évalués suggère une possible saturation du benchmark, avec une capacité de discrimination réduite entre les systèmes les plus performants. Son accès public peut aussi créer un risque de contamination ou de familiarité avec les données, sans que cela établisse qu’un modèle particulier en a bénéficié. Sa portée reste centrée sur des QCM en anglais et sur des diagrammes de sciences naturelles de niveau scolaire. Le classement montre néanmoins un avantage du meilleur modèle, Claude 3.5 Sonnet, sur une population déjà globalement performante.
Sources des scores : llm-stats.