AI2D

AI2D est un benchmark créé en 2016 par l’Allen Institute for Artificial Intelligence (AI2) et Kembhavi et al. Il repose sur des diagrammes illustratifs issus des sciences naturelles de niveau scolaire, notamment des réseaux alimentaires, des éléments de physiologie humaine et des cycles…

AI2D est un benchmark créé en 2016 par l’Allen Institute for Artificial Intelligence (AI2) et Kembhavi et al. Il repose sur des diagrammes illustratifs issus des sciences naturelles de niveau scolaire, notamment des réseaux alimentaires, des éléments de physiologie humaine et des cycles de vie.

À travers des questions à choix multiples, AI2D évalue la compréhension des schémas et le raisonnement visuel. Les modèles doivent interpréter les éléments graphiques, leur organisation ainsi que leurs relations spatiales, structurelles et sémantiques afin d’identifier les concepts scientifiques représentés.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAllen Institute for Artificial Intelligence (AI2) / Kembhavi et al.
Capacités mesuréesmultimodal, raisonnement, vision
ModalitéMultimodal
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu4 903 diagrammes et plus de 15 000 questions à choix multiples
Année de publication2016
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (32)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude 3.5 SonnetAnthropic🔒 Propriétaire94,7 %22 octobre 2024Auto-déclaré
2Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire94,4 %31 mars 2026Auto-déclaré
3GPT-4oOpenAI🔒 Propriétaire94,2 %27 mars 2025Auto-déclaré
4Pixtral LargeMistral AI🟢 Ouvert93,8 %18 novembre 2024Auto-déclaré
5Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert93,3 %24 février 2026Auto-déclaré
6Mistral Small 3.2 24B InstructMistral AI🟢 Ouvert92,9 %20 juin 2025Auto-déclaré
7Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert92,9 %24 février 2026Auto-déclaré
8Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert92,7 %16 avril 2026Auto-déclaré
9Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert92,6 %24 février 2026Auto-déclaré
10Llama 3.2 90B InstructMeta🟢 Ouvert92,3 %25 septembre 2024Auto-déclaré
11Llama 3.2 11B InstructMeta🟢 Ouvert91,1 %25 septembre 2024Auto-déclaré
12Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert89,7 %22 septembre 2025Auto-déclaré
13Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert89,5 %22 septembre 2025Auto-déclaré
14Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert89,2 %22 septembre 2025Auto-déclaré
15Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert88,9 %22 septembre 2025Auto-déclaré
16Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert88,4 %26 janvier 2025Auto-déclaré
17Grok-1.5VxAI🔒 Propriétaire88,3 %12 avril 2024Auto-déclaré
18Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert86,9 %22 septembre 2025Auto-déclaré
19Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert85,7 %22 septembre 2025Auto-déclaré
20Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert85,0 %22 septembre 2025Auto-déclaré
21Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert84,9 %22 septembre 2025Auto-déclaré
22Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert84,9 %22 septembre 2025Auto-déclaré
23Gemma 3 27BGoogle🟢 Ouvert84,5 %12 mars 2025Auto-déclaré
24Gemma 3 12BGoogle🟢 Ouvert84,2 %12 mars 2025Auto-déclaré
25Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert84,1 %22 septembre 2025Auto-déclaré
26Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert83,2 %27 mars 2025Auto-déclaré
27Phi-4-multimodal-instructMicrosoft🟢 Ouvert82,3 %1 février 2025Auto-déclaré
28DeepSeek VL2DeepSeek🟢 Ouvert81,4 %13 décembre 2024Auto-déclaré
29DeepSeek VL2 SmallDeepSeek🟢 Ouvert80,0 %13 décembre 2024Auto-déclaré
30Phi-3.5-vision-instructMicrosoft🟢 Ouvert78,1 %23 août 2024Auto-déclaré
31Gemma 3 4BGoogle🟢 Ouvert74,8 %12 mars 2025Auto-déclaré
32DeepSeek VL2 TinyDeepSeek🟢 Ouvert71,6 %13 décembre 2024Auto-déclaré

Classement établi sur 32 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 88,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur AI2D indique qu’un modèle répond correctement à une forte proportion de questions portant sur des diagrammes scientifiques. Il traduit donc une bonne capacité à relier les éléments visuels, la structure du schéma et les concepts exprimés. La mesure par accuracy fournit un indicateur simple, mais la fiabilité du classement doit être nuancée, car les résultats recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune.

Le niveau médian élevé parmi les 32 modèles évalués suggère une possible saturation du benchmark, avec une capacité de discrimination réduite entre les systèmes les plus performants. Son accès public peut aussi créer un risque de contamination ou de familiarité avec les données, sans que cela établisse qu’un modèle particulier en a bénéficié. Sa portée reste centrée sur des QCM en anglais et sur des diagrammes de sciences naturelles de niveau scolaire. Le classement montre néanmoins un avantage du meilleur modèle, Claude 3.5 Sonnet, sur une population déjà globalement performante.


Sources des scores : llm-stats.