DynaMath
DynaMath est un benchmark de raisonnement mathématique multimodal créé par l’University of Illinois Urbana-Champaign. Il repose sur des problèmes visuels dont plusieurs variantes sont générées par programme, notamment en modifiant des valeurs numériques, des éléments textuels ou des…
DynaMath est un benchmark de raisonnement mathématique multimodal créé par l’University of Illinois Urbana-Champaign. Il repose sur des problèmes visuels dont plusieurs variantes sont générées par programme, notamment en modifiant des valeurs numériques, des éléments textuels ou des graphes de fonctions.
Son objectif est d’évaluer si un modèle maintient un raisonnement correct lorsque la présentation d’un même problème évolue. DynaMath complète ainsi l’exactitude moyenne par une mesure au pire cas, afin de faire apparaître les modèles performants mais sensibles à certaines variations.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | University of Illinois Urbana-Champaign (UIUC) |
| Capacités mesurées | Robustesse du raisonnement mathématique multimodal face à des variations visuelles/textuelles (valeurs numériques, graphes de fonctions) |
| Modalité | Multimodal |
| Type de questions | raisonnement mathématique visuel (variantes dynamiques générées par programme) |
| Métrique d'évaluation | exactitude moyenne et exactitude au pire cas (worst-case accuracy sur les 10 variantes) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 501 questions-germes → 5 010 questions concrètes (10 variantes chacune) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 88,0 % | 31 mars 2026 | Auto-déclaré |
| 2 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,7 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,9 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,6 % | 21 avril 2026 | Auto-déclaré |
| 5 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,0 % | 24 février 2026 | Auto-déclaré |
| 6 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 73,1 % | 24 juin 2026 | Auto-déclaré |
| 7 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 68,1 % | 24 juin 2026 | Auto-déclaré |
Classement établi sur 7 modèles évalués. Score médian de l'ensemble : 85,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur DynaMath indique qu’un modèle résout correctement une forte proportion de problèmes mathématiques visuels et résiste aux variations générées à partir des questions-germes. L’exactitude au pire cas sur dix variantes est particulièrement exigeante, car une faiblesse ponctuelle peut révéler une robustesse inférieure à celle suggérée par la moyenne. Dans la base, les résultats sont toutefois majoritairement auto-déclarés par les éditeurs, ce qui impose davantage de prudence qu’une évaluation entièrement mesurée selon un protocole indépendant. Le score médian de 86 % et le meilleur résultat, 88 % pour Qwen3.6 Plus, montrent un classement resserré parmi les sept modèles évalués. Cet écart limité peut réduire le pouvoir discriminant du benchmark à ce niveau de performance et évoquer une saturation partielle. Son accès public crée aussi un risque général d’exposition des questions lors du développement des modèles, susceptible d’affecter l’interprétation des scores. Enfin, DynaMath mesure une portée ciblée, le raisonnement mathématique multimodal en anglais face à des variations visuelles et textuelles, plutôt que les capacités générales d’un modèle.
Sources des scores : llm-stats.