DynaMath

DynaMath est un benchmark de raisonnement mathématique multimodal créé par l’University of Illinois Urbana-Champaign. Il repose sur des problèmes visuels dont plusieurs variantes sont générées par programme, notamment en modifiant des valeurs numériques, des éléments textuels ou des…

DynaMath est un benchmark de raisonnement mathématique multimodal créé par l’University of Illinois Urbana-Champaign. Il repose sur des problèmes visuels dont plusieurs variantes sont générées par programme, notamment en modifiant des valeurs numériques, des éléments textuels ou des graphes de fonctions.

Son objectif est d’évaluer si un modèle maintient un raisonnement correct lorsque la présentation d’un même problème évolue. DynaMath complète ainsi l’exactitude moyenne par une mesure au pire cas, afin de faire apparaître les modèles performants mais sensibles à certaines variations.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkUniversity of Illinois Urbana-Champaign (UIUC)
Capacités mesuréesRobustesse du raisonnement mathématique multimodal face à des variations visuelles/textuelles (valeurs numériques, graphes de fonctions)
ModalitéMultimodal
Type de questionsraisonnement mathématique visuel (variantes dynamiques générées par programme)
Métrique d'évaluationexactitude moyenne et exactitude au pire cas (worst-case accuracy sur les 10 variantes)
AccèsPublic
Languesanglais
Taille du jeu501 questions-germes → 5 010 questions concrètes (10 variantes chacune)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire88,0 %31 mars 2026Auto-déclaré
2Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert87,7 %24 février 2026Auto-déclaré
3Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert85,9 %24 février 2026Auto-déclaré
4Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert85,6 %21 avril 2026Auto-déclaré
5Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert85,0 %24 février 2026Auto-déclaré
6Seed 2.1 ProByteDance🔒 Propriétaire73,1 %24 juin 2026Auto-déclaré
7Seed 2.1 TurboByteDance🔒 Propriétaire68,1 %24 juin 2026Auto-déclaré

Classement établi sur 7 modèles évalués. Score médian de l'ensemble : 85,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur DynaMath indique qu’un modèle résout correctement une forte proportion de problèmes mathématiques visuels et résiste aux variations générées à partir des questions-germes. L’exactitude au pire cas sur dix variantes est particulièrement exigeante, car une faiblesse ponctuelle peut révéler une robustesse inférieure à celle suggérée par la moyenne. Dans la base, les résultats sont toutefois majoritairement auto-déclarés par les éditeurs, ce qui impose davantage de prudence qu’une évaluation entièrement mesurée selon un protocole indépendant. Le score médian de 86 % et le meilleur résultat, 88 % pour Qwen3.6 Plus, montrent un classement resserré parmi les sept modèles évalués. Cet écart limité peut réduire le pouvoir discriminant du benchmark à ce niveau de performance et évoquer une saturation partielle. Son accès public crée aussi un risque général d’exposition des questions lors du développement des modèles, susceptible d’affecter l’interprétation des scores. Enfin, DynaMath mesure une portée ciblée, le raisonnement mathématique multimodal en anglais face à des variations visuelles et textuelles, plutôt que les capacités générales d’un modèle.


Sources des scores : llm-stats.