TheoremQA
TheoremQA est un benchmark de questions scientifiques et mathématiques fondées sur des théorèmes, créé par Wenhu Chen et ses coauteurs en 2023. Il couvre notamment les mathématiques, la physique, l’ingénierie électrique, l’informatique et la finance.
TheoremQA est un benchmark de questions scientifiques et mathématiques fondées sur des théorèmes, créé par Wenhu Chen et ses coauteurs en 2023. Il couvre notamment les mathématiques, la physique, l’ingénierie électrique, l’informatique et la finance.
Son objectif est d’évaluer la capacité d’un modèle à reconnaître le théorème pertinent, puis à l’appliquer dans un raisonnement en plusieurs étapes afin de produire une réponse courte. Il teste ainsi la résolution de problèmes universitaires exigeants plutôt que la simple restitution de connaissances.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Wenhu Chen et al. |
| Capacités mesurées | finance, mathématiques, physique, raisonnement |
| Modalité | Texte |
| Type de questions | questions ouvertes à réponse courte, principalement numériques ou symboliques, avec certains items de type choix ou vrai/faux |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 800 questions |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (6)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,4 % | 23 juillet 2024 | Auto-déclaré |
| 2 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,1 % | 19 septembre 2024 | Auto-déclaré |
| 3 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 43,1 % | 19 septembre 2024 | Auto-déclaré |
| 4 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 43,0 % | 19 septembre 2024 | Auto-déclaré |
| 5 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 34,0 % | 19 septembre 2024 | Auto-déclaré |
| 6 | Qwen2 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 25,3 % | 23 juillet 2024 | Auto-déclaré |
Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 43,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle identifie et applique correctement des théorèmes sur une proportion importante des questions, selon la métrique d’accuracy. Il reflète donc à la fois la sélection du bon principe, l’exécution du raisonnement et la production de la réponse attendue. La lecture des résultats exige toutefois de la prudence, car les scores disponibles sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. L’accès public au jeu invite également à considérer un risque de contamination lors de l’interprétation des performances. Avec un meilleur score de 44 % pour Qwen2 72B Instruct et une médiane de 43 % parmi les six modèles évalués, le classement apparaît très resserré. Cet écart limité réduit la portée des comparaisons fines, tandis que le niveau atteint ne signale pas une saturation du benchmark. Enfin, TheoremQA mesure un périmètre ciblé : des problèmes universitaires en anglais, principalement à réponses numériques ou symboliques, dans les disciplines scientifiques et financières couvertes.
Sources des scores : llm-stats.