TheoremQA

TheoremQA est un benchmark de questions scientifiques et mathématiques fondées sur des théorèmes, créé par Wenhu Chen et ses coauteurs en 2023. Il couvre notamment les mathématiques, la physique, l’ingénierie électrique, l’informatique et la finance.

TheoremQA est un benchmark de questions scientifiques et mathématiques fondées sur des théorèmes, créé par Wenhu Chen et ses coauteurs en 2023. Il couvre notamment les mathématiques, la physique, l’ingénierie électrique, l’informatique et la finance.

Son objectif est d’évaluer la capacité d’un modèle à reconnaître le théorème pertinent, puis à l’appliquer dans un raisonnement en plusieurs étapes afin de produire une réponse courte. Il teste ainsi la résolution de problèmes universitaires exigeants plutôt que la simple restitution de connaissances.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkWenhu Chen et al.
Capacités mesuréesfinance, mathématiques, physique, raisonnement
ModalitéTexte
Type de questionsquestions ouvertes à réponse courte, principalement numériques ou symboliques, avec certains items de type choix ou vrai/faux
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu800 questions
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (6)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert44,4 %23 juillet 2024Auto-déclaré
2Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert44,1 %19 septembre 2024Auto-déclaré
3Qwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert43,1 %19 septembre 2024Auto-déclaré
4Qwen2.5 14B InstructAlibaba Cloud / Qwen Team🟢 Ouvert43,0 %19 septembre 2024Auto-déclaré
5Qwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert34,0 %19 septembre 2024Auto-déclaré
6Qwen2 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert25,3 %23 juillet 2024Auto-déclaré

Classement établi sur 6 modèles évalués. Score médian de l'ensemble : 43,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle identifie et applique correctement des théorèmes sur une proportion importante des questions, selon la métrique d’accuracy. Il reflète donc à la fois la sélection du bon principe, l’exécution du raisonnement et la production de la réponse attendue. La lecture des résultats exige toutefois de la prudence, car les scores disponibles sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. L’accès public au jeu invite également à considérer un risque de contamination lors de l’interprétation des performances. Avec un meilleur score de 44 % pour Qwen2 72B Instruct et une médiane de 43 % parmi les six modèles évalués, le classement apparaît très resserré. Cet écart limité réduit la portée des comparaisons fines, tandis que le niveau atteint ne signale pas une saturation du benchmark. Enfin, TheoremQA mesure un périmètre ciblé : des problèmes universitaires en anglais, principalement à réponses numériques ou symboliques, dans les disciplines scientifiques et financières couvertes.


Sources des scores : llm-stats.