SciCode
SciCode est un benchmark de codage scientifique de recherche conçu par SciCode-bench, une collaboration académique réunissant plusieurs institutions. Élaboré par des scientifiques, il soumet les modèles de langage à des problèmes issus de plusieurs sous-domaines des sciences naturelles,…
SciCode est un benchmark de codage scientifique de recherche conçu par SciCode-bench, une collaboration académique réunissant plusieurs institutions. Élaboré par des scientifiques, il soumet les modèles de langage à des problèmes issus de plusieurs sous-domaines des sciences naturelles, notamment les mathématiques, la physique, la chimie, la biologie et la science des matériaux.
Chaque problème est décomposé en sous-problèmes nécessitant rappel de connaissances, raisonnement et synthèse de code. SciCode sert ainsi à évaluer la capacité des modèles à produire des solutions programmatiques fonctionnelles face à des tâches scientifiques exigeantes.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | SciCode-bench (collaboration académique multi-institutions) |
| Capacités mesurées | Codage scientifique de recherche, rappel de connaissances, raisonnement, synthèse de code dans 16 sous-domaines des sciences naturelles (maths, physique, chimie, biologie, science des matériaux) |
| Modalité | Texte |
| Type de questions | génération de code pour problèmes scientifiques (décomposés en sous-problèmes) |
| Métrique d'évaluation | taux de réussite (pass rate) au niveau des sous-problèmes et des problèmes principaux, via cas de test |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 80 problèmes principaux, 338 sous-problèmes |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (18)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 59,8 % | 24 juin 2026 | Auto-déclaré |
| 2 | Gemini 3.1 Pro Preview | ▫ n.d. | 59,0 % | 19 février 2026 | Auto-déclaré | |
| 3 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 57,8 % | 24 juin 2026 | Auto-déclaré |
| 4 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 53,5 % | 19 mai 2026 | Auto-déclaré |
| 5 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 52,2 % | 20 avril 2026 | Auto-déclaré |
| 6 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 51,3 % | 31 mai 2026 | Auto-déclaré |
| 7 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 48,7 % | 27 janvier 2026 | Auto-déclaré |
| 8 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 44,8 % | 5 septembre 2025 | Auto-déclaré |
| 9 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 44,6 % | 4 juin 2026 | Auto-déclaré |
| 10 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 42,0 % | 11 mars 2026 | Auto-déclaré |
| 11 | GLM-4.5 | Zhipu AI | 🟢 Ouvert | 41,7 % | 28 juillet 2025 | Auto-déclaré |
| 12 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 39,0 % | 23 décembre 2025 | Auto-déclaré |
| 13 | North Mini Code 1.0 | Cohere | 🟢 Ouvert | 38,2 % | 9 juin 2026 | Auto-déclaré |
| 14 | Command A+ | Cohere | 🟢 Ouvert | 38,0 % | 20 mai 2026 | Auto-déclaré |
| 15 | Mercury 2 | Inception | 🔒 Propriétaire | 38,0 % | 24 février 2026 | Auto-déclaré |
| 16 | GLM-4.5-Air | Zhipu AI | 🟢 Ouvert | 37,3 % | 28 juillet 2025 | Auto-déclaré |
| 17 | MiniMax M2 | MiniMax | 🟢 Ouvert | 36,0 % | 27 octobre 2025 | Auto-déclaré |
| 18 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 33,3 % | 15 décembre 2025 | Auto-déclaré |
Classement établi sur 18 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 43,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur SciCode signifie qu’un modèle réussit une proportion importante de cas de test, aussi bien pour les sous-problèmes que pour les problèmes principaux. Il traduit donc une combinaison efficace de connaissances scientifiques, de raisonnement et de génération de code correct. L’évaluation par cas de test apporte un critère fonctionnel mesurable, mais la fiabilité comparative doit être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun.
Le classement montre une difficulté encore marquée pour les modèles évalués. Seed 2.1 Pro arrive en tête avec 60 %, tandis que la médiane des 18 modèles s’établit à 43 %. Cet écart indique une hiérarchie réelle, sans signal de saturation complète au sommet. La portée reste centrée sur des problèmes en anglais couvrant 16 sous-domaines des sciences naturelles, et les résultats ne caractérisent donc que ce cadre. Enfin, l’accès public facilite l’usage et la reproductibilité du benchmark, mais impose de considérer le risque de contamination lors de l’interprétation de performances futures.
Sources des scores : llm-stats.