SciCode

SciCode est un benchmark de codage scientifique de recherche conçu par SciCode-bench, une collaboration académique réunissant plusieurs institutions. Élaboré par des scientifiques, il soumet les modèles de langage à des problèmes issus de plusieurs sous-domaines des sciences naturelles,…

SciCode est un benchmark de codage scientifique de recherche conçu par SciCode-bench, une collaboration académique réunissant plusieurs institutions. Élaboré par des scientifiques, il soumet les modèles de langage à des problèmes issus de plusieurs sous-domaines des sciences naturelles, notamment les mathématiques, la physique, la chimie, la biologie et la science des matériaux.

Chaque problème est décomposé en sous-problèmes nécessitant rappel de connaissances, raisonnement et synthèse de code. SciCode sert ainsi à évaluer la capacité des modèles à produire des solutions programmatiques fonctionnelles face à des tâches scientifiques exigeantes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkSciCode-bench (collaboration académique multi-institutions)
Capacités mesuréesCodage scientifique de recherche, rappel de connaissances, raisonnement, synthèse de code dans 16 sous-domaines des sciences naturelles (maths, physique, chimie, biologie, science des matériaux)
ModalitéTexte
Type de questionsgénération de code pour problèmes scientifiques (décomposés en sous-problèmes)
Métrique d'évaluationtaux de réussite (pass rate) au niveau des sous-problèmes et des problèmes principaux, via cas de test
AccèsPublic
Languesanglais
Taille du jeu80 problèmes principaux, 338 sous-problèmes
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (18)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Seed 2.1 ProByteDance🔒 Propriétaire59,8 %24 juin 2026Auto-déclaré
2Gemini 3.1 Pro PreviewGoogle▫ n.d.59,0 %19 février 2026Auto-déclaré
3Seed 2.1 TurboByteDance🔒 Propriétaire57,8 %24 juin 2026Auto-déclaré
4Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire53,5 %19 mai 2026Auto-déclaré
5Kimi K2.6Moonshot AI🟢 Ouvert52,2 %20 avril 2026Auto-déclaré
6Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire51,3 %31 mai 2026Auto-déclaré
7Kimi K2.5Moonshot AI🟢 Ouvert48,7 %27 janvier 2026Auto-déclaré
8Kimi K2 0905Moonshot AI🔒 Propriétaire44,8 %5 septembre 2025Auto-déclaré
9Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert44,6 %4 juin 2026Auto-déclaré
10Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert42,0 %11 mars 2026Auto-déclaré
11GLM-4.5Zhipu AI🟢 Ouvert41,7 %28 juillet 2025Auto-déclaré
12MiniMax M2.1MiniMax🟢 Ouvert39,0 %23 décembre 2025Auto-déclaré
13North Mini Code 1.0Cohere🟢 Ouvert38,2 %9 juin 2026Auto-déclaré
14Command A+Cohere🟢 Ouvert38,0 %20 mai 2026Auto-déclaré
15Mercury 2Inception🔒 Propriétaire38,0 %24 février 2026Auto-déclaré
16GLM-4.5-AirZhipu AI🟢 Ouvert37,3 %28 juillet 2025Auto-déclaré
17MiniMax M2MiniMax🟢 Ouvert36,0 %27 octobre 2025Auto-déclaré
18Nemotron 3 Nano (30B A3B)NVIDIA🟢 Ouvert33,3 %15 décembre 2025Auto-déclaré

Classement établi sur 18 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 43,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur SciCode signifie qu’un modèle réussit une proportion importante de cas de test, aussi bien pour les sous-problèmes que pour les problèmes principaux. Il traduit donc une combinaison efficace de connaissances scientifiques, de raisonnement et de génération de code correct. L’évaluation par cas de test apporte un critère fonctionnel mesurable, mais la fiabilité comparative doit être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun.

Le classement montre une difficulté encore marquée pour les modèles évalués. Seed 2.1 Pro arrive en tête avec 60 %, tandis que la médiane des 18 modèles s’établit à 43 %. Cet écart indique une hiérarchie réelle, sans signal de saturation complète au sommet. La portée reste centrée sur des problèmes en anglais couvrant 16 sous-domaines des sciences naturelles, et les résultats ne caractérisent donc que ce cadre. Enfin, l’accès public facilite l’usage et la reproductibilité du benchmark, mais impose de considérer le risque de contamination lors de l’interprétation de performances futures.


Sources des scores : llm-stats.