OJBench

OJBench est un benchmark de raisonnement de code de niveau compétition, créé par BUPT et Moonshot AI. Il soumet les modèles à des problèmes issus de la programmation compétitive, dont les solutions générées en Python ou en C++ sont vérifiées par un juge en ligne.

OJBench est un benchmark de raisonnement de code de niveau compétition, créé par BUPT et Moonshot AI. Il soumet les modèles à des problèmes issus de la programmation compétitive, dont les solutions générées en Python ou en C++ sont vérifiées par un juge en ligne.

Son objectif est d’évaluer la capacité des grands modèles de langage à élaborer des algorithmes avancés et à produire un code effectivement accepté. La répartition des problèmes par difficulté permet d’observer les performances au-delà d’un score global.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBUPT & Moonshot AI
Capacités mesuréesRaisonnement de code de niveau compétition (algorithmique avancée)
ModalitéTexte
Type de questionsprogrammation compétitive (génération de code jugée par un juge en ligne / online judge)
Métrique d'évaluationtaux de résolution (acceptation via online judge), par difficulté
AccèsPublic
LanguesPython et C++ (énoncés bilingues)
Taille du jeu232 problèmes (NOI + ICPC), niveaux Facile/Moyen/Difficile
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (9)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K2.6Moonshot AI🟢 Ouvert60,6 %20 avril 2026Auto-déclaré
2Kimi K2 0905Moonshot AI🔒 Propriétaire48,7 %5 septembre 2025Auto-déclaré
3Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert40,1 %24 février 2026Auto-déclaré
4Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert39,5 %24 février 2026Auto-déclaré
5Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert36,0 %24 février 2026Auto-déclaré
6Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert32,5 %25 juillet 2025Auto-déclaré
7Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert29,7 %10 septembre 2025Auto-déclaré
8Kimi K2 InstructMoonshot AI🟢 Ouvert27,1 %11 juillet 2025Auto-déclaré
9Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert27,1 %5 septembre 2025Auto-déclaré

Classement établi sur 9 modèles évalués. Score médian de l'ensemble : 36,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur OJBench indique qu’un modèle résout fréquemment des problèmes de compétition en produisant du code accepté par l’online judge. Cette validation par exécution apporte un critère plus rigoureux qu’une appréciation textuelle, puisque la solution doit satisfaire les tests du juge. La fiabilité comparative reste toutefois à nuancer, car les scores recensés sont majoritairement auto-déclarés par les éditeurs.

Avec un score médian de 36 % parmi les neuf modèles évalués et un meilleur résultat de 61 % pour Kimi K2.6, le classement fait apparaître une avance nette en tête, mais aussi une marge de progression importante. Il ne semble donc pas saturé dans cette sélection. Sa portée demeure ciblée sur le raisonnement algorithmique de compétition, à partir de problèmes NOI et ICPC, et ne représente pas l’ensemble des compétences de programmation. Enfin, son accès public peut favoriser une contamination des évaluations si les problèmes ou leurs solutions se retrouvent dans les données utilisées par les modèles.


Sources des scores : llm-stats.