OJBench
OJBench est un benchmark de raisonnement de code de niveau compétition, créé par BUPT et Moonshot AI. Il soumet les modèles à des problèmes issus de la programmation compétitive, dont les solutions générées en Python ou en C++ sont vérifiées par un juge en ligne.
OJBench est un benchmark de raisonnement de code de niveau compétition, créé par BUPT et Moonshot AI. Il soumet les modèles à des problèmes issus de la programmation compétitive, dont les solutions générées en Python ou en C++ sont vérifiées par un juge en ligne.
Son objectif est d’évaluer la capacité des grands modèles de langage à élaborer des algorithmes avancés et à produire un code effectivement accepté. La répartition des problèmes par difficulté permet d’observer les performances au-delà d’un score global.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | BUPT & Moonshot AI |
| Capacités mesurées | Raisonnement de code de niveau compétition (algorithmique avancée) |
| Modalité | Texte |
| Type de questions | programmation compétitive (génération de code jugée par un juge en ligne / online judge) |
| Métrique d'évaluation | taux de résolution (acceptation via online judge), par difficulté |
| Accès | Public |
| Langues | Python et C++ (énoncés bilingues) |
| Taille du jeu | 232 problèmes (NOI + ICPC), niveaux Facile/Moyen/Difficile |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (9)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 60,6 % | 20 avril 2026 | Auto-déclaré |
| 2 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 48,7 % | 5 septembre 2025 | Auto-déclaré |
| 3 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 40,1 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 39,5 % | 24 février 2026 | Auto-déclaré |
| 5 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 36,0 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 32,5 % | 25 juillet 2025 | Auto-déclaré |
| 7 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 29,7 % | 10 septembre 2025 | Auto-déclaré |
| 8 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 27,1 % | 11 juillet 2025 | Auto-déclaré |
| 9 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 27,1 % | 5 septembre 2025 | Auto-déclaré |
Classement établi sur 9 modèles évalués. Score médian de l'ensemble : 36,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur OJBench indique qu’un modèle résout fréquemment des problèmes de compétition en produisant du code accepté par l’online judge. Cette validation par exécution apporte un critère plus rigoureux qu’une appréciation textuelle, puisque la solution doit satisfaire les tests du juge. La fiabilité comparative reste toutefois à nuancer, car les scores recensés sont majoritairement auto-déclarés par les éditeurs.
Avec un score médian de 36 % parmi les neuf modèles évalués et un meilleur résultat de 61 % pour Kimi K2.6, le classement fait apparaître une avance nette en tête, mais aussi une marge de progression importante. Il ne semble donc pas saturé dans cette sélection. Sa portée demeure ciblée sur le raisonnement algorithmique de compétition, à partir de problèmes NOI et ICPC, et ne représente pas l’ensemble des compétences de programmation. Enfin, son accès public peut favoriser une contamination des évaluations si les problèmes ou leurs solutions se retrouvent dans les données utilisées par les modèles.
Sources des scores : llm-stats.