CodeForces

CodeForces est un benchmark de programmation compétitive construit à partir de problèmes issus de la plateforme Codeforces, sa créatrice. Il confronte les modèles à des énoncés algorithmiques complexes couvrant notamment la programmation dynamique, les graphes, les structures de données…

CodeForces est un benchmark de programmation compétitive construit à partir de problèmes issus de la plateforme Codeforces, sa créatrice. Il confronte les modèles à des énoncés algorithmiques complexes couvrant notamment la programmation dynamique, les graphes, les structures de données et les problèmes mathématiques.

Son objectif est d’évaluer conjointement la compréhension des consignes, la conception d’algorithmes efficaces et la génération de code correct. L’exécution des solutions sur des tests, notamment par soumission directe à la plateforme, en fait un outil d’évaluation pratique des capacités de résolution algorithmique des modèles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkPlateforme Codeforces (programmation compétitive)
Capacités mesuréesCompréhension d'énoncés complexes, conception d'algorithmes efficaces (programmation dynamique, graphes, structures de données) et génération de code correct.
ModalitéTexte
Type de questionsGénération de code algorithmique (problèmes de concours, difficulté ~800-2400)
Métrique d'évaluationTaux de réussite des tests / rating Elo (selon l'implémentation)
AccèsPublic
Licencepropriétaire
LanguesÉnoncés en anglais ; code (C++, Python, etc.)
Taille du jeuVariable selon l'implémentation (ex. CodeElo : 387 problèmes)
RessourcesSite / dépôt officiel

Classement des modèles (16)

#ModèleÉditeurLicenceScoreSortieFiabilité
1DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert100,0 %23 avril 2026Auto-déclaré
2DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert100,0 %23 avril 2026Auto-déclaré
3DeepSeek-V3.2-SpecialeDeepSeek🟢 Ouvert90,0 %1 décembre 2025Auto-déclaré
4Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert85,1 %24 février 2026Auto-déclaré
5Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert82,2 %24 février 2026Auto-déclaré
6GPT OSS 120BOpenAI🟢 Ouvert82,1 %5 août 2025Auto-déclaré
7Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert80,7 %24 février 2026Auto-déclaré
8DeepSeek-V3.2DeepSeek🟢 Ouvert79,5 %1 décembre 2025Auto-déclaré
9DeepSeek-V3.2 (Thinking)DeepSeek🟢 Ouvert79,5 %1 décembre 2025Auto-déclaré
10GPT OSS 20BOpenAI🟢 Ouvert74,3 %5 août 2025Auto-déclaré
11DeepSeek-V3.2-ExpDeepSeek🟢 Ouvert70,7 %29 septembre 2025Auto-déclaré
12DeepSeek-V3.1DeepSeek🟢 Ouvert69,7 %10 janvier 2025Auto-déclaré
13Qwen3 32BAlibaba Cloud / Qwen Team🟢 Ouvert65,9 %29 avril 2025Auto-déclaré
14DeepSeek-R1-0528DeepSeek🟢 Ouvert64,3 %28 mai 2025Auto-déclaré
15Gemma 4 12BGoogle🟢 Ouvert55,3 %23 mai 2026Auto-déclaré
16DiffusionGemma 26B-A4BGoogle🟢 Ouvert47,6 %10 juin 2026Auto-déclaré

Classement établi sur 16 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 79,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle produit fréquemment des solutions capables de réussir les tests associés à des problèmes de concours de difficulté variée. Il reflète donc à la fois l’analyse de l’énoncé, le choix d’un algorithme adapté et la correction du code généré. L’évaluation par exécution constitue un critère plus concret qu’une appréciation textuelle, mais la fiabilité comparative reste à nuancer, car les scores recensés sont majoritairement auto-déclarés par les éditeurs et la métrique dépend de l’implémentation, entre taux de réussite et rating Elo.

Le résultat maximal de DeepSeek-V4-Flash-Max signale une possible saturation sur l’implémentation considérée, ce qui réduit la capacité à départager les modèles les plus performants. Le caractère public des problèmes Codeforces crée aussi un risque de contamination par exposition préalable, susceptible de mêler mémorisation et généralisation. Enfin, la portée demeure centrée sur la programmation algorithmique compétitive et ne représente pas, à elle seule, l’ensemble des usages du développement logiciel. Avec 16 modèles et une médiane de 80 %, le classement révèle un niveau globalement élevé, tout en laissant apparaître un avantage net au meilleur modèle.


Sources des scores : llm-stats.