CodeForces
CodeForces est un benchmark de programmation compétitive construit à partir de problèmes issus de la plateforme Codeforces, sa créatrice. Il confronte les modèles à des énoncés algorithmiques complexes couvrant notamment la programmation dynamique, les graphes, les structures de données…
CodeForces est un benchmark de programmation compétitive construit à partir de problèmes issus de la plateforme Codeforces, sa créatrice. Il confronte les modèles à des énoncés algorithmiques complexes couvrant notamment la programmation dynamique, les graphes, les structures de données et les problèmes mathématiques.
Son objectif est d’évaluer conjointement la compréhension des consignes, la conception d’algorithmes efficaces et la génération de code correct. L’exécution des solutions sur des tests, notamment par soumission directe à la plateforme, en fait un outil d’évaluation pratique des capacités de résolution algorithmique des modèles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Plateforme Codeforces (programmation compétitive) |
| Capacités mesurées | Compréhension d'énoncés complexes, conception d'algorithmes efficaces (programmation dynamique, graphes, structures de données) et génération de code correct. |
| Modalité | Texte |
| Type de questions | Génération de code algorithmique (problèmes de concours, difficulté ~800-2400) |
| Métrique d'évaluation | Taux de réussite des tests / rating Elo (selon l'implémentation) |
| Accès | Public |
| Licence | propriétaire |
| Langues | Énoncés en anglais ; code (C++, Python, etc.) |
| Taille du jeu | Variable selon l'implémentation (ex. CodeElo : 387 problèmes) |
| Ressources | Site / dépôt officiel |
Classement des modèles (16)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 100,0 % | 23 avril 2026 | Auto-déclaré |
| 2 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 100,0 % | 23 avril 2026 | Auto-déclaré |
| 3 | DeepSeek-V3.2-Speciale | DeepSeek | 🟢 Ouvert | 90,0 % | 1 décembre 2025 | Auto-déclaré |
| 4 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,1 % | 24 février 2026 | Auto-déclaré |
| 5 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,2 % | 24 février 2026 | Auto-déclaré |
| 6 | GPT OSS 120B | OpenAI | 🟢 Ouvert | 82,1 % | 5 août 2025 | Auto-déclaré |
| 7 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,7 % | 24 février 2026 | Auto-déclaré |
| 8 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 79,5 % | 1 décembre 2025 | Auto-déclaré |
| 9 | DeepSeek-V3.2 (Thinking) | DeepSeek | 🟢 Ouvert | 79,5 % | 1 décembre 2025 | Auto-déclaré |
| 10 | GPT OSS 20B | OpenAI | 🟢 Ouvert | 74,3 % | 5 août 2025 | Auto-déclaré |
| 11 | DeepSeek-V3.2-Exp | DeepSeek | 🟢 Ouvert | 70,7 % | 29 septembre 2025 | Auto-déclaré |
| 12 | DeepSeek-V3.1 | DeepSeek | 🟢 Ouvert | 69,7 % | 10 janvier 2025 | Auto-déclaré |
| 13 | Qwen3 32B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,9 % | 29 avril 2025 | Auto-déclaré |
| 14 | DeepSeek-R1-0528 | DeepSeek | 🟢 Ouvert | 64,3 % | 28 mai 2025 | Auto-déclaré |
| 15 | Gemma 4 12B | 🟢 Ouvert | 55,3 % | 23 mai 2026 | Auto-déclaré | |
| 16 | DiffusionGemma 26B-A4B | 🟢 Ouvert | 47,6 % | 10 juin 2026 | Auto-déclaré |
Classement établi sur 16 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 79,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle produit fréquemment des solutions capables de réussir les tests associés à des problèmes de concours de difficulté variée. Il reflète donc à la fois l’analyse de l’énoncé, le choix d’un algorithme adapté et la correction du code généré. L’évaluation par exécution constitue un critère plus concret qu’une appréciation textuelle, mais la fiabilité comparative reste à nuancer, car les scores recensés sont majoritairement auto-déclarés par les éditeurs et la métrique dépend de l’implémentation, entre taux de réussite et rating Elo.
Le résultat maximal de DeepSeek-V4-Flash-Max signale une possible saturation sur l’implémentation considérée, ce qui réduit la capacité à départager les modèles les plus performants. Le caractère public des problèmes Codeforces crée aussi un risque de contamination par exposition préalable, susceptible de mêler mémorisation et généralisation. Enfin, la portée demeure centrée sur la programmation algorithmique compétitive et ne représente pas, à elle seule, l’ensemble des usages du développement logiciel. Avec 16 modèles et une médiane de 80 %, le classement révèle un niveau globalement élevé, tout en laissant apparaître un avantage net au meilleur modèle.
Sources des scores : llm-stats.