C-Eval
C-Eval est une suite d’évaluation en chinois conçue par Y. Huang et al., au sein de HKUST NLP et avec plusieurs collaborateurs. Elle examine les connaissances disciplinaires et les capacités de raisonnement de modèles de fondation dans un contexte éducatif et professionnel chinois.
C-Eval est une suite d’évaluation en chinois conçue par Y. Huang et al., au sein de HKUST NLP et avec plusieurs collaborateurs. Elle examine les connaissances disciplinaires et les capacités de raisonnement de modèles de fondation dans un contexte éducatif et professionnel chinois.
Ses QCM couvrent les sciences humaines, les sciences et l’ingénierie, à plusieurs niveaux de difficulté. C-Eval Hard rassemble des matières particulièrement exigeantes en raisonnement avancé. Le benchmark sert ainsi à comparer la maîtrise de contenus académiques et spécialisés par différents modèles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Y. Huang et al. (HKUST NLP et collaborateurs) |
| Capacités mesurées | généraliste, raisonnement |
| Modalité | Texte |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Jeu de test privé (réponses non divulguées) |
| Licence | CC BY-NC-SA 4.0 |
| Langues | chinois |
| Taille du jeu | 13 948 questions à choix multiples dans 52 disciplines |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (18)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 93,3 % | 31 mars 2026 | Auto-déclaré |
| 2 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,0 % | 16 février 2026 | Auto-déclaré |
| 3 | Kimi K2 Base | Moonshot AI | 🟢 Ouvert | 92,5 % | 11 juillet 2025 | Auto-déclaré |
| 4 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,9 % | 24 février 2026 | Auto-déclaré |
| 5 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 91,5 % | 27 avril 2026 | Auto-déclaré |
| 6 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,4 % | 21 avril 2026 | Auto-déclaré |
| 7 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,5 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,2 % | 24 février 2026 | Auto-déclaré |
| 9 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,0 % | 16 avril 2026 | Auto-déclaré |
| 10 | Kimi-k1.5 | Moonshot AI | 🔒 Propriétaire | 88,3 % | 20 janvier 2025 | Auto-déclaré |
| 11 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,2 % | 2 mars 2026 | Auto-déclaré |
| 12 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 86,5 % | 25 décembre 2024 | Auto-déclaré |
| 13 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,1 % | 2 mars 2026 | Auto-déclaré |
| 14 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,8 % | 23 juillet 2024 | Auto-déclaré |
| 15 | Qwen2 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,2 % | 23 juillet 2024 | Auto-déclaré |
| 16 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,2 % | 2 mars 2026 | Auto-déclaré |
| 17 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 50,5 % | 2 mars 2026 | Auto-déclaré |
| 18 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 40,7 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 18 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 89,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur C-Eval indique une forte proportion de réponses correctes à des QCM disciplinaires en chinois, y compris dans des domaines demandant des connaissances avancées et du raisonnement. Il ne résume toutefois pas l’ensemble des capacités d’un modèle, car la portée reste centrée sur ce format, ces disciplines et le contexte chinois. Avec une médiane de 89 % parmi les 18 modèles recensés et un meilleur résultat de 93 % pour Qwen3.6 Plus, le classement montre des performances globalement élevées et un écart réduit entre le centre de l’ensemble et la première place. Cette concentration suggère un risque de saturation, qui peut limiter le pouvoir discriminant du benchmark pour les modèles les plus performants. Le jeu de test privé et la non-divulgation des réponses renforcent la protection contre une contamination directe par les corrigés. La rigueur comparative doit néanmoins être nuancée, puisque les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique.
Sources des scores : llm-stats.