C-Eval

C-Eval est une suite d’évaluation en chinois conçue par Y. Huang et al., au sein de HKUST NLP et avec plusieurs collaborateurs. Elle examine les connaissances disciplinaires et les capacités de raisonnement de modèles de fondation dans un contexte éducatif et professionnel chinois.

C-Eval est une suite d’évaluation en chinois conçue par Y. Huang et al., au sein de HKUST NLP et avec plusieurs collaborateurs. Elle examine les connaissances disciplinaires et les capacités de raisonnement de modèles de fondation dans un contexte éducatif et professionnel chinois.

Ses QCM couvrent les sciences humaines, les sciences et l’ingénierie, à plusieurs niveaux de difficulté. C-Eval Hard rassemble des matières particulièrement exigeantes en raisonnement avancé. Le benchmark sert ainsi à comparer la maîtrise de contenus académiques et spécialisés par différents modèles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkY. Huang et al. (HKUST NLP et collaborateurs)
Capacités mesuréesgénéraliste, raisonnement
ModalitéTexte
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsJeu de test privé (réponses non divulguées)
LicenceCC BY-NC-SA 4.0
Langueschinois
Taille du jeu13 948 questions à choix multiples dans 52 disciplines
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (18)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire93,3 %31 mars 2026Auto-déclaré
2Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert93,0 %16 février 2026Auto-déclaré
3Kimi K2 BaseMoonshot AI🟢 Ouvert92,5 %11 juillet 2025Auto-déclaré
4Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert91,9 %24 février 2026Auto-déclaré
5MiMo-V2.5-ProXiaomi🟢 Ouvert91,5 %27 avril 2026Auto-déclaré
6Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert91,4 %21 avril 2026Auto-déclaré
7Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert90,5 %24 février 2026Auto-déclaré
8Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert90,2 %24 février 2026Auto-déclaré
9Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert90,0 %16 avril 2026Auto-déclaré
10Kimi-k1.5Moonshot AI🔒 Propriétaire88,3 %20 janvier 2025Auto-déclaré
11Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert88,2 %2 mars 2026Auto-déclaré
12DeepSeek-V3DeepSeek🟢 Ouvert86,5 %25 décembre 2024Auto-déclaré
13Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert85,1 %2 mars 2026Auto-déclaré
14Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,8 %23 juillet 2024Auto-déclaré
15Qwen2 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert77,2 %23 juillet 2024Auto-déclaré
16Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert73,2 %2 mars 2026Auto-déclaré
17Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert50,5 %2 mars 2026Auto-déclaré
18ERNIE 4.5Baidu🔒 Propriétaire40,7 %25 juin 2025Auto-déclaré

Classement établi sur 18 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 89,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur C-Eval indique une forte proportion de réponses correctes à des QCM disciplinaires en chinois, y compris dans des domaines demandant des connaissances avancées et du raisonnement. Il ne résume toutefois pas l’ensemble des capacités d’un modèle, car la portée reste centrée sur ce format, ces disciplines et le contexte chinois. Avec une médiane de 89 % parmi les 18 modèles recensés et un meilleur résultat de 93 % pour Qwen3.6 Plus, le classement montre des performances globalement élevées et un écart réduit entre le centre de l’ensemble et la première place. Cette concentration suggère un risque de saturation, qui peut limiter le pouvoir discriminant du benchmark pour les modèles les plus performants. Le jeu de test privé et la non-divulgation des réponses renforcent la protection contre une contamination directe par les corrigés. La rigueur comparative doit néanmoins être nuancée, puisque les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique.


Sources des scores : llm-stats.