CSimpleQA

CSimpleQA est un benchmark publié en 2024 par Alibaba Group, sous l’équipe OpenStellarTeam. Il évalue la factualité des modèles de langage à travers des questions courtes portant sur la connaissance en chinois.

CSimpleQA est un benchmark publié en 2024 par Alibaba Group, sous l’équipe OpenStellarTeam. Il évalue la factualité des modèles de langage à travers des questions courtes portant sur la connaissance en chinois.

Présenté comme le premier benchmark chinois complet consacré à cette capacité, il couvre des sujets relevant notamment des sciences humaines, des sciences, de l’ingénierie, de la culture et de la société. Son rôle est de mesurer la capacité d’un modèle à produire une réponse factuelle concise plutôt qu’à développer un raisonnement long.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAlibaba Group (OpenStellarTeam)
Capacités mesuréesFactualité / connaissance en chinois, capacité à répondre à des questions factuelles courtes
ModalitéTexte
Type de questionsquestions-réponses courtes (évaluation de factualité)
Métrique d'évaluationnotation par juge LLM (style SimpleQA via API OpenAI : correct/incorrect/non tenté, F-score)
AccèsPublic
Langueschinois
Taille du jeu3 000 questions (6 thèmes majeurs, 99 sous-thèmes)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert84,4 %23 avril 2026Auto-déclaré
2Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert84,3 %22 juillet 2025Auto-déclaré
3Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,4 %22 septembre 2025Auto-déclaré
4DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert78,9 %23 avril 2026Auto-déclaré
5Kimi K2 InstructMoonshot AI🟢 Ouvert78,4 %11 juillet 2025Auto-déclaré
6Kimi K2 BaseMoonshot AI🟢 Ouvert77,6 %11 juillet 2025Auto-déclaré
7DeepSeek-V3DeepSeek🟢 Ouvert64,8 %25 décembre 2024Auto-déclaré

Classement établi sur 7 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 78,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur CSimpleQA indique qu’un modèle répond correctement à une large part des questions factuelles courtes en chinois, tout en limitant les réponses incorrectes et les questions non tentées. L’évaluation repose sur un juge LLM, selon un protocole inspiré de SimpleQA utilisant une API OpenAI, avec les catégories correct, incorrect et non tenté, puis un F-score. Cette méthode fournit un cadre homogène, mais la fiabilité comparative doit être nuancée puisque les résultats de la base sont majoritairement auto-déclarés par les éditeurs.

Le score médian de 79 % et le meilleur résultat de 84 %, obtenu par DeepSeek-V4-Pro-Max, montrent des performances déjà élevées parmi les sept modèles recensés. Cet écart limité peut réduire le pouvoir discriminant du benchmark à mesure que les scores progressent, ce qui constitue un risque de saturation. Son accès public appelle aussi à considérer le risque de contamination lors de l’interprétation des résultats. Enfin, le classement renseigne spécifiquement sur la factualité en chinois et sur des réponses courtes. Il ne mesure pas, à lui seul, des capacités plus générales ou des réponses longues.


Sources des scores : llm-stats.