CSimpleQA
CSimpleQA est un benchmark publié en 2024 par Alibaba Group, sous l’équipe OpenStellarTeam. Il évalue la factualité des modèles de langage à travers des questions courtes portant sur la connaissance en chinois.
CSimpleQA est un benchmark publié en 2024 par Alibaba Group, sous l’équipe OpenStellarTeam. Il évalue la factualité des modèles de langage à travers des questions courtes portant sur la connaissance en chinois.
Présenté comme le premier benchmark chinois complet consacré à cette capacité, il couvre des sujets relevant notamment des sciences humaines, des sciences, de l’ingénierie, de la culture et de la société. Son rôle est de mesurer la capacité d’un modèle à produire une réponse factuelle concise plutôt qu’à développer un raisonnement long.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Alibaba Group (OpenStellarTeam) |
| Capacités mesurées | Factualité / connaissance en chinois, capacité à répondre à des questions factuelles courtes |
| Modalité | Texte |
| Type de questions | questions-réponses courtes (évaluation de factualité) |
| Métrique d'évaluation | notation par juge LLM (style SimpleQA via API OpenAI : correct/incorrect/non tenté, F-score) |
| Accès | Public |
| Langues | chinois |
| Taille du jeu | 3 000 questions (6 thèmes majeurs, 99 sous-thèmes) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 84,4 % | 23 avril 2026 | Auto-déclaré |
| 2 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,3 % | 22 juillet 2025 | Auto-déclaré |
| 3 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,4 % | 22 septembre 2025 | Auto-déclaré |
| 4 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 78,9 % | 23 avril 2026 | Auto-déclaré |
| 5 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 78,4 % | 11 juillet 2025 | Auto-déclaré |
| 6 | Kimi K2 Base | Moonshot AI | 🟢 Ouvert | 77,6 % | 11 juillet 2025 | Auto-déclaré |
| 7 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 64,8 % | 25 décembre 2024 | Auto-déclaré |
Classement établi sur 7 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 78,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur CSimpleQA indique qu’un modèle répond correctement à une large part des questions factuelles courtes en chinois, tout en limitant les réponses incorrectes et les questions non tentées. L’évaluation repose sur un juge LLM, selon un protocole inspiré de SimpleQA utilisant une API OpenAI, avec les catégories correct, incorrect et non tenté, puis un F-score. Cette méthode fournit un cadre homogène, mais la fiabilité comparative doit être nuancée puisque les résultats de la base sont majoritairement auto-déclarés par les éditeurs.
Le score médian de 79 % et le meilleur résultat de 84 %, obtenu par DeepSeek-V4-Pro-Max, montrent des performances déjà élevées parmi les sept modèles recensés. Cet écart limité peut réduire le pouvoir discriminant du benchmark à mesure que les scores progressent, ce qui constitue un risque de saturation. Son accès public appelle aussi à considérer le risque de contamination lors de l’interprétation des résultats. Enfin, le classement renseigne spécifiquement sur la factualité en chinois et sur des réponses courtes. Il ne mesure pas, à lui seul, des capacités plus générales ou des réponses longues.
Sources des scores : llm-stats.