Chinese
MTEB: Chinese est un benchmark communautaire de MTEB / embeddings-benchmark, constitué à partir du sous-ensemble chinois C-MTEB de BAAI/FlagEmbedding. Il évalue la qualité des embeddings de textes en chinois dans plusieurs familles de tâches.
MTEB: Chinese est un benchmark communautaire de MTEB / embeddings-benchmark, constitué à partir du sous-ensemble chinois C-MTEB de BAAI/FlagEmbedding. Il évalue la qualité des embeddings de textes en chinois dans plusieurs familles de tâches.
Son périmètre couvre notamment la recherche, le reranking, la classification, le clustering et la similarité sémantique. Cette diversité permet de comparer la capacité des modèles à produire des représentations textuelles utiles dans différents contextes, plutôt que sur un usage unique.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MTEB / embeddings-benchmark (communauté) — sous-ensemble chinois issu de C-MTEB (BAAI/FlagEmbedding) |
| Capacités mesurées | Qualité des embeddings de texte en chinois à travers recherche, reranking, classification de paires, clustering, classification et similarité sémantique |
| Modalité | Texte |
| Type de questions | tâches d'embedding de texte (retrieval, reranking, pair classification, clustering, classification, STS) |
| Métrique d'évaluation | score principal par tâche (ex. nDCG@10, accuracy, corrélation de Spearman) moyenné |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | chinois (cmn) |
| Taille du jeu | ~35 jeux de données chinois (C-MTEB) |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (58)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kingsoft-LLM/QZhou-Embedding-Zh | Kingsoft-LLM | 🟢 Ouvert | 78,5 % | 28 septembre 2025 | ✅ Mesuré |
| 2 | tencent/Youtu-Embedding | Tencent | 🟢 Ouvert | 77,6 % | 28 septembre 2025 | ✅ Mesuré |
| 3 | Kingsoft-LLM/QZhou-Embedding | Kingsoft-LLM | 🟢 Ouvert | 77,0 % | 24 août 2025 | ✅ Mesuré |
| 4 | Bytedance/Seed1.6-embedding | ByteDance | 🟢 Ouvert | 75,6 % | 18 juin 2025 | ✅ Mesuré |
| 5 | ByteDance-Seed/Seed1.5-Embedding | ByteDance Seed | 🟢 Ouvert | 74,9 % | 25 avril 2025 | ✅ Mesuré |
| 6 | TencentBAC/Conan-embedding-v2 | Tencent | 🟢 Ouvert | 74,2 % | 10 avril 2025 | ✅ Mesuré |
| 7 | Qwen: Qwen3 Embedding 8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,9 % | 28 octobre 2025 | ✅ Mesuré |
| 8 | infgrad/Jasper-Token-Compression-600M | infgrad | 🟢 Ouvert | 73,5 % | 14 novembre 2025 | ✅ Mesuré |
| 9 | richinfoai/ritrieve_zh_v1 | richinfoai | 🟢 Ouvert | 72,7 % | 25 mars 2025 | ✅ Mesuré |
| 10 | IEITYuan/Yuan-embedding-2.0-zh | IEITYuan | 🟢 Ouvert | 72,6 % | 24 novembre 2025 | ✅ Mesuré |
| 11 | TencentBAC/Conan-embedding-v1 | Tencent | 🟢 Ouvert | 72,5 % | 22 août 2024 | ✅ Mesuré |
| 12 | lier007/xiaobu-embedding-v2 | lier007 | 🟢 Ouvert | 72,4 % | 30 juin 2024 | ✅ Mesuré |
| 13 | Qwen: Qwen3 Embedding 4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,3 % | 28 octobre 2025 | ✅ Mesuré |
| 14 | iampanda/zpoint_large_embedding_zh | iampanda | 🟢 Ouvert | 71,8 % | 4 juin 2024 | ✅ Mesuré |
| 15 | Alibaba-NLP/gte-Qwen2-7B-instruct | Alibaba | 🟢 Ouvert | 71,6 % | 15 juin 2024 | ✅ Mesuré |
| 16 | KaLM-Embedding/KaLM-embedding-multilingual-mini-instruct-v2.5 | KaLM-Embedding | 🟢 Ouvert | 70,9 % | 30 septembre 2025 | ✅ Mesuré |
| 17 | sensenova/piccolo-large-zh-v2 | sensenova | 🟢 Ouvert | 70,9 % | 22 avril 2024 | ✅ Mesuré |
| 18 | Alibaba-NLP/gme-Qwen2-VL-7B-Instruct | Alibaba | 🟢 Ouvert | 70,7 % | 24 décembre 2024 | ✅ Mesuré |
| 19 | Classical/Yinka | Classical | 🟢 Ouvert | 70,7 % | 9 janvier 2024 | ✅ Mesuré |
| 20 | dunzhang/stella-mrl-large-zh-v3.5-1792d | dunzhang | 🟢 Ouvert | 68,6 % | 27 février 2024 | ✅ Mesuré |
| 21 | dunzhang/stella-large-zh-v3-1792d | dunzhang | 🟢 Ouvert | 68,5 % | 17 février 2024 | ✅ Mesuré |
| 22 | qihoo360/Zhinao-ChineseModernBert-Embedding | qihoo360 | 🟢 Ouvert | 68,5 % | 18 mars 2026 | ✅ Mesuré |
| 23 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 68,3 % | 9 mars 2026 | ✅ Mesuré |
| 24 | HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v2 | HIT-TMG | 🟢 Ouvert | 68,1 % | 25 juin 2025 | ✅ Mesuré |
| 25 | Alibaba-NLP/gme-Qwen2-VL-2B-Instruct | Alibaba | 🟢 Ouvert | 68,0 % | 24 décembre 2024 | ✅ Mesuré |
| 26 | infgrad/stella-base-zh-v3-1792d | infgrad | 🟢 Ouvert | 68,0 % | 17 février 2024 | ✅ Mesuré |
| 27 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 67,7 % | 9 mars 2026 | ✅ Mesuré |
| 28 | BAAI/bge-multilingual-gemma2 | BAAI | 🟢 Ouvert | 67,6 % | 25 juillet 2024 | ✅ Mesuré |
| 29 | lier007/xiaobu-embedding | lier007 | 🟢 Ouvert | 67,3 % | 9 janvier 2024 | ✅ Mesuré |
| 30 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 67,1 % | 9 mars 2026 | ✅ Mesuré |
| 31 | Alibaba-NLP/gte-Qwen2-1.5B-instruct | Alibaba | 🟢 Ouvert | 67,1 % | 29 juillet 2024 | ✅ Mesuré |
| 32 | malenia1/ternary-weight-embedding | malenia1 | 🟢 Ouvert | 67,0 % | 23 octobre 2024 | ✅ Mesuré |
| 33 | thenlper/gte-large-zh | Alibaba | 🟢 Ouvert | 66,7 % | 8 novembre 2023 | ✅ Mesuré |
| 34 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 66,4 % | 9 mars 2026 | ✅ Mesuré |
| 35 | Qwen: Qwen3 Embedding 0.6B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,4 % | 5 novembre 2025 | ✅ Mesuré |
| 36 | DMetaSoul/Dmeta-embedding-zh-small | DMetaSoul | 🟢 Ouvert | 66,0 % | 25 mars 2024 | ✅ Mesuré |
| 37 | thenlper/gte-base-zh | Alibaba | 🟢 Ouvert | 65,7 % | 8 novembre 2023 | ✅ Mesuré |
| 38 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 64,8 % | 9 mars 2026 | ✅ Mesuré |
| 39 | HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1.5 | HIT-TMG | 🟢 Ouvert | 63,7 % | 26 décembre 2024 | ✅ Mesuré |
| 40 | sensenova/piccolo-base-zh | sensenova | 🟢 Ouvert | 63,4 % | 4 septembre 2023 | ✅ Mesuré |
| 41 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 63,0 % | 9 mars 2026 | ✅ Mesuré |
| 42 | HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1 | HIT-TMG | 🟢 Ouvert | 63,0 % | 23 octobre 2024 | ✅ Mesuré |
| 43 | HIT-TMG/KaLM-embedding-multilingual-mini-v1 | HIT-TMG | 🟢 Ouvert | 62,3 % | 27 août 2024 | ✅ Mesuré |
| 44 | thenlper/gte-small-zh | Alibaba | 🟢 Ouvert | 60,0 % | 8 novembre 2023 | ✅ Mesuré |
| 45 | intfloat/e5-mistral-7b-instruct | Intfloat | 🟢 Ouvert | 59,9 % | 8 février 2024 | ✅ Mesuré |
| 46 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 59,9 % | 9 mars 2026 | ✅ Mesuré |
| 47 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 58,2 % | 9 mars 2026 | ✅ Mesuré |
| 48 | Intfloat: Multilingual-E5-Large | Intfloat | 🟢 Ouvert | 57,8 % | 18 novembre 2025 | ✅ Mesuré |
| 49 | izhx/udever-bloom-7b1 | izhx | 🟢 Ouvert | 57,4 % | 24 octobre 2023 | ✅ Mesuré |
| 50 | intfloat/multilingual-e5-base | Intfloat | 🟢 Ouvert | 56,2 % | 8 février 2024 | ✅ Mesuré |
| 51 | izhx/udever-bloom-3b | izhx | 🟢 Ouvert | 56,1 % | 24 octobre 2023 | ✅ Mesuré |
| 52 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 55,3 % | 8 février 2024 | ✅ Mesuré |
| 53 | izhx/udever-bloom-1b1 | izhx | 🟢 Ouvert | 55,0 % | 24 octobre 2023 | ✅ Mesuré |
| 54 | izhx/udever-bloom-560m | izhx | 🟢 Ouvert | 50,0 % | 24 octobre 2023 | ✅ Mesuré |
| 55 | DMetaSoul/sbert-chinese-general-v1 | DMetaSoul | 🟢 Ouvert | 45,4 % | 25 mars 2022 | ✅ Mesuré |
| 56 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 41,0 % | 23 mai 2025 | ✅ Mesuré |
| 57 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 39,4 % | 15 janvier 2025 | ✅ Mesuré |
| 58 | facebook/SONAR | Meta | 🟢 Ouvert | 33,4 % | 21 mai 2021 | ✅ Mesuré |
Classement établi sur 58 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 67,2 %.
Notre analyse
Un score élevé indique qu’un modèle obtient de bonnes performances moyennes sur les métriques principales propres aux différentes tâches, comme nDCG@10, l’accuracy ou la corrélation de Spearman. Il traduit donc une qualité d’embedding relativement polyvalente au sein du périmètre chinois de C-MTEB, sans garantir le même niveau sur d’autres langues ou sur des usages absents de la suite.
La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs. Cette méthode facilite la couverture de nombreux modèles, mais offre une rigueur moins homogène qu’une évaluation entièrement reproduite et contrôlée par une même entité. Elle ne suffit pas non plus, à elle seule, à écarter un éventuel effet de contamination. Avec une médiane de 67 % parmi 58 modèles et un meilleur résultat de 79 % pour Kingsoft-LLM/QZhou-Embedding-Zh, le classement montre une différenciation encore visible plutôt qu’une saturation complète. Il met surtout en évidence les modèles les plus performants sur cet ensemble précis de tâches chinoises.
Sources des scores : mteb.