Dutch
MTEB: Dutch est un benchmark communautaire créé par MTEB / embeddings-benchmark dans le cadre de MTEB-NL. Il évalue la qualité des embeddings de textes en néerlandais sur un ensemble diversifié de tâches, allant de la classification à la recherche, en passant par le clustering et la…
MTEB: Dutch est un benchmark communautaire créé par MTEB / embeddings-benchmark dans le cadre de MTEB-NL. Il évalue la qualité des embeddings de textes en néerlandais sur un ensemble diversifié de tâches, allant de la classification à la recherche, en passant par le clustering et la similarité sémantique.
Son rôle consiste à comparer la capacité des modèles à produire des représentations textuelles utiles dans plusieurs contextes. Cette couverture permet une appréciation transversale des performances, plutôt qu’une évaluation limitée à un seul usage des embeddings.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MTEB / embeddings-benchmark (communauté) — benchmark néerlandais MTEB-NL |
| Capacités mesurées | Qualité des embeddings de texte en néerlandais à travers classification, clustering, classification de paires/multilabel, reranking, recherche et similarité sémantique |
| Modalité | Texte |
| Type de questions | tâches d'embedding de texte (classification, clustering, pair/multilabel classification, reranking, retrieval, STS) |
| Métrique d'évaluation | score principal par tâche (ex. nDCG@10, accuracy, corrélation de Spearman) moyenné |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | néerlandais (nld) |
| Taille du jeu | plusieurs dizaines de jeux de données néerlandais |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (113)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 66,4 % | 9 mars 2026 | ✅ Mesuré |
| 2 | nvidia/llama-embed-nemotron-8b | NVIDIA | 🟢 Ouvert | 66,2 % | 23 octobre 2025 | ✅ Mesuré |
| 3 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 65,8 % | 9 mars 2026 | ✅ Mesuré |
| 4 | Octen/Octen-Embedding-8B | Octen | 🟢 Ouvert | 65,6 % | 23 décembre 2025 | ✅ Mesuré |
| 5 | Qwen: Qwen3 Embedding 8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,6 % | 28 octobre 2025 | ✅ Mesuré |
| 6 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 64,1 % | 9 mars 2026 | ✅ Mesuré |
| 7 | Octen/Octen-Embedding-4B | Octen | 🟢 Ouvert | 63,8 % | 30 décembre 2025 | ✅ Mesuré |
| 8 | Qwen: Qwen3 Embedding 4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,7 % | 28 octobre 2025 | ✅ Mesuré |
| 9 | Salesforce/SFR-Embedding-2_R | Salesforce | 🟢 Ouvert | 63,5 % | 14 juin 2024 | ✅ Mesuré |
| 10 | Linq-AI-Research/Linq-Embed-Mistral | Linq-AI-Research | 🟢 Ouvert | 63,1 % | 29 mai 2024 | ✅ Mesuré |
| 11 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 62,7 % | 9 mars 2026 | ✅ Mesuré |
| 12 | Salesforce/SFR-Embedding-Mistral | Salesforce | 🟢 Ouvert | 62,6 % | 24 janvier 2024 | ✅ Mesuré |
| 13 | BidirLM/BidirLM-1.7B-Embedding | BidirLM | 🟢 Ouvert | 60,5 % | 7 avril 2026 | ✅ Mesuré |
| 14 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 59,5 % | 9 mars 2026 | ✅ Mesuré |
| 15 | microsoft/harrier-oss-v1-0.6b | Microsoft | 🟢 Ouvert | 59,4 % | 27 mars 2026 | ✅ Mesuré |
| 16 | BidirLM/BidirLM-1B-Embedding | BidirLM | 🟢 Ouvert | 59,2 % | 7 avril 2026 | ✅ Mesuré |
| 17 | Mira190/Euler-Legal-Embedding-V1 | Mira190 | 🟢 Ouvert | 58,4 % | 6 novembre 2025 | ✅ Mesuré |
| 18 | intfloat/multilingual-e5-large-instruct | Intfloat | 🟢 Ouvert | 58,4 % | 8 février 2024 | ✅ Mesuré |
| 19 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 57,6 % | 9 mars 2026 | ✅ Mesuré |
| 20 | jinaai/jina-embeddings-v3 | Jina AI | 🟢 Ouvert | 57,0 % | 18 septembre 2024 | ✅ Mesuré |
| 21 | clips/e5-large-trm-nl | clips | 🟢 Ouvert | 56,4 % | 23 septembre 2025 | ✅ Mesuré |
| 22 | OrdalieTech/Solon-embeddings-large-0.1 | OrdalieTech | 🟢 Ouvert | 56,3 % | 9 décembre 2023 | ✅ Mesuré |
| 23 | Lajavaness/bilingual-embedding-large | Lajavaness | 🟢 Ouvert | 56,2 % | 24 juin 2024 | ✅ Mesuré |
| 24 | BidirLM/BidirLM-0.6B-Embedding | BidirLM | 🟢 Ouvert | 56,2 % | 7 avril 2026 | ✅ Mesuré |
| 25 | microsoft/harrier-oss-v1-270m | Microsoft | 🟢 Ouvert | 55,9 % | 27 mars 2026 | ✅ Mesuré |
| 26 | Snowflake/snowflake-arctic-embed-l-v2.0 | Snowflake | 🟢 Ouvert | 55,2 % | 4 décembre 2024 | ✅ Mesuré |
| 27 | BAAI: bge-m3 | BAAI | 🟢 Ouvert | 54,8 % | 18 novembre 2025 | ✅ Mesuré |
| 28 | Intfloat: Multilingual-E5-Large | Intfloat | 🟢 Ouvert | 54,7 % | 18 novembre 2025 | ✅ Mesuré |
| 29 | clips/e5-base-trm-nl | clips | 🟢 Ouvert | 54,5 % | 23 septembre 2025 | ✅ Mesuré |
| 30 | Qwen: Qwen3 Embedding 0.6B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,3 % | 5 novembre 2025 | ✅ Mesuré |
| 31 | ibm-granite/granite-embedding-311m-multilingual-r2 | IBM | 🟢 Ouvert | 54,1 % | 29 avril 2026 | ✅ Mesuré |
| 32 | Alibaba-NLP/gte-multilingual-base | Alibaba | 🟢 Ouvert | 53,6 % | 20 juillet 2024 | ✅ Mesuré |
| 33 | Lajavaness/bilingual-embedding-base | Lajavaness | 🟢 Ouvert | 53,6 % | 26 juin 2024 | ✅ Mesuré |
| 34 | manu/bge-m3-custom-fr | manu | 🟢 Ouvert | 53,5 % | 11 avril 2024 | ✅ Mesuré |
| 35 | clips/e5-small-trm-nl | clips | 🟢 Ouvert | 53,3 % | 23 septembre 2025 | ✅ Mesuré |
| 36 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 53,0 % | 9 mars 2026 | ✅ Mesuré |
| 37 | intfloat/multilingual-e5-base | Intfloat | 🟢 Ouvert | 52,4 % | 8 février 2024 | ✅ Mesuré |
| 38 | Lajavaness/bilingual-embedding-small | Lajavaness | 🟢 Ouvert | 51,9 % | 17 juillet 2024 | ✅ Mesuré |
| 39 | ibm-granite/granite-embedding-97m-multilingual-r2 | IBM | 🟢 Ouvert | 51,4 % | 29 avril 2026 | ✅ Mesuré |
| 40 | BidirLM/BidirLM-270M-Embedding | BidirLM | 🟢 Ouvert | 50,9 % | 7 avril 2026 | ✅ Mesuré |
| 41 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 50,8 % | 8 février 2024 | ✅ Mesuré |
| 42 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 50,5 % | 9 mars 2026 | ✅ Mesuré |
| 43 | Snowflake/snowflake-arctic-embed-m-v2.0 | Snowflake | 🟢 Ouvert | 50,3 % | 4 décembre 2024 | ✅ Mesuré |
| 44 | ibm-granite/granite-embedding-278m-multilingual | IBM | 🟢 Ouvert | 50,2 % | 18 décembre 2024 | ✅ Mesuré |
| 45 | ibm-granite/granite-embedding-107m-multilingual | IBM | 🟢 Ouvert | 49,1 % | 18 décembre 2024 | ✅ Mesuré |
| 46 | sentence-transformers/paraphrase-multilingual-mpnet-base-v2 | Sentence Transformers | 🟢 Ouvert | 49,0 % | 1 novembre 2019 | ✅ Mesuré |
| 47 | Omartificial-Intelligence-Space/Arabic-all-nli-triplet-Matryoshka | Omartificial-Intelligence-Space | 🟢 Ouvert | 48,6 % | 14 juin 2024 | ✅ Mesuré |
| 48 | Omartificial-Intelligence-Space/Arabic-labse-Matryoshka | Omartificial-Intelligence-Space | 🟢 Ouvert | 46,9 % | 16 juin 2024 | ✅ Mesuré |
| 49 | sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 | Sentence Transformers | 🟢 Ouvert | 45,8 % | 1 novembre 2019 | ✅ Mesuré |
| 50 | omarelshehy/arabic-english-sts-matryoshka | omarelshehy | 🟢 Ouvert | 45,7 % | 13 octobre 2024 | ✅ Mesuré |
| 51 | Gameselo/STS-multilingual-mpnet-base-v2 | Gameselo | 🟢 Ouvert | 45,4 % | 7 juin 2024 | ✅ Mesuré |
| 52 | Omartificial-Intelligence-Space/Arabic-MiniLM-L12-v2-all-nli-triplet | Omartificial-Intelligence-Space | 🟢 Ouvert | 45,2 % | 25 juin 2024 | ✅ Mesuré |
| 53 | sentence-transformers/LaBSE | Sentence Transformers | 🟢 Ouvert | 44,2 % | 1 novembre 2019 | ✅ Mesuré |
| 54 | Intfloat: E5-Large-v2 | Intfloat | 🟢 Ouvert | 43,1 % | 18 novembre 2025 | ✅ Mesuré |
| 55 | WhereIsAI/UAE-Large-V1 | WhereIsAI | 🟢 Ouvert | 43,0 % | 4 décembre 2023 | ✅ Mesuré |
| 56 | intfloat/e5-large | Intfloat | 🟢 Ouvert | 42,8 % | 26 décembre 2022 | ✅ Mesuré |
| 57 | sentence-transformers/gtr-t5-large | Sentence Transformers | 🟢 Ouvert | 42,8 % | 9 février 2022 | ✅ Mesuré |
| 58 | BAAI: bge-large-en-v1.5 | BAAI | 🟢 Ouvert | 42,8 % | 18 novembre 2025 | ✅ Mesuré |
| 59 | mixedbread-ai/mxbai-embed-large-v1 | Mixedbread AI | 🟢 Ouvert | 42,6 % | 7 mars 2024 | ✅ Mesuré |
| 60 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 42,4 % | 23 mai 2025 | ✅ Mesuré |
| 61 | Intfloat: E5-Base-v2 | Intfloat | 🟢 Ouvert | 42,2 % | 18 novembre 2025 | ✅ Mesuré |
| 62 | avsolatorio/GIST-large-Embedding-v0 | avsolatorio | 🟢 Ouvert | 41,5 % | 14 février 2024 | ✅ Mesuré |
| 63 | intfloat/e5-base | Intfloat | 🟢 Ouvert | 41,2 % | 26 décembre 2022 | ✅ Mesuré |
| 64 | BAAI: bge-base-en-v1.5 | BAAI | 🟢 Ouvert | 41,0 % | 18 novembre 2025 | ✅ Mesuré |
| 65 | ibm-granite/granite-embedding-125m-english | IBM | 🟢 Ouvert | 40,8 % | 18 décembre 2024 | ✅ Mesuré |
| 66 | sentence-transformers/sentence-t5-large | Sentence Transformers | 🟢 Ouvert | 40,8 % | 9 février 2022 | ✅ Mesuré |
| 67 | Snowflake/snowflake-arctic-embed-l | Snowflake | 🟢 Ouvert | 40,7 % | 12 avril 2024 | ✅ Mesuré |
| 68 | shibing624/text2vec-base-multilingual | shibing624 | 🟢 Ouvert | 40,6 % | 22 juin 2023 | ✅ Mesuré |
| 69 | avsolatorio/GIST-Embedding-v0 | avsolatorio | 🟢 Ouvert | 40,0 % | 31 janvier 2024 | ✅ Mesuré |
| 70 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 39,9 % | 15 janvier 2025 | ✅ Mesuré |
| 71 | intfloat/e5-small-v2 | Intfloat | 🟢 Ouvert | 39,9 % | 8 février 2024 | ✅ Mesuré |
| 72 | BAAI/bge-small-en-v1.5 | BAAI | 🟢 Ouvert | 39,8 % | 12 septembre 2023 | ✅ Mesuré |
| 73 | sdadas/mmlw-e5-large | sdadas | 🟢 Ouvert | 39,7 % | 17 novembre 2023 | ✅ Mesuré |
| 74 | abhinand/MedEmbed-small-v0.1 | abhinand | 🟢 Ouvert | 39,4 % | 20 octobre 2024 | ✅ Mesuré |
| 75 | intfloat/e5-small | Intfloat | 🟢 Ouvert | 39,4 % | 8 février 2024 | ✅ Mesuré |
| 76 | Snowflake/snowflake-arctic-embed-s | Snowflake | 🟢 Ouvert | 39,4 % | 12 avril 2024 | ✅ Mesuré |
| 77 | sdadas/mmlw-roberta-large | sdadas | 🟢 Ouvert | 38,5 % | 17 novembre 2023 | ✅ Mesuré |
| 78 | Snowflake/snowflake-arctic-embed-m | Snowflake | 🟢 Ouvert | 38,4 % | 12 avril 2024 | ✅ Mesuré |
| 79 | GritLM/GritLM-7B | GritLM | 🟢 Ouvert | 38,4 % | 15 février 2024 | ✅ Mesuré |
| 80 | avsolatorio/GIST-small-Embedding-v0 | avsolatorio | 🟢 Ouvert | 38,4 % | 3 février 2024 | ✅ Mesuré |
| 81 | ibm-granite/granite-embedding-30m-english | IBM | 🟢 Ouvert | 37,5 % | 18 décembre 2024 | ✅ Mesuré |
| 82 | Snowflake/snowflake-arctic-embed-m-v1.5 | Snowflake | 🟢 Ouvert | 37,2 % | 8 juillet 2024 | ✅ Mesuré |
| 83 | Sentence Transformers: all-mpnet-base-v2 | Sentence Transformers | 🟢 Ouvert | 36,6 % | 17 novembre 2025 | ✅ Mesuré |
| 84 | sdadas/mmlw-e5-base | sdadas | 🟢 Ouvert | 36,6 % | 17 novembre 2023 | ✅ Mesuré |
| 85 | sentence-transformers/sentence-t5-base | Sentence Transformers | 🟢 Ouvert | 36,4 % | 9 février 2022 | ✅ Mesuré |
| 86 | sdadas/mmlw-roberta-base | sdadas | 🟢 Ouvert | 36,4 % | 17 novembre 2023 | ✅ Mesuré |
| 87 | jinaai/jina-embedding-b-en-v1 | Jina AI | 🟢 Ouvert | 36,3 % | 7 juillet 2023 | ✅ Mesuré |
| 88 | avsolatorio/GIST-all-MiniLM-L6-v2 | avsolatorio | 🟢 Ouvert | 36,1 % | 3 février 2024 | ✅ Mesuré |
| 89 | Snowflake/snowflake-arctic-embed-xs | Snowflake | 🟢 Ouvert | 35,1 % | 8 juillet 2024 | ✅ Mesuré |
| 90 | sentence-transformers/multi-qa-MiniLM-L6-cos-v1 | Sentence Transformers | 🟢 Ouvert | 34,6 % | 30 août 2021 | ✅ Mesuré |
| 91 | sdadas/mmlw-e5-small | sdadas | 🟢 Ouvert | 34,5 % | 17 novembre 2023 | ✅ Mesuré |
| 92 | Sentence Transformers: all-MiniLM-L6-v2 | Sentence Transformers | 🟢 Ouvert | 34,2 % | 17 novembre 2025 | ✅ Mesuré |
| 93 | Mihaiii/Wartortle | Mihaiii | 🟢 Ouvert | 33,3 % | 30 avril 2024 | ✅ Mesuré |
| 94 | ai-forever/ru-en-RoSBERTa | ai-forever | 🟢 Ouvert | 32,4 % | 29 juillet 2024 | ✅ Mesuré |
| 95 | jinaai/jina-embedding-s-en-v1 | Jina AI | 🟢 Ouvert | 32,2 % | 7 juillet 2023 | ✅ Mesuré |
| 96 | Mihaiii/Squirtle | Mihaiii | 🟢 Ouvert | 32,2 % | 30 avril 2024 | ✅ Mesuré |
| 97 | minishlab/M2V_base_glove_subword | minishlab | 🟢 Ouvert | 30,6 % | 21 septembre 2024 | ✅ Mesuré |
| 98 | minishlab/potion-base-8M | minishlab | 🟢 Ouvert | 30,1 % | 29 octobre 2024 | ✅ Mesuré |
| 99 | minishlab/M2V_base_output | minishlab | 🟢 Ouvert | 29,7 % | 21 septembre 2024 | ✅ Mesuré |
| 100 | minishlab/potion-base-4M | minishlab | 🟢 Ouvert | 28,8 % | 29 octobre 2024 | ✅ Mesuré |
| 101 | sergeyzh/rubert-tiny-turbo | sergeyzh | 🟢 Ouvert | 27,2 % | 21 juin 2024 | ✅ Mesuré |
| 102 | minishlab/potion-base-2M | minishlab | 🟢 Ouvert | 26,2 % | 29 octobre 2024 | ✅ Mesuré |
| 103 | cointegrated/rubert-tiny | cointegrated | 🟢 Ouvert | 25,7 % | 24 mai 2021 | ✅ Mesuré |
| 104 | DeepPavlov/rubert-base-cased-sentence | DeepPavlov | 🟢 Ouvert | 25,4 % | 4 mars 2020 | ✅ Mesuré |
| 105 | Omartificial-Intelligence-Space/Arabic-mpnet-base-all-nli-triplet | Omartificial-Intelligence-Space | 🟢 Ouvert | 25,4 % | 15 juin 2024 | ✅ Mesuré |
| 106 | Omartificial-Intelligence-Space/Arabert-all-nli-triplet-Matryoshka | Omartificial-Intelligence-Space | 🟢 Ouvert | 25,3 % | 16 juin 2024 | ✅ Mesuré |
| 107 | cointegrated/rubert-tiny2 | cointegrated | 🟢 Ouvert | 24,8 % | 28 octobre 2021 | ✅ Mesuré |
| 108 | DeepPavlov/distilrubert-small-cased-conversational | DeepPavlov | 🟢 Ouvert | 23,7 % | 28 juin 2022 | ✅ Mesuré |
| 109 | Omartificial-Intelligence-Space/Marbert-all-nli-triplet-Matryoshka | Omartificial-Intelligence-Space | 🟢 Ouvert | 23,4 % | 17 juin 2024 | ✅ Mesuré |
| 110 | deepvk/deberta-v1-base | deepvk | 🟢 Ouvert | 22,5 % | 7 février 2023 | ✅ Mesuré |
| 111 | malenia1/ternary-weight-embedding | malenia1 | 🟢 Ouvert | 22,3 % | 23 octobre 2024 | ✅ Mesuré |
| 112 | ai-forever/sbert_large_mt_nlu_ru | ai-forever | 🟢 Ouvert | 21,5 % | 18 mai 2021 | ✅ Mesuré |
| 113 | ai-forever/sbert_large_nlu_ru | ai-forever | 🟢 Ouvert | 21,3 % | 20 novembre 2020 | ✅ Mesuré |
Classement établi sur 113 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 42,8 %.
Notre analyse
Un score élevé indique qu’un modèle obtient de bons résultats moyens sur des tâches aux objectifs et métriques variés, notamment nDCG@10, l’accuracy et la corrélation de Spearman. Cette moyenne facilite la comparaison globale, mais peut masquer des écarts entre classification, reranking, recherche ou similarité sémantique. La rigueur du classement doit aussi être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un cadre de mesure entièrement indépendant.
Avec un meilleur score de 66 % contre une médiane de 43 %, le classement fait apparaître un écart net entre le modèle de tête, codefuse-ai/F2LLM-v2-14B, et le niveau central de l’ensemble évalué. Ce résultat ne suggère pas une saturation complète du benchmark. Sa portée reste toutefois circonscrite aux embeddings de textes en néerlandais et aux familles de tâches couvertes. Son accès public implique également que la contamination constitue un risque méthodologique à considérer lors de l’interprétation des résultats, sans établir qu’elle affecte effectivement les scores publiés.
Sources des scores : mteb.