BEIR-NL
MTEB: BEIR-NL est un benchmark public consacré à la recherche d’information zero-shot en néerlandais. Publié en 2024 par Banar, Lotfi et Daelemans, du CLiPS à l’Université d’Anvers, il repose sur une traduction automatique de la suite de tâches BEIR initialement conçue en anglais.
MTEB: BEIR-NL est un benchmark public consacré à la recherche d’information zero-shot en néerlandais. Publié en 2024 par Banar, Lotfi et Daelemans, du CLiPS à l’Université d’Anvers, il repose sur une traduction automatique de la suite de tâches BEIR initialement conçue en anglais.
Il mesure la capacité des modèles à retrouver et classer des contenus pertinents sans adaptation préalable aux tâches évaluées. Son intégration à MTEB permet de comparer qualitativement les performances de modèles de recherche sur un ensemble commun de tâches néerlandophones.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Banar, Lotfi, Daelemans (CLiPS, Universite d'Anvers) |
| Capacités mesurées | Evalue la qualite de la recherche d'information zero-shot en neerlandais sur la suite de taches BEIR, obtenue par traduction automatique du benchmark anglais original. |
| Modalité | Texte |
| Type de questions | Recherche d'information zero-shot (suite de taches BEIR traduite) |
| Métrique d'évaluation | nDCG@10 |
| Accès | Public |
| Langues | Neerlandais |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (15)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | infly/inf-retriever-v1 | infly | 🟢 Ouvert | 54,5 % | 24 décembre 2024 | ✅ Mesuré |
| 2 | infly/inf-retriever-v1-1.5b | infly | 🟢 Ouvert | 50,1 % | 8 février 2025 | ✅ Mesuré |
| 3 | Intfloat: Multilingual-E5-Large | Intfloat | 🟢 Ouvert | 45,9 % | 18 novembre 2025 | ✅ Mesuré |
| 4 | jinaai/jina-embeddings-v3 | Jina AI | 🟢 Ouvert | 45,6 % | 18 septembre 2024 | ✅ Mesuré |
| 5 | BAAI: bge-m3 | BAAI | 🟢 Ouvert | 44,7 % | 18 novembre 2025 | ✅ Mesuré |
| 6 | intfloat/multilingual-e5-large-instruct | Intfloat | 🟢 Ouvert | 44,4 % | 8 février 2024 | ✅ Mesuré |
| 7 | Alibaba-NLP/gte-multilingual-base | Alibaba | 🟢 Ouvert | 43,4 % | 20 juillet 2024 | ✅ Mesuré |
| 8 | intfloat/multilingual-e5-base | Intfloat | 🟢 Ouvert | 42,4 % | 8 février 2024 | ✅ Mesuré |
| 9 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 41,1 % | 8 février 2024 | ✅ Mesuré |
| 10 | HIT-TMG/KaLM-embedding-multilingual-mini-v1 | HIT-TMG | 🟢 Ouvert | 40,5 % | 27 août 2024 | ✅ Mesuré |
| 11 | HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1 | HIT-TMG | 🟢 Ouvert | 26,1 % | 23 octobre 2024 | ✅ Mesuré |
| 12 | sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 | Sentence Transformers | 🟢 Ouvert | 25,8 % | 1 novembre 2019 | ✅ Mesuré |
| 13 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 21,7 % | 15 janvier 2025 | ✅ Mesuré |
| 14 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 20,2 % | 23 mai 2025 | ✅ Mesuré |
| 15 | sentence-transformers/LaBSE | Sentence Transformers | 🟢 Ouvert | 19,5 % | 1 novembre 2019 | ✅ Mesuré |
Classement établi sur 15 modèles évalués. Score médian de l'ensemble : 42,4 %.
Notre analyse
Un score nDCG@10 élevé indique que les résultats pertinents tendent à apparaître parmi les dix premières positions, avec un avantage accordé à ceux placés le plus haut. Dans la base, infly/inf-retriever-v1 domine les quinze modèles évalués avec 55 %, tandis que la médiane atteint 42 %. Cet écart montre une différenciation réelle entre le meilleur modèle et le niveau central. Le meilleur résultat reste aussi nettement sous le plafond de la métrique, ce qui ne signale pas de saturation apparente du benchmark.
La comparaison doit toutefois être interprétée avec prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’obtenus dans un protocole indépendant et uniformément reproduit. La portée demeure ciblée sur la recherche d’information zero-shot en néerlandais et sur les tâches issues de BEIR. La traduction automatique peut également transmettre des caractéristiques de la suite anglaise originale. Enfin, le cadre zero-shot ne suffit pas, à lui seul, à écarter un éventuel effet de contamination provenant de cette source. Le classement reflète donc surtout l’efficacité relative des modèles sur cette déclinaison néerlandaise traduite.
Sources des scores : mteb.