BEIR-NL

MTEB: BEIR-NL est un benchmark public consacré à la recherche d’information zero-shot en néerlandais. Publié en 2024 par Banar, Lotfi et Daelemans, du CLiPS à l’Université d’Anvers, il repose sur une traduction automatique de la suite de tâches BEIR initialement conçue en anglais.

MTEB: BEIR-NL est un benchmark public consacré à la recherche d’information zero-shot en néerlandais. Publié en 2024 par Banar, Lotfi et Daelemans, du CLiPS à l’Université d’Anvers, il repose sur une traduction automatique de la suite de tâches BEIR initialement conçue en anglais.

Il mesure la capacité des modèles à retrouver et classer des contenus pertinents sans adaptation préalable aux tâches évaluées. Son intégration à MTEB permet de comparer qualitativement les performances de modèles de recherche sur un ensemble commun de tâches néerlandophones.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBanar, Lotfi, Daelemans (CLiPS, Universite d'Anvers)
Capacités mesuréesEvalue la qualite de la recherche d'information zero-shot en neerlandais sur la suite de taches BEIR, obtenue par traduction automatique du benchmark anglais original.
ModalitéTexte
Type de questionsRecherche d'information zero-shot (suite de taches BEIR traduite)
Métrique d'évaluationnDCG@10
AccèsPublic
LanguesNeerlandais
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (15)

#ModèleÉditeurLicenceScoreSortieFiabilité
1infly/inf-retriever-v1infly🟢 Ouvert54,5 %24 décembre 2024✅ Mesuré
2infly/inf-retriever-v1-1.5binfly🟢 Ouvert50,1 %8 février 2025✅ Mesuré
3Intfloat: Multilingual-E5-LargeIntfloat🟢 Ouvert45,9 %18 novembre 2025✅ Mesuré
4jinaai/jina-embeddings-v3Jina AI🟢 Ouvert45,6 %18 septembre 2024✅ Mesuré
5BAAI: bge-m3BAAI🟢 Ouvert44,7 %18 novembre 2025✅ Mesuré
6intfloat/multilingual-e5-large-instructIntfloat🟢 Ouvert44,4 %8 février 2024✅ Mesuré
7Alibaba-NLP/gte-multilingual-baseAlibaba🟢 Ouvert43,4 %20 juillet 2024✅ Mesuré
8intfloat/multilingual-e5-baseIntfloat🟢 Ouvert42,4 %8 février 2024✅ Mesuré
9intfloat/multilingual-e5-smallIntfloat🟢 Ouvert41,1 %8 février 2024✅ Mesuré
10HIT-TMG/KaLM-embedding-multilingual-mini-v1HIT-TMG🟢 Ouvert40,5 %27 août 2024✅ Mesuré
11HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1HIT-TMG🟢 Ouvert26,1 %23 octobre 2024✅ Mesuré
12sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2Sentence Transformers🟢 Ouvert25,8 %1 novembre 2019✅ Mesuré
13sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert21,7 %15 janvier 2025✅ Mesuré
14minishlab/potion-multilingual-128Mminishlab🟢 Ouvert20,2 %23 mai 2025✅ Mesuré
15sentence-transformers/LaBSESentence Transformers🟢 Ouvert19,5 %1 novembre 2019✅ Mesuré

Classement établi sur 15 modèles évalués. Score médian de l'ensemble : 42,4 %.

Notre analyse

Un score nDCG@10 élevé indique que les résultats pertinents tendent à apparaître parmi les dix premières positions, avec un avantage accordé à ceux placés le plus haut. Dans la base, infly/inf-retriever-v1 domine les quinze modèles évalués avec 55 %, tandis que la médiane atteint 42 %. Cet écart montre une différenciation réelle entre le meilleur modèle et le niveau central. Le meilleur résultat reste aussi nettement sous le plafond de la métrique, ce qui ne signale pas de saturation apparente du benchmark.

La comparaison doit toutefois être interprétée avec prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt qu’obtenus dans un protocole indépendant et uniformément reproduit. La portée demeure ciblée sur la recherche d’information zero-shot en néerlandais et sur les tâches issues de BEIR. La traduction automatique peut également transmettre des caractéristiques de la suite anglaise originale. Enfin, le cadre zero-shot ne suffit pas, à lui seul, à écarter un éventuel effet de contamination provenant de cette source. Le classement reflète donc surtout l’efficacité relative des modèles sur cette déclinaison néerlandaise traduite.


Sources des scores : mteb.