Scandinavian

MTEB: Scandinavian est un benchmark public consacré à la qualité des embeddings de texte dans les principales langues scandinaves continentales. Publié en 2024, il a été créé par le Scandinavian Embedding Benchmark, sous la direction de Kenneth Enevoldsen et al., puis intégré à MTEB.

MTEB: Scandinavian est un benchmark public consacré à la qualité des embeddings de texte dans les principales langues scandinaves continentales. Publié en 2024, il a été créé par le Scandinavian Embedding Benchmark, sous la direction de Kenneth Enevoldsen et al., puis intégré à MTEB.

Son évaluation couvre la classification, le clustering, la recherche d’information et le bitext mining entre dialectes ou formes écrites. Cette diversité permet de comparer la capacité des modèles à produire des représentations utiles dans plusieurs contextes linguistiques, notamment en danois, suédois et norvégien.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkScandinavian Embedding Benchmark (SEB) - Kenneth Enevoldsen et al. (intégré à MTEB)
Capacités mesuréesQualité des embeddings de texte pour les langues scandinaves mainland, à travers classification, clustering, retrieval et bitext mining entre dialectes/formes écrites.
ModalitéTexte
Type de questionsÉvaluation d'embeddings de texte (classification, clustering, retrieval, bitext mining)
Métrique d'évaluationScore dépendant de la tâche (nDCG@10, accuracy, V-measure, etc.), agrégé
AccèsPublic
LanguesDanois, suédois, norvégien (Bokmål, Nynorsk) ; dialecte bornholmsk
Taille du jeu24 tâches / 10 sous-tâches sur 4 catégories
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (47)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert71,1 %9 mars 2026✅ Mesuré
2codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert69,9 %9 mars 2026✅ Mesuré
3codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert68,5 %9 mars 2026✅ Mesuré
4codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert67,2 %9 mars 2026✅ Mesuré
5Salesforce/SFR-Embedding-2_RSalesforce🟢 Ouvert65,6 %14 juin 2024✅ Mesuré
6codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert64,3 %9 mars 2026✅ Mesuré
7GritLM/GritLM-7BGritLM🟢 Ouvert64,1 %15 février 2024✅ Mesuré
8nicher92/saga-embed_v1nicher92🟢 Ouvert63,5 %9 janvier 2025✅ Mesuré
9openai/text-embedding-3-largeOpenAI🟢 Ouvert62,5 %25 janvier 2024✅ Mesuré
10Cohere/Cohere-embed-multilingual-v3.0Cohere🟢 Ouvert62,2 %2 novembre 2023✅ Mesuré
11intfloat/e5-mistral-7b-instructIntfloat🟢 Ouvert62,0 %8 février 2024✅ Mesuré
12codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert61,9 %9 mars 2026✅ Mesuré
13intfloat/multilingual-e5-large-instructIntfloat🟢 Ouvert61,6 %8 février 2024✅ Mesuré
14voyageai/voyage-finance-2Voyage AI🟢 Ouvert61,6 %30 mai 2024✅ Mesuré
15voyageai/voyage-multilingual-2Voyage AI🟢 Ouvert61,2 %10 juin 2024✅ Mesuré
16Qwen: Qwen3 Embedding 0.6BAlibaba Cloud / Qwen Team🟢 Ouvert61,0 %5 novembre 2025✅ Mesuré
17voyageai/voyage-3.5 (output_dtype=int8)Voyage AI🟢 Ouvert60,8 %21 janvier 2025✅ Mesuré
18voyageai/voyage-3.5Voyage AI🟢 Ouvert60,4 %21 janvier 2025✅ Mesuré
19voyageai/voyage-large-2-instructVoyage AI🟢 Ouvert59,7 %5 mai 2024✅ Mesuré
20voyageai/voyage-3Voyage AI🟢 Ouvert58,6 %18 septembre 2024✅ Mesuré
21voyageai/voyage-3.5 (output_dtype=binary)Voyage AI🟢 Ouvert58,4 %21 janvier 2025✅ Mesuré
22openai/text-embedding-3-smallOpenAI🟢 Ouvert58,4 %25 janvier 2024✅ Mesuré
23voyageai/voyage-3-liteVoyage AI🟢 Ouvert58,4 %18 septembre 2024✅ Mesuré
24BAAI: bge-m3BAAI🟢 Ouvert57,9 %18 novembre 2025✅ Mesuré
25codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert57,8 %9 mars 2026✅ Mesuré
26Cohere/Cohere-embed-multilingual-light-v3.0Cohere🟢 Ouvert56,9 %2 novembre 2023✅ Mesuré
27Snowflake/snowflake-arctic-embed-l-v2.0Snowflake🟢 Ouvert56,6 %4 décembre 2024✅ Mesuré
28intfloat/multilingual-e5-smallIntfloat🟢 Ouvert56,1 %8 février 2024✅ Mesuré
29codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert55,5 %9 mars 2026✅ Mesuré
30emillykkejensen/EmbeddingGemma-Scandi-300memillykkejensen🟢 Ouvert54,0 %17 octobre 2025✅ Mesuré
31voyageai/voyage-large-2Voyage AI🟢 Ouvert53,3 %29 octobre 2023✅ Mesuré
32voyageai/voyage-2Voyage AI🟢 Ouvert52,2 %29 octobre 2023✅ Mesuré
33emillykkejensen/mmBERTscandi-base-embeddingemillykkejensen🟢 Ouvert52,1 %17 octobre 2025✅ Mesuré
34NbAiLab/nb-sbert-baseNbAiLab🟢 Ouvert51,9 %23 novembre 2022✅ Mesuré
35sentence-transformers/paraphrase-multilingual-mpnet-base-v2Sentence Transformers🟢 Ouvert51,2 %1 novembre 2019✅ Mesuré
36sentence-transformers/LaBSESentence Transformers🟢 Ouvert48,5 %1 novembre 2019✅ Mesuré
37sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2Sentence Transformers🟢 Ouvert47,8 %1 novembre 2019✅ Mesuré
38KennethEnevoldsen/dfm-sentence-encoder-largeKennethEnevoldsen🟢 Ouvert47,8 %12 juillet 2023✅ Mesuré
39mixedbread-ai/mxbai-embed-large-v1Mixedbread AI🟢 Ouvert45,3 %7 mars 2024✅ Mesuré
40sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert44,7 %15 janvier 2025✅ Mesuré
41KennethEnevoldsen/dfm-sentence-encoder-mediumKennethEnevoldsen🟢 Ouvert40,6 %12 juillet 2023✅ Mesuré
42rasgaard/m2v-dfm-largerasgaard🟢 Ouvert40,3 %8 octobre 2025✅ Mesuré
43Sentence Transformers: all-MiniLM-L6-v2Sentence Transformers🟢 Ouvert38,9 %17 novembre 2025✅ Mesuré
44andersborges/model2vecdkandersborges🟢 Ouvert38,1 %21 novembre 2025✅ Mesuré
45andersborges/model2vecdk-stemandersborges🟢 Ouvert38,0 %21 novembre 2025✅ Mesuré
46FacebookAI/xlm-roberta-largeFacebookAI🟢 Ouvert36,5 %5 novembre 2019✅ Mesuré
47FacebookAI/xlm-roberta-baseFacebookAI🟢 Ouvert35,9 %5 novembre 2019✅ Mesuré

Classement établi sur 47 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 57,9 %.

Notre analyse

Un score agrégé élevé indique qu’un modèle produit des embeddings performants sur plusieurs familles de tâches, selon des métriques adaptées comme nDCG@10, l’accuracy ou la V-measure. Il ne correspond donc pas à une mesure unique et doit être interprété comme une synthèse de performances hétérogènes. Dans la base, codefuse-ai/F2LLM-v2-14B arrive en tête à 71 %, contre une médiane de 58 % pour les 47 modèles évalués. Cet écart révèle une différenciation réelle entre le meilleur résultat et le niveau central du classement, sans indiquer une saturation complète du benchmark.

La fiabilité appelle toutefois à la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de façon indépendante dans un protocole unique. Une contamination éventuelle des données d’évaluation pourrait également favoriser certains résultats. Enfin, la portée reste spécialisée : MTEB: Scandinavian mesure les embeddings pour le danois, le suédois, le norvégien Bokmål et Nynorsk, ainsi que le bornholmsk, sur la classification, le clustering, le retrieval et le bitext mining. Le classement renseigne donc sur ce périmètre précis, pas sur les capacités générales des modèles.


Sources des scores : mteb.