Scandinavian
MTEB: Scandinavian est un benchmark public consacré à la qualité des embeddings de texte dans les principales langues scandinaves continentales. Publié en 2024, il a été créé par le Scandinavian Embedding Benchmark, sous la direction de Kenneth Enevoldsen et al., puis intégré à MTEB.
MTEB: Scandinavian est un benchmark public consacré à la qualité des embeddings de texte dans les principales langues scandinaves continentales. Publié en 2024, il a été créé par le Scandinavian Embedding Benchmark, sous la direction de Kenneth Enevoldsen et al., puis intégré à MTEB.
Son évaluation couvre la classification, le clustering, la recherche d’information et le bitext mining entre dialectes ou formes écrites. Cette diversité permet de comparer la capacité des modèles à produire des représentations utiles dans plusieurs contextes linguistiques, notamment en danois, suédois et norvégien.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Scandinavian Embedding Benchmark (SEB) - Kenneth Enevoldsen et al. (intégré à MTEB) |
| Capacités mesurées | Qualité des embeddings de texte pour les langues scandinaves mainland, à travers classification, clustering, retrieval et bitext mining entre dialectes/formes écrites. |
| Modalité | Texte |
| Type de questions | Évaluation d'embeddings de texte (classification, clustering, retrieval, bitext mining) |
| Métrique d'évaluation | Score dépendant de la tâche (nDCG@10, accuracy, V-measure, etc.), agrégé |
| Accès | Public |
| Langues | Danois, suédois, norvégien (Bokmål, Nynorsk) ; dialecte bornholmsk |
| Taille du jeu | 24 tâches / 10 sous-tâches sur 4 catégories |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (47)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 71,1 % | 9 mars 2026 | ✅ Mesuré |
| 2 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 69,9 % | 9 mars 2026 | ✅ Mesuré |
| 3 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 68,5 % | 9 mars 2026 | ✅ Mesuré |
| 4 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 67,2 % | 9 mars 2026 | ✅ Mesuré |
| 5 | Salesforce/SFR-Embedding-2_R | Salesforce | 🟢 Ouvert | 65,6 % | 14 juin 2024 | ✅ Mesuré |
| 6 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 64,3 % | 9 mars 2026 | ✅ Mesuré |
| 7 | GritLM/GritLM-7B | GritLM | 🟢 Ouvert | 64,1 % | 15 février 2024 | ✅ Mesuré |
| 8 | nicher92/saga-embed_v1 | nicher92 | 🟢 Ouvert | 63,5 % | 9 janvier 2025 | ✅ Mesuré |
| 9 | openai/text-embedding-3-large | OpenAI | 🟢 Ouvert | 62,5 % | 25 janvier 2024 | ✅ Mesuré |
| 10 | Cohere/Cohere-embed-multilingual-v3.0 | Cohere | 🟢 Ouvert | 62,2 % | 2 novembre 2023 | ✅ Mesuré |
| 11 | intfloat/e5-mistral-7b-instruct | Intfloat | 🟢 Ouvert | 62,0 % | 8 février 2024 | ✅ Mesuré |
| 12 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 61,9 % | 9 mars 2026 | ✅ Mesuré |
| 13 | intfloat/multilingual-e5-large-instruct | Intfloat | 🟢 Ouvert | 61,6 % | 8 février 2024 | ✅ Mesuré |
| 14 | voyageai/voyage-finance-2 | Voyage AI | 🟢 Ouvert | 61,6 % | 30 mai 2024 | ✅ Mesuré |
| 15 | voyageai/voyage-multilingual-2 | Voyage AI | 🟢 Ouvert | 61,2 % | 10 juin 2024 | ✅ Mesuré |
| 16 | Qwen: Qwen3 Embedding 0.6B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,0 % | 5 novembre 2025 | ✅ Mesuré |
| 17 | voyageai/voyage-3.5 (output_dtype=int8) | Voyage AI | 🟢 Ouvert | 60,8 % | 21 janvier 2025 | ✅ Mesuré |
| 18 | voyageai/voyage-3.5 | Voyage AI | 🟢 Ouvert | 60,4 % | 21 janvier 2025 | ✅ Mesuré |
| 19 | voyageai/voyage-large-2-instruct | Voyage AI | 🟢 Ouvert | 59,7 % | 5 mai 2024 | ✅ Mesuré |
| 20 | voyageai/voyage-3 | Voyage AI | 🟢 Ouvert | 58,6 % | 18 septembre 2024 | ✅ Mesuré |
| 21 | voyageai/voyage-3.5 (output_dtype=binary) | Voyage AI | 🟢 Ouvert | 58,4 % | 21 janvier 2025 | ✅ Mesuré |
| 22 | openai/text-embedding-3-small | OpenAI | 🟢 Ouvert | 58,4 % | 25 janvier 2024 | ✅ Mesuré |
| 23 | voyageai/voyage-3-lite | Voyage AI | 🟢 Ouvert | 58,4 % | 18 septembre 2024 | ✅ Mesuré |
| 24 | BAAI: bge-m3 | BAAI | 🟢 Ouvert | 57,9 % | 18 novembre 2025 | ✅ Mesuré |
| 25 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 57,8 % | 9 mars 2026 | ✅ Mesuré |
| 26 | Cohere/Cohere-embed-multilingual-light-v3.0 | Cohere | 🟢 Ouvert | 56,9 % | 2 novembre 2023 | ✅ Mesuré |
| 27 | Snowflake/snowflake-arctic-embed-l-v2.0 | Snowflake | 🟢 Ouvert | 56,6 % | 4 décembre 2024 | ✅ Mesuré |
| 28 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 56,1 % | 8 février 2024 | ✅ Mesuré |
| 29 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 55,5 % | 9 mars 2026 | ✅ Mesuré |
| 30 | emillykkejensen/EmbeddingGemma-Scandi-300m | emillykkejensen | 🟢 Ouvert | 54,0 % | 17 octobre 2025 | ✅ Mesuré |
| 31 | voyageai/voyage-large-2 | Voyage AI | 🟢 Ouvert | 53,3 % | 29 octobre 2023 | ✅ Mesuré |
| 32 | voyageai/voyage-2 | Voyage AI | 🟢 Ouvert | 52,2 % | 29 octobre 2023 | ✅ Mesuré |
| 33 | emillykkejensen/mmBERTscandi-base-embedding | emillykkejensen | 🟢 Ouvert | 52,1 % | 17 octobre 2025 | ✅ Mesuré |
| 34 | NbAiLab/nb-sbert-base | NbAiLab | 🟢 Ouvert | 51,9 % | 23 novembre 2022 | ✅ Mesuré |
| 35 | sentence-transformers/paraphrase-multilingual-mpnet-base-v2 | Sentence Transformers | 🟢 Ouvert | 51,2 % | 1 novembre 2019 | ✅ Mesuré |
| 36 | sentence-transformers/LaBSE | Sentence Transformers | 🟢 Ouvert | 48,5 % | 1 novembre 2019 | ✅ Mesuré |
| 37 | sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 | Sentence Transformers | 🟢 Ouvert | 47,8 % | 1 novembre 2019 | ✅ Mesuré |
| 38 | KennethEnevoldsen/dfm-sentence-encoder-large | KennethEnevoldsen | 🟢 Ouvert | 47,8 % | 12 juillet 2023 | ✅ Mesuré |
| 39 | mixedbread-ai/mxbai-embed-large-v1 | Mixedbread AI | 🟢 Ouvert | 45,3 % | 7 mars 2024 | ✅ Mesuré |
| 40 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 44,7 % | 15 janvier 2025 | ✅ Mesuré |
| 41 | KennethEnevoldsen/dfm-sentence-encoder-medium | KennethEnevoldsen | 🟢 Ouvert | 40,6 % | 12 juillet 2023 | ✅ Mesuré |
| 42 | rasgaard/m2v-dfm-large | rasgaard | 🟢 Ouvert | 40,3 % | 8 octobre 2025 | ✅ Mesuré |
| 43 | Sentence Transformers: all-MiniLM-L6-v2 | Sentence Transformers | 🟢 Ouvert | 38,9 % | 17 novembre 2025 | ✅ Mesuré |
| 44 | andersborges/model2vecdk | andersborges | 🟢 Ouvert | 38,1 % | 21 novembre 2025 | ✅ Mesuré |
| 45 | andersborges/model2vecdk-stem | andersborges | 🟢 Ouvert | 38,0 % | 21 novembre 2025 | ✅ Mesuré |
| 46 | FacebookAI/xlm-roberta-large | FacebookAI | 🟢 Ouvert | 36,5 % | 5 novembre 2019 | ✅ Mesuré |
| 47 | FacebookAI/xlm-roberta-base | FacebookAI | 🟢 Ouvert | 35,9 % | 5 novembre 2019 | ✅ Mesuré |
Classement établi sur 47 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 57,9 %.
Notre analyse
Un score agrégé élevé indique qu’un modèle produit des embeddings performants sur plusieurs familles de tâches, selon des métriques adaptées comme nDCG@10, l’accuracy ou la V-measure. Il ne correspond donc pas à une mesure unique et doit être interprété comme une synthèse de performances hétérogènes. Dans la base, codefuse-ai/F2LLM-v2-14B arrive en tête à 71 %, contre une médiane de 58 % pour les 47 modèles évalués. Cet écart révèle une différenciation réelle entre le meilleur résultat et le niveau central du classement, sans indiquer une saturation complète du benchmark.
La fiabilité appelle toutefois à la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de façon indépendante dans un protocole unique. Une contamination éventuelle des données d’évaluation pourrait également favoriser certains résultats. Enfin, la portée reste spécialisée : MTEB: Scandinavian mesure les embeddings pour le danois, le suédois, le norvégien Bokmål et Nynorsk, ainsi que le bornholmsk, sur la classification, le clustering, le retrieval et le bitext mining. Le classement renseigne donc sur ce périmètre précis, pas sur les capacités générales des modèles.
Sources des scores : mteb.