Spanish

MTEB: Spanish est un benchmark communautaire créé par MTEB / embeddings-benchmark, avec des jeux de données espagnols notamment issus de jina-ai/mteb-es. Il évalue la qualité des embeddings de texte en espagnol dans plusieurs familles de tâches.

MTEB: Spanish est un benchmark communautaire créé par MTEB / embeddings-benchmark, avec des jeux de données espagnols notamment issus de jina-ai/mteb-es. Il évalue la qualité des embeddings de texte en espagnol dans plusieurs familles de tâches.

Son périmètre couvre la classification, le clustering, la comparaison de paires, le reranking, la recherche d’information et la similarité sémantique. Il sert ainsi à comparer la capacité des modèles à produire des représentations textuelles utiles dans des contextes variés, au moyen de scores adaptés à chaque tâche puis agrégés.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB / embeddings-benchmark (benchmark communautaire ; jeux de données espagnols notamment via jina-ai/mteb-es)
Capacités mesuréesQualité des embeddings de texte en espagnol couvrant classification, clustering, pair classification, reranking, retrieval et similarité sémantique.
ModalitéTexte
Type de questionsÉvaluation d'embeddings de texte (classification, clustering, pair classification, reranking, retrieval, STS)
Métrique d'évaluationScore dépendant de la tâche (nDCG@10, accuracy, V-measure, Spearman), agrégé
AccèsPublic
LanguesEspagnol
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (27)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert73,3 %9 mars 2026✅ Mesuré
2codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert72,9 %9 mars 2026✅ Mesuré
3codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert72,5 %9 mars 2026✅ Mesuré
4google/gemini-embedding-001Google🟢 Ouvert72,0 %7 mars 2025✅ Mesuré
5codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert71,0 %9 mars 2026✅ Mesuré
6codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert69,4 %9 mars 2026✅ Mesuré
7openai/text-embedding-3-largeOpenAI🟢 Ouvert68,5 %25 janvier 2024✅ Mesuré
8jinaai/jina-embeddings-v5-omni-smallJina AI🟢 Ouvert68,2 %1 avril 2026✅ Mesuré
9jinaai/jina-embeddings-v5-text-smallJina AI🟢 Ouvert68,2 %17 février 2026✅ Mesuré
10codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert67,8 %9 mars 2026✅ Mesuré
11jinaai/jina-embeddings-v5-omni-nanoJina AI🟢 Ouvert66,8 %1 avril 2026✅ Mesuré
12jinaai/jina-embeddings-v5-text-nanoJina AI🟢 Ouvert66,8 %17 février 2026✅ Mesuré
13intfloat/multilingual-e5-large-instructIntfloat🟢 Ouvert65,8 %8 février 2024✅ Mesuré
14openai/text-embedding-3-smallOpenAI🟢 Ouvert65,8 %25 janvier 2024✅ Mesuré
15BAAI: bge-m3BAAI🟢 Ouvert64,8 %18 novembre 2025✅ Mesuré
16Intfloat: Multilingual-E5-LargeIntfloat🟢 Ouvert64,7 %18 novembre 2025✅ Mesuré
17codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert63,6 %9 mars 2026✅ Mesuré
18intfloat/multilingual-e5-baseIntfloat🟢 Ouvert62,5 %8 février 2024✅ Mesuré
19codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert61,6 %9 mars 2026✅ Mesuré
20intfloat/multilingual-e5-smallIntfloat🟢 Ouvert61,4 %8 février 2024✅ Mesuré
21sentence-transformers/paraphrase-multilingual-mpnet-base-v2Sentence Transformers🟢 Ouvert58,2 %1 novembre 2019✅ Mesuré
22sentence-transformers/LaBSESentence Transformers🟢 Ouvert51,5 %1 novembre 2019✅ Mesuré
23sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert51,3 %15 janvier 2025✅ Mesuré
24minishlab/potion-multilingual-128Mminishlab🟢 Ouvert49,8 %23 mai 2025✅ Mesuré
25nomic-ai/nomic-embed-text-v1.5Nomic AI🟢 Ouvert48,9 %10 février 2024✅ Mesuré
26sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2Sentence Transformers🟢 Ouvert46,3 %1 novembre 2019✅ Mesuré
27Snowflake/snowflake-arctic-embed-m-v1.5Snowflake🟢 Ouvert46,3 %8 juillet 2024✅ Mesuré

Classement établi sur 27 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 65,8 %.

Notre analyse

Un score élevé sur MTEB: Spanish indique qu’un modèle produit des embeddings performants sur plusieurs usages en espagnol, plutôt que sur une seule capacité. L’agrégation combine des métriques dépendant des tâches, notamment nDCG@10, accuracy, V-measure et Spearman. Elle fournit une vue synthétique, mais peut masquer des écarts entre classification, retrieval, clustering ou similarité sémantique.

La fiabilité doit être interprétée avec prudence, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre entièrement indépendant. Le caractère public du benchmark implique aussi de considérer un risque de contamination lors de l’interprétation, sans établir qu’elle a effectivement eu lieu. La portée reste centrée sur les embeddings de texte en espagnol et sur les catégories de tâches incluses.

Parmi les 27 modèles recensés, codefuse-ai/F2LLM-v2-14B occupe la première place à 73 %, contre une médiane de 66 %. Cet écart montre un avantage mesurable en tête du classement, tandis que le meilleur score, encore éloigné du plafond théorique, ne traduit pas une saturation complète du benchmark.


Sources des scores : mteb.