Spanish
MTEB: Spanish est un benchmark communautaire créé par MTEB / embeddings-benchmark, avec des jeux de données espagnols notamment issus de jina-ai/mteb-es. Il évalue la qualité des embeddings de texte en espagnol dans plusieurs familles de tâches.
MTEB: Spanish est un benchmark communautaire créé par MTEB / embeddings-benchmark, avec des jeux de données espagnols notamment issus de jina-ai/mteb-es. Il évalue la qualité des embeddings de texte en espagnol dans plusieurs familles de tâches.
Son périmètre couvre la classification, le clustering, la comparaison de paires, le reranking, la recherche d’information et la similarité sémantique. Il sert ainsi à comparer la capacité des modèles à produire des représentations textuelles utiles dans des contextes variés, au moyen de scores adaptés à chaque tâche puis agrégés.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MTEB / embeddings-benchmark (benchmark communautaire ; jeux de données espagnols notamment via jina-ai/mteb-es) |
| Capacités mesurées | Qualité des embeddings de texte en espagnol couvrant classification, clustering, pair classification, reranking, retrieval et similarité sémantique. |
| Modalité | Texte |
| Type de questions | Évaluation d'embeddings de texte (classification, clustering, pair classification, reranking, retrieval, STS) |
| Métrique d'évaluation | Score dépendant de la tâche (nDCG@10, accuracy, V-measure, Spearman), agrégé |
| Accès | Public |
| Langues | Espagnol |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (27)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 73,3 % | 9 mars 2026 | ✅ Mesuré |
| 2 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 72,9 % | 9 mars 2026 | ✅ Mesuré |
| 3 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 72,5 % | 9 mars 2026 | ✅ Mesuré |
| 4 | google/gemini-embedding-001 | 🟢 Ouvert | 72,0 % | 7 mars 2025 | ✅ Mesuré | |
| 5 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 71,0 % | 9 mars 2026 | ✅ Mesuré |
| 6 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 69,4 % | 9 mars 2026 | ✅ Mesuré |
| 7 | openai/text-embedding-3-large | OpenAI | 🟢 Ouvert | 68,5 % | 25 janvier 2024 | ✅ Mesuré |
| 8 | jinaai/jina-embeddings-v5-omni-small | Jina AI | 🟢 Ouvert | 68,2 % | 1 avril 2026 | ✅ Mesuré |
| 9 | jinaai/jina-embeddings-v5-text-small | Jina AI | 🟢 Ouvert | 68,2 % | 17 février 2026 | ✅ Mesuré |
| 10 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 67,8 % | 9 mars 2026 | ✅ Mesuré |
| 11 | jinaai/jina-embeddings-v5-omni-nano | Jina AI | 🟢 Ouvert | 66,8 % | 1 avril 2026 | ✅ Mesuré |
| 12 | jinaai/jina-embeddings-v5-text-nano | Jina AI | 🟢 Ouvert | 66,8 % | 17 février 2026 | ✅ Mesuré |
| 13 | intfloat/multilingual-e5-large-instruct | Intfloat | 🟢 Ouvert | 65,8 % | 8 février 2024 | ✅ Mesuré |
| 14 | openai/text-embedding-3-small | OpenAI | 🟢 Ouvert | 65,8 % | 25 janvier 2024 | ✅ Mesuré |
| 15 | BAAI: bge-m3 | BAAI | 🟢 Ouvert | 64,8 % | 18 novembre 2025 | ✅ Mesuré |
| 16 | Intfloat: Multilingual-E5-Large | Intfloat | 🟢 Ouvert | 64,7 % | 18 novembre 2025 | ✅ Mesuré |
| 17 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 63,6 % | 9 mars 2026 | ✅ Mesuré |
| 18 | intfloat/multilingual-e5-base | Intfloat | 🟢 Ouvert | 62,5 % | 8 février 2024 | ✅ Mesuré |
| 19 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 61,6 % | 9 mars 2026 | ✅ Mesuré |
| 20 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 61,4 % | 8 février 2024 | ✅ Mesuré |
| 21 | sentence-transformers/paraphrase-multilingual-mpnet-base-v2 | Sentence Transformers | 🟢 Ouvert | 58,2 % | 1 novembre 2019 | ✅ Mesuré |
| 22 | sentence-transformers/LaBSE | Sentence Transformers | 🟢 Ouvert | 51,5 % | 1 novembre 2019 | ✅ Mesuré |
| 23 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 51,3 % | 15 janvier 2025 | ✅ Mesuré |
| 24 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 49,8 % | 23 mai 2025 | ✅ Mesuré |
| 25 | nomic-ai/nomic-embed-text-v1.5 | Nomic AI | 🟢 Ouvert | 48,9 % | 10 février 2024 | ✅ Mesuré |
| 26 | sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 | Sentence Transformers | 🟢 Ouvert | 46,3 % | 1 novembre 2019 | ✅ Mesuré |
| 27 | Snowflake/snowflake-arctic-embed-m-v1.5 | Snowflake | 🟢 Ouvert | 46,3 % | 8 juillet 2024 | ✅ Mesuré |
Classement établi sur 27 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 65,8 %.
Notre analyse
Un score élevé sur MTEB: Spanish indique qu’un modèle produit des embeddings performants sur plusieurs usages en espagnol, plutôt que sur une seule capacité. L’agrégation combine des métriques dépendant des tâches, notamment nDCG@10, accuracy, V-measure et Spearman. Elle fournit une vue synthétique, mais peut masquer des écarts entre classification, retrieval, clustering ou similarité sémantique.
La fiabilité doit être interprétée avec prudence, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre entièrement indépendant. Le caractère public du benchmark implique aussi de considérer un risque de contamination lors de l’interprétation, sans établir qu’elle a effectivement eu lieu. La portée reste centrée sur les embeddings de texte en espagnol et sur les catégories de tâches incluses.
Parmi les 27 modèles recensés, codefuse-ai/F2LLM-v2-14B occupe la première place à 73 %, contre une médiane de 66 %. Cet écart montre un avantage mesurable en tête du classement, tandis que le meilleur score, encore éloigné du plafond théorique, ne traduit pas une saturation complète du benchmark.
Sources des scores : mteb.