Portuguese
MTEB: Portuguese est un benchmark créé par les contributeurs de MTEB, dont N. Muennighoff et al. Il évalue la qualité générale des représentations vectorielles de textes en portugais à travers la similarité sémantique, la classification, le reclassement de résultats et la recherche…
MTEB: Portuguese est un benchmark créé par les contributeurs de MTEB, dont N. Muennighoff et al. Il évalue la qualité générale des représentations vectorielles de textes en portugais à travers la similarité sémantique, la classification, le reclassement de résultats et la recherche d’information.
Son ensemble hétérogène combine textes étiquetés, paires de textes, requêtes et documents. Il sert à comparer la capacité des modèles d’embeddings à produire des représentations pertinentes pour plusieurs usages, plutôt qu’à mesurer une seule aptitude isolée.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MTEB contributors (N. Muennighoff et al.) |
| Capacités mesurées | Mesure la qualité générale des représentations vectorielles de textes portugais pour la similarité sémantique, la classification, le reclassement de résultats et la recherche d'information. |
| Modalité | Texte |
| Type de questions | Ensemble hétérogène comprenant des textes étiquetés pour la classification, des paires de textes pour la similarité sémantique, ainsi que des requêtes et documents à classer pour le reranking et la recherche d'information. |
| Métrique d'évaluation | Moyenne agrégée de métriques propres à chaque tâche, notamment accuracy pour la classification, corrélation de Spearman pour la similarité sémantique, MAP pour le reranking et nDCG@10 pour la recherche. |
| Accès | Public |
| Langues | portugais |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (18)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | intfloat/multilingual-e5-large-instruct | Intfloat | 🟢 Ouvert | 72,1 % | 8 février 2024 | ✅ Mesuré |
| 2 | Qwen: Qwen3 Embedding 0.6B | Qwen | 🟢 Ouvert | 71,6 % | 5 novembre 2025 | ✅ Mesuré |
| 3 | iara-project/e5-large-matryoshka-sts-pt | iara-project | 🟢 Ouvert | 70,4 % | 23 mars 2026 | ✅ Mesuré |
| 4 | Alibaba-NLP/gte-multilingual-base | Alibaba | 🟢 Ouvert | 69,7 % | 20 juillet 2024 | ✅ Mesuré |
| 5 | Intfloat: Multilingual-E5-Large | Intfloat | 🟢 Ouvert | 69,2 % | 18 novembre 2025 | ✅ Mesuré |
| 6 | hotchpotch/bekko-embedding-v1-a25m | hotchpotch | 🟢 Ouvert | 68,8 % | 28 juillet 2026 | ✅ Mesuré |
| 7 | iara-project/BERTimbau-large-matryoshka-sts-pt | iara-project | 🟢 Ouvert | 67,6 % | 23 mars 2026 | ✅ Mesuré |
| 8 | intfloat/multilingual-e5-base | Intfloat | 🟢 Ouvert | 67,5 % | 8 février 2024 | ✅ Mesuré |
| 9 | hotchpotch/bekko-embedding-v1-a8m | hotchpotch | 🟢 Ouvert | 66,8 % | 28 juillet 2026 | ✅ Mesuré |
| 10 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 66,5 % | 8 février 2024 | ✅ Mesuré |
| 11 | llm-semantic-router/mmbert-embed-32k-2d-matryoshka | llm-semantic-router | 🟢 Ouvert | 66,2 % | 26 janvier 2026 | ✅ Mesuré |
| 12 | PORTULAN/serafim-900m-portuguese-pt-sentence-encoder | PORTULAN | 🟢 Ouvert | 66,1 % | 4 juillet 2024 | ✅ Mesuré |
| 13 | sentence-transformers/paraphrase-multilingual-mpnet-base-v2 | Sentence Transformers | 🟢 Ouvert | 64,6 % | 1 novembre 2019 | ✅ Mesuré |
| 14 | iara-project/ModBERTBr-matryoshka-sts-pt | iara-project | 🟢 Ouvert | 64,4 % | 1 avril 2026 | ✅ Mesuré |
| 15 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 60,3 % | 9 mars 2026 | ✅ Mesuré |
| 16 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 59,4 % | 15 janvier 2025 | ✅ Mesuré |
| 17 | rufimelo/Legal-BERTimbau-sts-large-ma-v3 | rufimelo | 🟢 Ouvert | 59,2 % | 21 septembre 2022 | ✅ Mesuré |
| 18 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 56,8 % | 23 mai 2025 | ✅ Mesuré |
Classement établi sur 18 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 66,7 %.
Notre analyse
Un score élevé indique une performance globalement solide sur les différentes familles de tâches, selon une moyenne réunissant notamment accuracy, corrélation de Spearman, MAP et nDCG@10. Cette agrégation facilite la comparaison générale, mais peut masquer des écarts entre classification, similarité, reranking et retrieval. Dans la base, intfloat/multilingual-e5-large-instruct arrive en tête à 72 %, contre une médiane de 67 % parmi 18 modèles. Cet écart limité suggère un classement relativement resserré, sans suffire à démontrer une saturation complète du benchmark.
La fiabilité doit être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un protocole de mesure indépendant. L’accès public facilite la reproductibilité, mais crée aussi un risque de contamination lorsque les données ou tâches influencent l’entraînement ou l’optimisation des modèles. Enfin, la portée reste ciblée sur les textes portugais et sur quatre usages des embeddings. Le classement renseigne donc sur la polyvalence dans ce périmètre précis, sans constituer une mesure générale de toutes les capacités d’un modèle.
Sources des scores : mteb.