Portuguese

MTEB: Portuguese est un benchmark créé par les contributeurs de MTEB, dont N. Muennighoff et al. Il évalue la qualité générale des représentations vectorielles de textes en portugais à travers la similarité sémantique, la classification, le reclassement de résultats et la recherche…

MTEB: Portuguese est un benchmark créé par les contributeurs de MTEB, dont N. Muennighoff et al. Il évalue la qualité générale des représentations vectorielles de textes en portugais à travers la similarité sémantique, la classification, le reclassement de résultats et la recherche d’information.

Son ensemble hétérogène combine textes étiquetés, paires de textes, requêtes et documents. Il sert à comparer la capacité des modèles d’embeddings à produire des représentations pertinentes pour plusieurs usages, plutôt qu’à mesurer une seule aptitude isolée.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB contributors (N. Muennighoff et al.)
Capacités mesuréesMesure la qualité générale des représentations vectorielles de textes portugais pour la similarité sémantique, la classification, le reclassement de résultats et la recherche d'information.
ModalitéTexte
Type de questionsEnsemble hétérogène comprenant des textes étiquetés pour la classification, des paires de textes pour la similarité sémantique, ainsi que des requêtes et documents à classer pour le reranking et la recherche d'information.
Métrique d'évaluationMoyenne agrégée de métriques propres à chaque tâche, notamment accuracy pour la classification, corrélation de Spearman pour la similarité sémantique, MAP pour le reranking et nDCG@10 pour la recherche.
AccèsPublic
Languesportugais
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (18)

#ModèleÉditeurLicenceScoreSortieFiabilité
1intfloat/multilingual-e5-large-instructIntfloat🟢 Ouvert72,1 %8 février 2024✅ Mesuré
2Qwen: Qwen3 Embedding 0.6BQwen🟢 Ouvert71,6 %5 novembre 2025✅ Mesuré
3iara-project/e5-large-matryoshka-sts-ptiara-project🟢 Ouvert70,4 %23 mars 2026✅ Mesuré
4Alibaba-NLP/gte-multilingual-baseAlibaba🟢 Ouvert69,7 %20 juillet 2024✅ Mesuré
5Intfloat: Multilingual-E5-LargeIntfloat🟢 Ouvert69,2 %18 novembre 2025✅ Mesuré
6hotchpotch/bekko-embedding-v1-a25mhotchpotch🟢 Ouvert68,8 %28 juillet 2026✅ Mesuré
7iara-project/BERTimbau-large-matryoshka-sts-ptiara-project🟢 Ouvert67,6 %23 mars 2026✅ Mesuré
8intfloat/multilingual-e5-baseIntfloat🟢 Ouvert67,5 %8 février 2024✅ Mesuré
9hotchpotch/bekko-embedding-v1-a8mhotchpotch🟢 Ouvert66,8 %28 juillet 2026✅ Mesuré
10intfloat/multilingual-e5-smallIntfloat🟢 Ouvert66,5 %8 février 2024✅ Mesuré
11llm-semantic-router/mmbert-embed-32k-2d-matryoshkallm-semantic-router🟢 Ouvert66,2 %26 janvier 2026✅ Mesuré
12PORTULAN/serafim-900m-portuguese-pt-sentence-encoderPORTULAN🟢 Ouvert66,1 %4 juillet 2024✅ Mesuré
13sentence-transformers/paraphrase-multilingual-mpnet-base-v2Sentence Transformers🟢 Ouvert64,6 %1 novembre 2019✅ Mesuré
14iara-project/ModBERTBr-matryoshka-sts-ptiara-project🟢 Ouvert64,4 %1 avril 2026✅ Mesuré
15codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert60,3 %9 mars 2026✅ Mesuré
16sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert59,4 %15 janvier 2025✅ Mesuré
17rufimelo/Legal-BERTimbau-sts-large-ma-v3rufimelo🟢 Ouvert59,2 %21 septembre 2022✅ Mesuré
18minishlab/potion-multilingual-128Mminishlab🟢 Ouvert56,8 %23 mai 2025✅ Mesuré

Classement établi sur 18 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 66,7 %.

Notre analyse

Un score élevé indique une performance globalement solide sur les différentes familles de tâches, selon une moyenne réunissant notamment accuracy, corrélation de Spearman, MAP et nDCG@10. Cette agrégation facilite la comparaison générale, mais peut masquer des écarts entre classification, similarité, reranking et retrieval. Dans la base, intfloat/multilingual-e5-large-instruct arrive en tête à 72 %, contre une médiane de 67 % parmi 18 modèles. Cet écart limité suggère un classement relativement resserré, sans suffire à démontrer une saturation complète du benchmark.

La fiabilité doit être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que produits dans un protocole de mesure indépendant. L’accès public facilite la reproductibilité, mais crée aussi un risque de contamination lorsque les données ou tâches influencent l’entraînement ou l’optimisation des modèles. Enfin, la portée reste ciblée sur les textes portugais et sur quatre usages des embeddings. Le classement renseigne donc sur la polyvalence dans ce périmètre précis, sans constituer une mesure générale de toutes les capacités d’un modèle.


Sources des scores : mteb.