Polish

MTEB: Polish est un benchmark consacré à l’évaluation des plongements de texte en polonais. Créé par la communauté MTEB/MMTEB à partir de PL-MTEB, développé par Rafal Poswiata et ses coauteurs à l’OPI-PIB, il associe des jeux communautaires adaptés au corpus de littérature scientifique…

MTEB: Polish est un benchmark consacré à l’évaluation des plongements de texte en polonais. Créé par la communauté MTEB/MMTEB à partir de PL-MTEB, développé par Rafal Poswiata et ses coauteurs à l’OPI-PIB, il associe des jeux communautaires adaptés au corpus de littérature scientifique polonaise PLSC.

Il mesure la qualité des représentations textuelles dans plusieurs cadres complémentaires : classification, clustering, classification de paires, recherche et similarité sémantique. Cette diversité permet de comparer la capacité des modèles à produire des plongements utiles pour différents usages linguistiques et documentaires.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkCommunaute MTEB/MMTEB ; base sur PL-MTEB (Rafal Poswiata et al., OPI-PIB)
Capacités mesuréesEvalue la qualite des plongements de texte en polonais sur la classification, le clustering, la classification de paires, la recherche et la similarite semantique, en combinant des jeux communautaires adaptes et le corpus scientifique PLSC.
ModalitéTexte
Type de questionsTaches d'embedding de texte (classification, clustering, pair classification, retrieval, similarite semantique)
Métrique d'évaluationVariable selon la tache (nDCG@10, accuracy, AP, correlation de Spearman) ; score moyen MTEB
AccèsPublic
LicenceApache-2.0 (cadre MTEB) ; licences des jeux de donnees variables
LanguesPolonais
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (10)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert75,1 %9 mars 2026✅ Mesuré
2codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert74,6 %9 mars 2026✅ Mesuré
3codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert73,4 %9 mars 2026✅ Mesuré
4codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert72,0 %9 mars 2026✅ Mesuré
5codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert69,6 %9 mars 2026✅ Mesuré
6codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert66,5 %9 mars 2026✅ Mesuré
7codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert62,3 %9 mars 2026✅ Mesuré
8codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert59,8 %9 mars 2026✅ Mesuré
9intfloat/multilingual-e5-smallIntfloat🟢 Ouvert59,5 %8 février 2024✅ Mesuré
10sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert50,9 %15 janvier 2025✅ Mesuré

Classement établi sur 10 modèles évalués. Score médian de l'ensemble : 68,1 %.

Notre analyse

Un score élevé indique qu’un modèle produit des plongements performants sur l’ensemble des tâches, selon des métriques adaptées à chacune, notamment nDCG@10, accuracy, AP et corrélation de Spearman. Le classement place codefuse-ai/F2LLM-v2-14B en tête à 75 %, contre une médiane de 68 % parmi les dix modèles évalués. Cet écart montre un avantage mesurable du premier modèle, sans suggérer une saturation complète du benchmark.

La lecture des résultats requiert toutefois de la prudence : les scores sont majoritairement auto-déclarés par les éditeurs, ce qui offre une garantie moins homogène qu’une évaluation entièrement reproduite par une instance indépendante. Le caractère public du benchmark et l’emploi de jeux communautaires adaptés créent aussi un risque d’exposition préalable des modèles aux contenus d’évaluation, donc de contamination. Enfin, sa portée reste ciblée sur le polonais et sur les tâches de plongement de texte. Le classement renseigne ainsi sur la polyvalence des représentations dans ce périmètre précis, et non sur les capacités générales des modèles d’IA.


Sources des scores : mteb.