Polish
MTEB: Polish est un benchmark consacré à l’évaluation des plongements de texte en polonais. Créé par la communauté MTEB/MMTEB à partir de PL-MTEB, développé par Rafal Poswiata et ses coauteurs à l’OPI-PIB, il associe des jeux communautaires adaptés au corpus de littérature scientifique…
MTEB: Polish est un benchmark consacré à l’évaluation des plongements de texte en polonais. Créé par la communauté MTEB/MMTEB à partir de PL-MTEB, développé par Rafal Poswiata et ses coauteurs à l’OPI-PIB, il associe des jeux communautaires adaptés au corpus de littérature scientifique polonaise PLSC.
Il mesure la qualité des représentations textuelles dans plusieurs cadres complémentaires : classification, clustering, classification de paires, recherche et similarité sémantique. Cette diversité permet de comparer la capacité des modèles à produire des plongements utiles pour différents usages linguistiques et documentaires.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Communaute MTEB/MMTEB ; base sur PL-MTEB (Rafal Poswiata et al., OPI-PIB) |
| Capacités mesurées | Evalue la qualite des plongements de texte en polonais sur la classification, le clustering, la classification de paires, la recherche et la similarite semantique, en combinant des jeux communautaires adaptes et le corpus scientifique PLSC. |
| Modalité | Texte |
| Type de questions | Taches d'embedding de texte (classification, clustering, pair classification, retrieval, similarite semantique) |
| Métrique d'évaluation | Variable selon la tache (nDCG@10, accuracy, AP, correlation de Spearman) ; score moyen MTEB |
| Accès | Public |
| Licence | Apache-2.0 (cadre MTEB) ; licences des jeux de donnees variables |
| Langues | Polonais |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (10)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 75,1 % | 9 mars 2026 | ✅ Mesuré |
| 2 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 74,6 % | 9 mars 2026 | ✅ Mesuré |
| 3 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 73,4 % | 9 mars 2026 | ✅ Mesuré |
| 4 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 72,0 % | 9 mars 2026 | ✅ Mesuré |
| 5 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 69,6 % | 9 mars 2026 | ✅ Mesuré |
| 6 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 66,5 % | 9 mars 2026 | ✅ Mesuré |
| 7 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 62,3 % | 9 mars 2026 | ✅ Mesuré |
| 8 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 59,8 % | 9 mars 2026 | ✅ Mesuré |
| 9 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 59,5 % | 8 février 2024 | ✅ Mesuré |
| 10 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 50,9 % | 15 janvier 2025 | ✅ Mesuré |
Classement établi sur 10 modèles évalués. Score médian de l'ensemble : 68,1 %.
Notre analyse
Un score élevé indique qu’un modèle produit des plongements performants sur l’ensemble des tâches, selon des métriques adaptées à chacune, notamment nDCG@10, accuracy, AP et corrélation de Spearman. Le classement place codefuse-ai/F2LLM-v2-14B en tête à 75 %, contre une médiane de 68 % parmi les dix modèles évalués. Cet écart montre un avantage mesurable du premier modèle, sans suggérer une saturation complète du benchmark.
La lecture des résultats requiert toutefois de la prudence : les scores sont majoritairement auto-déclarés par les éditeurs, ce qui offre une garantie moins homogène qu’une évaluation entièrement reproduite par une instance indépendante. Le caractère public du benchmark et l’emploi de jeux communautaires adaptés créent aussi un risque d’exposition préalable des modèles aux contenus d’évaluation, donc de contamination. Enfin, sa portée reste ciblée sur le polonais et sur les tâches de plongement de texte. Le classement renseigne ainsi sur la polyvalence des représentations dans ce périmètre précis, et non sur les capacités générales des modèles d’IA.
Sources des scores : mteb.