Farsi
MTEB: Farsi est un benchmark public consacré à la qualité des embeddings de textes en persan. Créé par FaMTEB, notamment Erfan Zinvandi, Morteza Alikhani et Mehran Sarmadi, il couvre plusieurs usages, de la classification à la recherche d’information, en passant par le clustering et la…
MTEB: Farsi est un benchmark public consacré à la qualité des embeddings de textes en persan. Créé par FaMTEB, notamment Erfan Zinvandi, Morteza Alikhani et Mehran Sarmadi, il couvre plusieurs usages, de la classification à la recherche d’information, en passant par le clustering et la similarité sémantique.
Publié en 2025, il sert à comparer la capacité des modèles à produire des représentations pertinentes selon différents contextes. Sa deuxième version privilégie l’accessibilité des grands jeux de données, retire des jeux de faible qualité et ajoute des données jugées meilleures.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | FaMTEB - Erfan Zinvandi, Morteza Alikhani, Mehran Sarmadi et al. |
| Capacités mesurées | Qualité des embeddings de texte en persan couvrant classification, clustering, pair classification, reranking, retrieval, summary retrieval et similarité sémantique. |
| Modalité | Texte |
| Type de questions | Évaluation d'embeddings de texte persan (classification, clustering, pair classification, reranking, retrieval, summary retrieval, STS) |
| Métrique d'évaluation | Score dépendant de la tâche (nDCG@10, accuracy, V-measure, Spearman), agrégé |
| Accès | Public |
| Langues | Persan (farsi) |
| Taille du jeu | 63 datasets sur 7 tâches |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (30)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 73,9 % | 9 mars 2026 | ✅ Mesuré |
| 2 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 73,0 % | 9 mars 2026 | ✅ Mesuré |
| 3 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 72,1 % | 9 mars 2026 | ✅ Mesuré |
| 4 | MCINext/Hakim | MCINext | 🟢 Ouvert | 71,6 % | 10 mai 2025 | ✅ Mesuré |
| 5 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 70,4 % | 9 mars 2026 | ✅ Mesuré |
| 6 | MCINext/Hakim-small | MCINext | 🟢 Ouvert | 68,5 % | 10 mai 2025 | ✅ Mesuré |
| 7 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 68,3 % | 9 mars 2026 | ✅ Mesuré |
| 8 | google/embeddinggemma-300m | 🟢 Ouvert | 67,8 % | 4 septembre 2025 | ✅ Mesuré | |
| 9 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 66,4 % | 9 mars 2026 | ✅ Mesuré |
| 10 | BAAI: bge-m3 | BAAI | 🟢 Ouvert | 65,6 % | 18 novembre 2025 | ✅ Mesuré |
| 11 | jinaai/jina-embeddings-v3 | Jina AI | 🟢 Ouvert | 65,3 % | 18 septembre 2024 | ✅ Mesuré |
| 12 | Alibaba-NLP/gte-Qwen2-7B-instruct | Alibaba | 🟢 Ouvert | 64,6 % | 15 juin 2024 | ✅ Mesuré |
| 13 | Intfloat: Multilingual-E5-Large | Intfloat | 🟢 Ouvert | 64,3 % | 18 novembre 2025 | ✅ Mesuré |
| 14 | MCINext/Hakim-unsup | MCINext | 🟢 Ouvert | 63,8 % | 10 mai 2025 | ✅ Mesuré |
| 15 | PartAI/Tooka-SBERT-V2-Large | PartAI | 🟢 Ouvert | 63,3 % | 1 mai 2025 | ✅ Mesuré |
| 16 | intfloat/multilingual-e5-base | Intfloat | 🟢 Ouvert | 62,6 % | 8 février 2024 | ✅ Mesuré |
| 17 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 62,4 % | 9 mars 2026 | ✅ Mesuré |
| 18 | PartAI/Tooka-SBERT-V2-Small | PartAI | 🟢 Ouvert | 62,0 % | 1 mai 2025 | ✅ Mesuré |
| 19 | intfloat/e5-mistral-7b-instruct | Intfloat | 🟢 Ouvert | 61,0 % | 8 février 2024 | ✅ Mesuré |
| 20 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 60,1 % | 9 mars 2026 | ✅ Mesuré |
| 21 | PartAI/Tooka-SBERT | PartAI | 🟢 Ouvert | 59,3 % | 7 décembre 2024 | ✅ Mesuré |
| 22 | openai/text-embedding-3-small | OpenAI | 🟢 Ouvert | 54,9 % | 25 janvier 2024 | ✅ Mesuré |
| 23 | sentence-transformers/LaBSE | Sentence Transformers | 🟢 Ouvert | 53,2 % | 1 novembre 2019 | ✅ Mesuré |
| 24 | sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 | Sentence Transformers | 🟢 Ouvert | 51,3 % | 1 novembre 2019 | ✅ Mesuré |
| 25 | PartAI/TookaBERT-Base | PartAI | 🟢 Ouvert | 46,5 % | 8 décembre 2024 | ✅ Mesuré |
| 26 | sbunlp/fabert | sbunlp | 🟢 Ouvert | 46,4 % | 7 octobre 2024 | ✅ Mesuré |
| 27 | HooshvareLab/bert-base-parsbert-uncased | HooshvareLab | 🟢 Ouvert | 45,6 % | 19 mai 2021 | ✅ Mesuré |
| 28 | myrkur/sentence-transformer-parsbert-fa | myrkur | 🟢 Ouvert | 43,3 % | 10 décembre 2024 | ✅ Mesuré |
| 29 | m3hrdadfi/bert-zwnj-wnli-mean-tokens | m3hrdadfi | 🟢 Ouvert | 43,2 % | 28 juin 2021 | ✅ Mesuré |
| 30 | m3hrdadfi/roberta-zwnj-wnli-mean-tokens | m3hrdadfi | 🟢 Ouvert | 43,1 % | 28 juin 2021 | ✅ Mesuré |
Classement établi sur 30 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 62,9 %.
Notre analyse
Un score élevé indique qu’un modèle obtient de bons résultats agrégés sur les différentes tâches d’embeddings en persan. L’interprétation dépend toutefois des métriques propres à chaque tâche, notamment nDCG@10, l’accuracy, la V-measure et la corrélation de Spearman. Le classement couvre 30 modèles, avec une médiane de 63 %. codefuse-ai/F2LLM-v2-14B arrive en tête à 74 %, soit un avantage de 11 points sur cette médiane. Cet écart met en évidence une performance globale supérieure au centre du classement, sans signifier une domination identique sur chaque catégorie.
La rigueur de comparaison doit être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que tous mesurés dans un protocole indépendant unique. Les risques méthodologiques de contamination ou de saturation appellent donc une lecture prudente du classement. La portée reste circonscrite aux embeddings de textes en persan et aux sept familles de tâches incluses. Le benchmark renseigne ainsi la polyvalence dans ce périmètre, mais le score agrégé peut atténuer les écarts entre compétences spécifiques.
Sources des scores : mteb.