Farsi

MTEB: Farsi est un benchmark public consacré à la qualité des embeddings de textes en persan. Créé par FaMTEB, notamment Erfan Zinvandi, Morteza Alikhani et Mehran Sarmadi, il couvre plusieurs usages, de la classification à la recherche d’information, en passant par le clustering et la…

MTEB: Farsi est un benchmark public consacré à la qualité des embeddings de textes en persan. Créé par FaMTEB, notamment Erfan Zinvandi, Morteza Alikhani et Mehran Sarmadi, il couvre plusieurs usages, de la classification à la recherche d’information, en passant par le clustering et la similarité sémantique.

Publié en 2025, il sert à comparer la capacité des modèles à produire des représentations pertinentes selon différents contextes. Sa deuxième version privilégie l’accessibilité des grands jeux de données, retire des jeux de faible qualité et ajoute des données jugées meilleures.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkFaMTEB - Erfan Zinvandi, Morteza Alikhani, Mehran Sarmadi et al.
Capacités mesuréesQualité des embeddings de texte en persan couvrant classification, clustering, pair classification, reranking, retrieval, summary retrieval et similarité sémantique.
ModalitéTexte
Type de questionsÉvaluation d'embeddings de texte persan (classification, clustering, pair classification, reranking, retrieval, summary retrieval, STS)
Métrique d'évaluationScore dépendant de la tâche (nDCG@10, accuracy, V-measure, Spearman), agrégé
AccèsPublic
LanguesPersan (farsi)
Taille du jeu63 datasets sur 7 tâches
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (30)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert73,9 %9 mars 2026✅ Mesuré
2codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert73,0 %9 mars 2026✅ Mesuré
3codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert72,1 %9 mars 2026✅ Mesuré
4MCINext/HakimMCINext🟢 Ouvert71,6 %10 mai 2025✅ Mesuré
5codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert70,4 %9 mars 2026✅ Mesuré
6MCINext/Hakim-smallMCINext🟢 Ouvert68,5 %10 mai 2025✅ Mesuré
7codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert68,3 %9 mars 2026✅ Mesuré
8google/embeddinggemma-300mGoogle🟢 Ouvert67,8 %4 septembre 2025✅ Mesuré
9codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert66,4 %9 mars 2026✅ Mesuré
10BAAI: bge-m3BAAI🟢 Ouvert65,6 %18 novembre 2025✅ Mesuré
11jinaai/jina-embeddings-v3Jina AI🟢 Ouvert65,3 %18 septembre 2024✅ Mesuré
12Alibaba-NLP/gte-Qwen2-7B-instructAlibaba🟢 Ouvert64,6 %15 juin 2024✅ Mesuré
13Intfloat: Multilingual-E5-LargeIntfloat🟢 Ouvert64,3 %18 novembre 2025✅ Mesuré
14MCINext/Hakim-unsupMCINext🟢 Ouvert63,8 %10 mai 2025✅ Mesuré
15PartAI/Tooka-SBERT-V2-LargePartAI🟢 Ouvert63,3 %1 mai 2025✅ Mesuré
16intfloat/multilingual-e5-baseIntfloat🟢 Ouvert62,6 %8 février 2024✅ Mesuré
17codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert62,4 %9 mars 2026✅ Mesuré
18PartAI/Tooka-SBERT-V2-SmallPartAI🟢 Ouvert62,0 %1 mai 2025✅ Mesuré
19intfloat/e5-mistral-7b-instructIntfloat🟢 Ouvert61,0 %8 février 2024✅ Mesuré
20codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert60,1 %9 mars 2026✅ Mesuré
21PartAI/Tooka-SBERTPartAI🟢 Ouvert59,3 %7 décembre 2024✅ Mesuré
22openai/text-embedding-3-smallOpenAI🟢 Ouvert54,9 %25 janvier 2024✅ Mesuré
23sentence-transformers/LaBSESentence Transformers🟢 Ouvert53,2 %1 novembre 2019✅ Mesuré
24sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2Sentence Transformers🟢 Ouvert51,3 %1 novembre 2019✅ Mesuré
25PartAI/TookaBERT-BasePartAI🟢 Ouvert46,5 %8 décembre 2024✅ Mesuré
26sbunlp/fabertsbunlp🟢 Ouvert46,4 %7 octobre 2024✅ Mesuré
27HooshvareLab/bert-base-parsbert-uncasedHooshvareLab🟢 Ouvert45,6 %19 mai 2021✅ Mesuré
28myrkur/sentence-transformer-parsbert-famyrkur🟢 Ouvert43,3 %10 décembre 2024✅ Mesuré
29m3hrdadfi/bert-zwnj-wnli-mean-tokensm3hrdadfi🟢 Ouvert43,2 %28 juin 2021✅ Mesuré
30m3hrdadfi/roberta-zwnj-wnli-mean-tokensm3hrdadfi🟢 Ouvert43,1 %28 juin 2021✅ Mesuré

Classement établi sur 30 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 62,9 %.

Notre analyse

Un score élevé indique qu’un modèle obtient de bons résultats agrégés sur les différentes tâches d’embeddings en persan. L’interprétation dépend toutefois des métriques propres à chaque tâche, notamment nDCG@10, l’accuracy, la V-measure et la corrélation de Spearman. Le classement couvre 30 modèles, avec une médiane de 63 %. codefuse-ai/F2LLM-v2-14B arrive en tête à 74 %, soit un avantage de 11 points sur cette médiane. Cet écart met en évidence une performance globale supérieure au centre du classement, sans signifier une domination identique sur chaque catégorie.

La rigueur de comparaison doit être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que tous mesurés dans un protocole indépendant unique. Les risques méthodologiques de contamination ou de saturation appellent donc une lecture prudente du classement. La portée reste circonscrite aux embeddings de textes en persan et aux sept familles de tâches incluses. Le benchmark renseigne ainsi la polyvalence dans ce périmètre, mais le score agrégé peut atténuer les écarts entre compétences spécifiques.


Sources des scores : mteb.