Thai

MTEB: Thai est un benchmark communautaire créé par MTEB / MMTEB pour évaluer la qualité des embeddings de textes en thaï. Il couvre plusieurs usages complémentaires, notamment la classification, le clustering, la classification de paires, le reranking et la recherche d’information.

MTEB: Thai est un benchmark communautaire créé par MTEB / MMTEB pour évaluer la qualité des embeddings de textes en thaï. Il couvre plusieurs usages complémentaires, notamment la classification, le clustering, la classification de paires, le reranking et la recherche d’information.

Les tâches reposent sur des contenus rédigés nativement en thaï ou sur des traductions humaines de haute qualité. En excluant les tâches traduites automatiquement et les évaluations cross-lingual, ce benchmark vise une comparaison ciblée des modèles capables de représenter efficacement les textes thaïlandais.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMTEB / MMTEB (communauté embeddings-benchmark)
Capacités mesuréesEvalue la qualite des plongements (embeddings) de texte en thai sur plusieurs types de taches : classification, clustering, classification de paires, reranking et recherche d'information.
ModalitéTexte
Type de questionsTaches d'embedding de texte (classification, clustering, pair classification, reranking, retrieval)
Métrique d'évaluationVariable selon la tache (nDCG@10, accuracy, AP, correlation de Spearman) ; score moyen MTEB
AccèsPublic
LicenceApache-2.0 (cadre MTEB) ; licences des jeux de donnees variables
LanguesThai
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (28)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert78,4 %9 mars 2026✅ Mesuré
2codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert77,6 %9 mars 2026✅ Mesuré
3codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert76,9 %9 mars 2026✅ Mesuré
4codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert75,3 %9 mars 2026✅ Mesuré
5codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert72,6 %9 mars 2026✅ Mesuré
6codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert71,1 %9 mars 2026✅ Mesuré
7tencent/KaLM-Embedding-Gemma3-12B-2511Tencent🟢 Ouvert66,4 %6 novembre 2025✅ Mesuré
8codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert66,0 %9 mars 2026✅ Mesuré
9jinaai/jina-embeddings-v5-omni-smallJina AI🟢 Ouvert64,2 %1 avril 2026✅ Mesuré
10jinaai/jina-embeddings-v5-text-smallJina AI🟢 Ouvert64,2 %17 février 2026✅ Mesuré
11BAAI: bge-m3BAAI🟢 Ouvert64,2 %18 novembre 2025✅ Mesuré
12Qwen: Qwen3 Embedding 0.6BAlibaba Cloud / Qwen Team🟢 Ouvert63,5 %5 novembre 2025✅ Mesuré
13jinaai/jina-embeddings-v5-omni-nanoJina AI🟢 Ouvert63,5 %1 avril 2026✅ Mesuré
14jinaai/jina-embeddings-v5-text-nanoJina AI🟢 Ouvert63,5 %17 février 2026✅ Mesuré
15intfloat/multilingual-e5-large-instructIntfloat🟢 Ouvert62,5 %8 février 2024✅ Mesuré
16voyageai/voyage-4-nanoVoyage AI🟢 Ouvert61,9 %15 janvier 2026✅ Mesuré
17telepix/PIXIE-Rune-v1.0telepix🟢 Ouvert61,5 %15 janvier 2026✅ Mesuré
18codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert61,5 %9 mars 2026✅ Mesuré
19Octen/Octen-Embedding-0.6BOcten🟢 Ouvert58,6 %10 janvier 2026✅ Mesuré
20SamilPwC-AXNode-GenAI/PwC-Embedding_exprSamilPwC-AXNode-GenAI🟢 Ouvert58,6 %12 août 2025✅ Mesuré
21jinaai/jina-embeddings-v3Jina AI🟢 Ouvert58,1 %18 septembre 2024✅ Mesuré
22IEITYuan/Yuan-embedding-2.0-enIEITYuan🟢 Ouvert57,8 %27 novembre 2025✅ Mesuré
23infgrad/Jasper-Token-Compression-600Minfgrad🟢 Ouvert56,5 %14 novembre 2025✅ Mesuré
24codefuse-ai/F2LLM-0.6Bcodefuse-ai🟢 Ouvert54,3 %18 septembre 2025✅ Mesuré
25Alibaba-NLP/gte-Qwen2-1.5B-instructAlibaba🟢 Ouvert38,0 %29 juillet 2024✅ Mesuré
26sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert12,8 %15 janvier 2025✅ Mesuré
27Sentence Transformers: all-mpnet-base-v2Sentence Transformers🟢 Ouvert12,2 %17 novembre 2025✅ Mesuré
28Sentence Transformers: all-MiniLM-L6-v2Sentence Transformers🟢 Ouvert11,4 %17 novembre 2025✅ Mesuré

Classement établi sur 28 modèles évalués. Score médian de l'ensemble : 63,0 %.

Notre analyse

Un score élevé sur MTEB: Thai indique qu’un modèle produit des représentations textuelles efficaces dans plusieurs familles de tâches, plutôt que dans un seul scénario. Le score moyen agrège toutefois des métriques variables selon les tâches, comme nDCG@10, l’accuracy, l’AP ou la corrélation de Spearman. Son interprétation doit donc tenir compte de cette diversité méthodologique.

Dans la base, la médiane de 63 % et le meilleur résultat de 78 %, obtenu par codefuse-ai/F2LLM-v2-14B, montrent une dispersion notable parmi les 28 modèles évalués. Le classement met ainsi en évidence un avantage clair du modèle de tête, sans suggérer une saturation complète au niveau maximal de l’échelle. La portée reste centrée sur le thaï natif ou traduit par des humains, les tâches issues de traduction automatique et les tâches cross-lingual étant exclues. Enfin, la majorité des scores étant auto-déclarés par les éditeurs, le classement doit être lu avec davantage de prudence qu’une campagne entièrement mesurée et vérifiée de manière centralisée.


Sources des scores : mteb.