Thai
MTEB: Thai est un benchmark communautaire créé par MTEB / MMTEB pour évaluer la qualité des embeddings de textes en thaï. Il couvre plusieurs usages complémentaires, notamment la classification, le clustering, la classification de paires, le reranking et la recherche d’information.
MTEB: Thai est un benchmark communautaire créé par MTEB / MMTEB pour évaluer la qualité des embeddings de textes en thaï. Il couvre plusieurs usages complémentaires, notamment la classification, le clustering, la classification de paires, le reranking et la recherche d’information.
Les tâches reposent sur des contenus rédigés nativement en thaï ou sur des traductions humaines de haute qualité. En excluant les tâches traduites automatiquement et les évaluations cross-lingual, ce benchmark vise une comparaison ciblée des modèles capables de représenter efficacement les textes thaïlandais.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | MTEB / MMTEB (communauté embeddings-benchmark) |
| Capacités mesurées | Evalue la qualite des plongements (embeddings) de texte en thai sur plusieurs types de taches : classification, clustering, classification de paires, reranking et recherche d'information. |
| Modalité | Texte |
| Type de questions | Taches d'embedding de texte (classification, clustering, pair classification, reranking, retrieval) |
| Métrique d'évaluation | Variable selon la tache (nDCG@10, accuracy, AP, correlation de Spearman) ; score moyen MTEB |
| Accès | Public |
| Licence | Apache-2.0 (cadre MTEB) ; licences des jeux de donnees variables |
| Langues | Thai |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (28)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 78,4 % | 9 mars 2026 | ✅ Mesuré |
| 2 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 77,6 % | 9 mars 2026 | ✅ Mesuré |
| 3 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 76,9 % | 9 mars 2026 | ✅ Mesuré |
| 4 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 75,3 % | 9 mars 2026 | ✅ Mesuré |
| 5 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 72,6 % | 9 mars 2026 | ✅ Mesuré |
| 6 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 71,1 % | 9 mars 2026 | ✅ Mesuré |
| 7 | tencent/KaLM-Embedding-Gemma3-12B-2511 | Tencent | 🟢 Ouvert | 66,4 % | 6 novembre 2025 | ✅ Mesuré |
| 8 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 66,0 % | 9 mars 2026 | ✅ Mesuré |
| 9 | jinaai/jina-embeddings-v5-omni-small | Jina AI | 🟢 Ouvert | 64,2 % | 1 avril 2026 | ✅ Mesuré |
| 10 | jinaai/jina-embeddings-v5-text-small | Jina AI | 🟢 Ouvert | 64,2 % | 17 février 2026 | ✅ Mesuré |
| 11 | BAAI: bge-m3 | BAAI | 🟢 Ouvert | 64,2 % | 18 novembre 2025 | ✅ Mesuré |
| 12 | Qwen: Qwen3 Embedding 0.6B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,5 % | 5 novembre 2025 | ✅ Mesuré |
| 13 | jinaai/jina-embeddings-v5-omni-nano | Jina AI | 🟢 Ouvert | 63,5 % | 1 avril 2026 | ✅ Mesuré |
| 14 | jinaai/jina-embeddings-v5-text-nano | Jina AI | 🟢 Ouvert | 63,5 % | 17 février 2026 | ✅ Mesuré |
| 15 | intfloat/multilingual-e5-large-instruct | Intfloat | 🟢 Ouvert | 62,5 % | 8 février 2024 | ✅ Mesuré |
| 16 | voyageai/voyage-4-nano | Voyage AI | 🟢 Ouvert | 61,9 % | 15 janvier 2026 | ✅ Mesuré |
| 17 | telepix/PIXIE-Rune-v1.0 | telepix | 🟢 Ouvert | 61,5 % | 15 janvier 2026 | ✅ Mesuré |
| 18 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 61,5 % | 9 mars 2026 | ✅ Mesuré |
| 19 | Octen/Octen-Embedding-0.6B | Octen | 🟢 Ouvert | 58,6 % | 10 janvier 2026 | ✅ Mesuré |
| 20 | SamilPwC-AXNode-GenAI/PwC-Embedding_expr | SamilPwC-AXNode-GenAI | 🟢 Ouvert | 58,6 % | 12 août 2025 | ✅ Mesuré |
| 21 | jinaai/jina-embeddings-v3 | Jina AI | 🟢 Ouvert | 58,1 % | 18 septembre 2024 | ✅ Mesuré |
| 22 | IEITYuan/Yuan-embedding-2.0-en | IEITYuan | 🟢 Ouvert | 57,8 % | 27 novembre 2025 | ✅ Mesuré |
| 23 | infgrad/Jasper-Token-Compression-600M | infgrad | 🟢 Ouvert | 56,5 % | 14 novembre 2025 | ✅ Mesuré |
| 24 | codefuse-ai/F2LLM-0.6B | codefuse-ai | 🟢 Ouvert | 54,3 % | 18 septembre 2025 | ✅ Mesuré |
| 25 | Alibaba-NLP/gte-Qwen2-1.5B-instruct | Alibaba | 🟢 Ouvert | 38,0 % | 29 juillet 2024 | ✅ Mesuré |
| 26 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 12,8 % | 15 janvier 2025 | ✅ Mesuré |
| 27 | Sentence Transformers: all-mpnet-base-v2 | Sentence Transformers | 🟢 Ouvert | 12,2 % | 17 novembre 2025 | ✅ Mesuré |
| 28 | Sentence Transformers: all-MiniLM-L6-v2 | Sentence Transformers | 🟢 Ouvert | 11,4 % | 17 novembre 2025 | ✅ Mesuré |
Classement établi sur 28 modèles évalués. Score médian de l'ensemble : 63,0 %.
Notre analyse
Un score élevé sur MTEB: Thai indique qu’un modèle produit des représentations textuelles efficaces dans plusieurs familles de tâches, plutôt que dans un seul scénario. Le score moyen agrège toutefois des métriques variables selon les tâches, comme nDCG@10, l’accuracy, l’AP ou la corrélation de Spearman. Son interprétation doit donc tenir compte de cette diversité méthodologique.
Dans la base, la médiane de 63 % et le meilleur résultat de 78 %, obtenu par codefuse-ai/F2LLM-v2-14B, montrent une dispersion notable parmi les 28 modèles évalués. Le classement met ainsi en évidence un avantage clair du modèle de tête, sans suggérer une saturation complète au niveau maximal de l’échelle. La portée reste centrée sur le thaï natif ou traduit par des humains, les tâches issues de traduction automatique et les tâches cross-lingual étant exclues. Enfin, la majorité des scores étant auto-déclarés par les éditeurs, le classement doit être lu avec davantage de prudence qu’une campagne entièrement mesurée et vérifiée de manière centralisée.
Sources des scores : mteb.