Chemical
MTEB: Chemical est un benchmark public créé en 2024 par BASF dans le cadre de ChemTEB. Il évalue la qualité des embeddings de texte spécialisés en chimie, notamment leur aptitude à représenter la littérature et les données de ce domaine.
MTEB: Chemical est un benchmark public créé en 2024 par BASF dans le cadre de ChemTEB. Il évalue la qualité des embeddings de texte spécialisés en chimie, notamment leur aptitude à représenter la littérature et les données de ce domaine.
La suite couvre plusieurs usages complémentaires : bitext mining, classification, clustering, pair classification et retrieval. Elle permet ainsi de comparer les modèles sur différentes formes de compréhension et d’organisation de contenus chimiques en anglais, au moyen de scores adaptés à chaque tâche puis agrégés.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | BASF (ChemTEB) |
| Capacités mesurées | Qualité des embeddings de texte spécialisés en chimie, mesurant la capacité des modèles à traiter la littérature et les données chimiques. |
| Modalité | Texte |
| Type de questions | Évaluation d'embeddings du domaine chimique (bitext mining, classification, clustering, pair classification, retrieval) |
| Métrique d'évaluation | Score dépendant de la tâche (nDCG@10, accuracy, V-measure, average precision), agrégé |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | Suite de tâches du domaine chimique ; 34 modèles évalués (taille de dataset non précisée) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (41)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | codefuse-ai/F2LLM-v2-8B | codefuse-ai | 🟢 Ouvert | 78,6 % | 9 mars 2026 | ✅ Mesuré |
| 2 | codefuse-ai/F2LLM-v2-14B | codefuse-ai | 🟢 Ouvert | 78,4 % | 9 mars 2026 | ✅ Mesuré |
| 3 | codefuse-ai/F2LLM-v2-4B | codefuse-ai | 🟢 Ouvert | 76,5 % | 9 mars 2026 | ✅ Mesuré |
| 4 | openai/text-embedding-3-large | OpenAI | 🟢 Ouvert | 75,9 % | 25 janvier 2024 | ✅ Mesuré |
| 5 | ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1 | ICT-TIME-and-Querit | 🟢 Ouvert | 75,2 % | 2 mai 2026 | ✅ Mesuré |
| 6 | ICT-TIME-and-Querit/BOOM_4B_v1 | ICT-TIME-and-Querit | 🟢 Ouvert | 75,1 % | 31 janvier 2026 | ✅ Mesuré |
| 7 | openai/text-embedding-3-small | OpenAI | 🟢 Ouvert | 73,2 % | 25 janvier 2024 | ✅ Mesuré |
| 8 | bedrock/amazon-titan-embed-text-v1 | bedrock | 🟢 Ouvert | 73,1 % | 27 septembre 2023 | ✅ Mesuré |
| 9 | bedrock/cohere-embed-english-v3 | bedrock | 🟢 Ouvert | 72,9 % | 2 novembre 2023 | ✅ Mesuré |
| 10 | bedrock/cohere-embed-multilingual-v3 | bedrock | 🟢 Ouvert | 72,6 % | 2 novembre 2023 | ✅ Mesuré |
| 11 | openai/text-embedding-ada-002 | OpenAI | 🟢 Ouvert | 72,5 % | 15 décembre 2022 | ✅ Mesuré |
| 12 | nomic-ai/nomic-embed-text-v1.5 | Nomic AI | 🟢 Ouvert | 71,8 % | 10 février 2024 | ✅ Mesuré |
| 13 | codefuse-ai/F2LLM-v2-1.7B | codefuse-ai | 🟢 Ouvert | 71,7 % | 9 mars 2026 | ✅ Mesuré |
| 14 | intfloat/e5-large | Intfloat | 🟢 Ouvert | 71,5 % | 26 décembre 2022 | ✅ Mesuré |
| 15 | BAAI: bge-large-en-v1.5 | BAAI | 🟢 Ouvert | 70,9 % | 18 novembre 2025 | ✅ Mesuré |
| 16 | bedrock/amazon-titan-embed-text-v2 | bedrock | 🟢 Ouvert | 70,8 % | 30 avril 2024 | ✅ Mesuré |
| 17 | codefuse-ai/F2LLM-v2-330M | codefuse-ai | 🟢 Ouvert | 70,7 % | 9 mars 2026 | ✅ Mesuré |
| 18 | nomic-ai/nomic-embed-text-v1 | Nomic AI | 🟢 Ouvert | 70,6 % | 31 janvier 2024 | ✅ Mesuré |
| 19 | BAAI: bge-base-en-v1.5 | BAAI | 🟢 Ouvert | 70,5 % | 18 novembre 2025 | ✅ Mesuré |
| 20 | Sentence Transformers: all-mpnet-base-v2 | Sentence Transformers | 🟢 Ouvert | 69,8 % | 17 novembre 2025 | ✅ Mesuré |
| 21 | Sentence Transformers: all-MiniLM-L6-v2 | Sentence Transformers | 🟢 Ouvert | 69,6 % | 17 novembre 2025 | ✅ Mesuré |
| 22 | codefuse-ai/F2LLM-v2-0.6B | codefuse-ai | 🟢 Ouvert | 69,6 % | 9 mars 2026 | ✅ Mesuré |
| 23 | BAAI: bge-m3 | BAAI | 🟢 Ouvert | 69,6 % | 18 novembre 2025 | ✅ Mesuré |
| 24 | Intfloat: E5-Large-v2 | Intfloat | 🟢 Ouvert | 69,2 % | 18 novembre 2025 | ✅ Mesuré |
| 25 | BAAI/bge-base-en | BAAI | 🟢 Ouvert | 69,2 % | 5 août 2023 | ✅ Mesuré |
| 26 | BAAI/bge-small-en-v1.5 | BAAI | 🟢 Ouvert | 69,2 % | 12 septembre 2023 | ✅ Mesuré |
| 27 | intfloat/e5-base | Intfloat | 🟢 Ouvert | 69,1 % | 26 décembre 2022 | ✅ Mesuré |
| 28 | Sentence Transformers: all-MiniLM-L12-v2 | Sentence Transformers | 🟢 Ouvert | 69,0 % | 18 novembre 2025 | ✅ Mesuré |
| 29 | BAAI/bge-small-en | BAAI | 🟢 Ouvert | 68,7 % | 5 août 2023 | ✅ Mesuré |
| 30 | BAAI/bge-large-en | BAAI | 🟢 Ouvert | 68,7 % | 5 août 2023 | ✅ Mesuré |
| 31 | intfloat/multilingual-e5-base | Intfloat | 🟢 Ouvert | 68,5 % | 8 février 2024 | ✅ Mesuré |
| 32 | intfloat/e5-small | Intfloat | 🟢 Ouvert | 68,3 % | 8 février 2024 | ✅ Mesuré |
| 33 | Intfloat: Multilingual-E5-Large | Intfloat | 🟢 Ouvert | 68,3 % | 18 novembre 2025 | ✅ Mesuré |
| 34 | Intfloat: E5-Base-v2 | Intfloat | 🟢 Ouvert | 68,3 % | 18 novembre 2025 | ✅ Mesuré |
| 35 | intfloat/multilingual-e5-small | Intfloat | 🟢 Ouvert | 68,1 % | 8 février 2024 | ✅ Mesuré |
| 36 | intfloat/e5-small-v2 | Intfloat | 🟢 Ouvert | 67,9 % | 8 février 2024 | ✅ Mesuré |
| 37 | codefuse-ai/F2LLM-v2-160M | codefuse-ai | 🟢 Ouvert | 66,9 % | 9 mars 2026 | ✅ Mesuré |
| 38 | Sentence Transformers: multi-qa-mpnet-base-dot-v1 | Sentence Transformers | 🟢 Ouvert | 66,8 % | 18 novembre 2025 | ✅ Mesuré |
| 39 | codefuse-ai/F2LLM-v2-80M | codefuse-ai | 🟢 Ouvert | 65,1 % | 9 mars 2026 | ✅ Mesuré |
| 40 | minishlab/potion-multilingual-128M | minishlab | 🟢 Ouvert | 61,1 % | 23 mai 2025 | ✅ Mesuré |
| 41 | sentence-transformers/static-similarity-mrl-multilingual-v1 | Sentence Transformers | 🟢 Ouvert | 60,9 % | 15 janvier 2025 | ✅ Mesuré |
Classement établi sur 41 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 69,6 %.
Notre analyse
Un score élevé indique qu’un modèle produit des représentations textuelles efficaces sur plusieurs tâches chimiques. L’interprétation repose toutefois sur une agrégation de métriques différentes, dont nDCG@10, accuracy, V-measure et average precision : le résultat synthétise donc des aptitudes variées plutôt qu’une performance unique.
La fiabilité du classement doit être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs. Cette méthode offre une base comparative, mais présente moins de garanties qu’une évaluation entièrement mesurée selon un protocole indépendant et uniforme. La portée reste centrée sur les embeddings de textes chimiques en anglais et ne résume pas les capacités générales d’un modèle. La proximité entre la médiane à 70 % et le meilleur résultat à 79 % suggère une différenciation relativement resserrée parmi les modèles recensés, sans démontrer à elle seule une saturation du benchmark. codefuse-ai/F2LLM-v2-8B arrive en tête, ce qui signale une forte efficacité agrégée sur cette suite, sans exclure des écarts selon les catégories de tâches. Comme pour tout benchmark public, la contamination constitue un risque à considérer lors de l’interprétation, sans pouvoir être déduite du seul classement.
Sources des scores : mteb.