Chemical

MTEB: Chemical est un benchmark public créé en 2024 par BASF dans le cadre de ChemTEB. Il évalue la qualité des embeddings de texte spécialisés en chimie, notamment leur aptitude à représenter la littérature et les données de ce domaine.

MTEB: Chemical est un benchmark public créé en 2024 par BASF dans le cadre de ChemTEB. Il évalue la qualité des embeddings de texte spécialisés en chimie, notamment leur aptitude à représenter la littérature et les données de ce domaine.

La suite couvre plusieurs usages complémentaires : bitext mining, classification, clustering, pair classification et retrieval. Elle permet ainsi de comparer les modèles sur différentes formes de compréhension et d’organisation de contenus chimiques en anglais, au moyen de scores adaptés à chaque tâche puis agrégés.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBASF (ChemTEB)
Capacités mesuréesQualité des embeddings de texte spécialisés en chimie, mesurant la capacité des modèles à traiter la littérature et les données chimiques.
ModalitéTexte
Type de questionsÉvaluation d'embeddings du domaine chimique (bitext mining, classification, clustering, pair classification, retrieval)
Métrique d'évaluationScore dépendant de la tâche (nDCG@10, accuracy, V-measure, average precision), agrégé
AccèsPublic
LanguesAnglais
Taille du jeuSuite de tâches du domaine chimique ; 34 modèles évalués (taille de dataset non précisée)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (41)

#ModèleÉditeurLicenceScoreSortieFiabilité
1codefuse-ai/F2LLM-v2-8Bcodefuse-ai🟢 Ouvert78,6 %9 mars 2026✅ Mesuré
2codefuse-ai/F2LLM-v2-14Bcodefuse-ai🟢 Ouvert78,4 %9 mars 2026✅ Mesuré
3codefuse-ai/F2LLM-v2-4Bcodefuse-ai🟢 Ouvert76,5 %9 mars 2026✅ Mesuré
4openai/text-embedding-3-largeOpenAI🟢 Ouvert75,9 %25 janvier 2024✅ Mesuré
5ICT-TIME-and-Querit/ICT-TIME-and-Querit-embedding-v1ICT-TIME-and-Querit🟢 Ouvert75,2 %2 mai 2026✅ Mesuré
6ICT-TIME-and-Querit/BOOM_4B_v1ICT-TIME-and-Querit🟢 Ouvert75,1 %31 janvier 2026✅ Mesuré
7openai/text-embedding-3-smallOpenAI🟢 Ouvert73,2 %25 janvier 2024✅ Mesuré
8bedrock/amazon-titan-embed-text-v1bedrock🟢 Ouvert73,1 %27 septembre 2023✅ Mesuré
9bedrock/cohere-embed-english-v3bedrock🟢 Ouvert72,9 %2 novembre 2023✅ Mesuré
10bedrock/cohere-embed-multilingual-v3bedrock🟢 Ouvert72,6 %2 novembre 2023✅ Mesuré
11openai/text-embedding-ada-002OpenAI🟢 Ouvert72,5 %15 décembre 2022✅ Mesuré
12nomic-ai/nomic-embed-text-v1.5Nomic AI🟢 Ouvert71,8 %10 février 2024✅ Mesuré
13codefuse-ai/F2LLM-v2-1.7Bcodefuse-ai🟢 Ouvert71,7 %9 mars 2026✅ Mesuré
14intfloat/e5-largeIntfloat🟢 Ouvert71,5 %26 décembre 2022✅ Mesuré
15BAAI: bge-large-en-v1.5BAAI🟢 Ouvert70,9 %18 novembre 2025✅ Mesuré
16bedrock/amazon-titan-embed-text-v2bedrock🟢 Ouvert70,8 %30 avril 2024✅ Mesuré
17codefuse-ai/F2LLM-v2-330Mcodefuse-ai🟢 Ouvert70,7 %9 mars 2026✅ Mesuré
18nomic-ai/nomic-embed-text-v1Nomic AI🟢 Ouvert70,6 %31 janvier 2024✅ Mesuré
19BAAI: bge-base-en-v1.5BAAI🟢 Ouvert70,5 %18 novembre 2025✅ Mesuré
20Sentence Transformers: all-mpnet-base-v2Sentence Transformers🟢 Ouvert69,8 %17 novembre 2025✅ Mesuré
21Sentence Transformers: all-MiniLM-L6-v2Sentence Transformers🟢 Ouvert69,6 %17 novembre 2025✅ Mesuré
22codefuse-ai/F2LLM-v2-0.6Bcodefuse-ai🟢 Ouvert69,6 %9 mars 2026✅ Mesuré
23BAAI: bge-m3BAAI🟢 Ouvert69,6 %18 novembre 2025✅ Mesuré
24Intfloat: E5-Large-v2Intfloat🟢 Ouvert69,2 %18 novembre 2025✅ Mesuré
25BAAI/bge-base-enBAAI🟢 Ouvert69,2 %5 août 2023✅ Mesuré
26BAAI/bge-small-en-v1.5BAAI🟢 Ouvert69,2 %12 septembre 2023✅ Mesuré
27intfloat/e5-baseIntfloat🟢 Ouvert69,1 %26 décembre 2022✅ Mesuré
28Sentence Transformers: all-MiniLM-L12-v2Sentence Transformers🟢 Ouvert69,0 %18 novembre 2025✅ Mesuré
29BAAI/bge-small-enBAAI🟢 Ouvert68,7 %5 août 2023✅ Mesuré
30BAAI/bge-large-enBAAI🟢 Ouvert68,7 %5 août 2023✅ Mesuré
31intfloat/multilingual-e5-baseIntfloat🟢 Ouvert68,5 %8 février 2024✅ Mesuré
32intfloat/e5-smallIntfloat🟢 Ouvert68,3 %8 février 2024✅ Mesuré
33Intfloat: Multilingual-E5-LargeIntfloat🟢 Ouvert68,3 %18 novembre 2025✅ Mesuré
34Intfloat: E5-Base-v2Intfloat🟢 Ouvert68,3 %18 novembre 2025✅ Mesuré
35intfloat/multilingual-e5-smallIntfloat🟢 Ouvert68,1 %8 février 2024✅ Mesuré
36intfloat/e5-small-v2Intfloat🟢 Ouvert67,9 %8 février 2024✅ Mesuré
37codefuse-ai/F2LLM-v2-160Mcodefuse-ai🟢 Ouvert66,9 %9 mars 2026✅ Mesuré
38Sentence Transformers: multi-qa-mpnet-base-dot-v1Sentence Transformers🟢 Ouvert66,8 %18 novembre 2025✅ Mesuré
39codefuse-ai/F2LLM-v2-80Mcodefuse-ai🟢 Ouvert65,1 %9 mars 2026✅ Mesuré
40minishlab/potion-multilingual-128Mminishlab🟢 Ouvert61,1 %23 mai 2025✅ Mesuré
41sentence-transformers/static-similarity-mrl-multilingual-v1Sentence Transformers🟢 Ouvert60,9 %15 janvier 2025✅ Mesuré

Classement établi sur 41 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 69,6 %.

Notre analyse

Un score élevé indique qu’un modèle produit des représentations textuelles efficaces sur plusieurs tâches chimiques. L’interprétation repose toutefois sur une agrégation de métriques différentes, dont nDCG@10, accuracy, V-measure et average precision : le résultat synthétise donc des aptitudes variées plutôt qu’une performance unique.

La fiabilité du classement doit être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs. Cette méthode offre une base comparative, mais présente moins de garanties qu’une évaluation entièrement mesurée selon un protocole indépendant et uniforme. La portée reste centrée sur les embeddings de textes chimiques en anglais et ne résume pas les capacités générales d’un modèle. La proximité entre la médiane à 70 % et le meilleur résultat à 79 % suggère une différenciation relativement resserrée parmi les modèles recensés, sans démontrer à elle seule une saturation du benchmark. codefuse-ai/F2LLM-v2-8B arrive en tête, ce qui signale une forte efficacité agrégée sur cette suite, sans exclure des écarts selon les catégories de tâches. Comme pour tout benchmark public, la contamination constitue un risque à considérer lors de l’interprétation, sans pouvoir être déduite du seul classement.


Sources des scores : mteb.