Cohere/Cohere-embed-multilingual-light-v3.0

Cohere/Cohere-embed-multilingual-light-v3.0 est un modèle d’embedding dense publié par Cohere le 2 novembre 2023. Il représente les textes sous forme de vecteurs de 384 dimensions, un format compact adapté à la constitution d’index sémantiques relativement légers.

Cohere/Cohere-embed-multilingual-light-v3.0 est un modèle d’embedding dense publié par Cohere le 2 novembre 2023. Il représente les textes sous forme de vecteurs de 384 dimensions, un format compact adapté à la constitution d’index sémantiques relativement légers.

Entraîné sur des paires en anglais et dans plus de 100 autres langues, il distingue les documents (« search_document ») des requêtes (« search_query »). Il sert à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering. Son déploiement passe par l’API Cohere, AWS SageMaker ou une infrastructure privée.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurCohere
Poids🟢 Poids ouverts
Date de sortie2 novembre 2023
Dimension du vecteur384
Représentationdense
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval39,1 %79ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal40,4 %77ᵉ / 208mteb✅ Mesuré
MTEB: Medical56,1 %34ᵉ / 158mteb✅ Mesuré
MTEB: Legal50,2 %42ᵉ / 157mteb✅ Mesuré
MTEB: European57,8 %30ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French41,8 %65ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German44,2 %74ᵉ / 209mteb✅ Mesuré
MTEB: Indic66,1 %14ᵉ / 119mteb✅ Mesuré
MTEB: French58,5 %25ᵉ / 117mteb✅ Mesuré
MTEB: Scandinavian56,9 %26ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Long-context Retrieval

WhereIsAI/UAE-Large-V140 %
▶ Cohere/Cohere-embed-mul…39 %

MTEB: Indic

▶ Cohere/Cohere-embed-mul…66 %

Notre analyse

Forces. Le meilleur positionnement MTEB du modèle concerne les langues indiennes, ce qui souligne son intérêt pour la recherche et la mise en correspondance de textes dans un environnement multilingue. Les résultats en français et sur l’ensemble européen restent honorables, notamment pour la classification, le clustering, la recherche et le bitext mining. La distinction entre requêtes et documents correspond directement aux besoins d’un moteur de recherche sémantique ou d’une chaîne RAG. Les vecteurs denses de 384 dimensions limitent par ailleurs la taille des index et le volume de calcul lors des comparaisons, par rapport à des représentations de plus grande dimension.

Limites et points d’attention. Les résultats MTEB sont moins convaincants sur les langues scandinaves, où le modèle se situe dans la seconde moitié du classement. Les domaines spécialisés sont également plus difficiles : le médical reste en retrait par rapport aux meilleurs modèles évalués, tandis que le juridique constitue son track le plus faible parmi ceux rapportés. Sorti il y a près de trois ans, il appartient à une génération ancienne à l’échelle de l’IA et peut être dépassé par des embeddings plus récents, voire retiré des catalogues actuels. Usages pertinents : recherche multilingue compacte, RAG généraliste, similarité documentaire et clustering, avec validation spécifique pour les corpus médicaux ou juridiques.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).