Cohere/Cohere-embed-multilingual-v3.0

Publié par Cohere le 2 novembre 2023, Cohere/Cohere-embed-multilingual-v3.0 est un modèle d’embedding multilingue qui représente requêtes et documents sous forme de vecteurs de 512 dimensions. Son entraînement repose sur près d’un milliard de paires en anglais et près de 0,5 milliard de…

Publié par Cohere le 2 novembre 2023, Cohere/Cohere-embed-multilingual-v3.0 est un modèle d’embedding multilingue qui représente requêtes et documents sous forme de vecteurs de 512 dimensions. Son entraînement repose sur près d’un milliard de paires en anglais et près de 0,5 milliard de paires non anglophones, couvrant plus de 100 langues.

Le modèle sert à la recherche sémantique, à l’indexation pour le RAG, à la mesure de similarité et au clustering. Il distingue notamment les entrées « search_document » et « search_query ». Il est exploitable via l’API Cohere, AWS SageMaker ou des déploiements privés.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurCohere
Poids🟢 Poids ouverts
Date de sortie2 novembre 2023
Dimension du vecteur512
Représentationembeddings vectoriels pour documents et requêtes
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval39,3 %78ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal42,3 %73ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare56,8 %45ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance54,2 %61ᵉ / 97mteb✅ Mesuré
MTEB: Medical60,8 %22ᵉ / 158mteb✅ Mesuré
MTEB: Legal52,1 %39ᵉ / 157mteb✅ Mesuré
MTEB: European61,5 %16ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French53,5 %29ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German46,8 %63ᵉ / 209mteb✅ Mesuré
MTEB: Indic68,7 %9ᵉ / 119mteb✅ Mesuré
MTEB: French62,8 %18ᵉ / 117mteb✅ Mesuré
MTEB: Scandinavian62,2 %10ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Long-context Retrieval

WhereIsAI/UAE-Large-V140 %
▶ Cohere/Cohere-embed-mul…39 %

MTEB: Indic

▶ Cohere/Cohere-embed-mul…69 %

Notre analyse

Forces. Les résultats MTEB placent le modèle parmi les dix premiers sur les langues Indic et scandinaves, ce qui souligne sa solidité pour la recherche, la classification, le clustering et l’alignement de textes en contexte multilingue. Ses positions sur les tracks French et European restent également compétitives. La représentation en 512 dimensions constitue un atout pratique : elle permet des index vectoriels relativement compacts, avec des besoins de stockage et de calcul de similarité contenus. La séparation entre documents et requêtes correspond directement aux pipelines de recherche sémantique et de RAG.

Limites et points d'attention. Le track RTEB Healthcare est moins favorable, avec un classement proche du milieu de tableau, tandis que MTEB Medical affiche une position plus solide sans atteindre les meilleurs rangs. Sorti en 2023 et ancien d’environ trois ans, le modèle appartient à une génération très ancienne à l’échelle de l’IA : il doit être comparé aux embeddings multilingues plus récents, susceptibles de l’avoir dépassé ou remplacé dans les catalogues actuels. Usages pertinents : recherche multilingue, RAG, regroupement thématique et détection de similarité, notamment dans les langues européennes, scandinaves et Indic.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).