Cohere/Cohere-embed-multilingual-v3.0
Publié par Cohere le 2 novembre 2023, Cohere/Cohere-embed-multilingual-v3.0 est un modèle d’embedding multilingue qui représente requêtes et documents sous forme de vecteurs de 512 dimensions. Son entraînement repose sur près d’un milliard de paires en anglais et près de 0,5 milliard de…
Publié par Cohere le 2 novembre 2023, Cohere/Cohere-embed-multilingual-v3.0 est un modèle d’embedding multilingue qui représente requêtes et documents sous forme de vecteurs de 512 dimensions. Son entraînement repose sur près d’un milliard de paires en anglais et près de 0,5 milliard de paires non anglophones, couvrant plus de 100 langues.
Le modèle sert à la recherche sémantique, à l’indexation pour le RAG, à la mesure de similarité et au clustering. Il distingue notamment les entrées « search_document » et « search_query ». Il est exploitable via l’API Cohere, AWS SageMaker ou des déploiements privés.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Cohere |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 2 novembre 2023 |
| Dimension du vecteur | 512 |
| Représentation | embeddings vectoriels pour documents et requêtes |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 39,3 % | 78ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 42,3 % | 73ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 56,8 % | 45ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 54,2 % | 61ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 60,8 % | 22ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 52,1 % | 39ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 61,5 % | 16ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 53,5 % | 29ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 46,8 % | 63ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 68,7 % | 9ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: French | 62,8 % | 18ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Scandinavian | 62,2 % | 10ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Indic
Notre analyse
Forces. Les résultats MTEB placent le modèle parmi les dix premiers sur les langues Indic et scandinaves, ce qui souligne sa solidité pour la recherche, la classification, le clustering et l’alignement de textes en contexte multilingue. Ses positions sur les tracks French et European restent également compétitives. La représentation en 512 dimensions constitue un atout pratique : elle permet des index vectoriels relativement compacts, avec des besoins de stockage et de calcul de similarité contenus. La séparation entre documents et requêtes correspond directement aux pipelines de recherche sémantique et de RAG.
Limites et points d'attention. Le track RTEB Healthcare est moins favorable, avec un classement proche du milieu de tableau, tandis que MTEB Medical affiche une position plus solide sans atteindre les meilleurs rangs. Sorti en 2023 et ancien d’environ trois ans, le modèle appartient à une génération très ancienne à l’échelle de l’IA : il doit être comparé aux embeddings multilingues plus récents, susceptibles de l’avoir dépassé ou remplacé dans les catalogues actuels. Usages pertinents : recherche multilingue, RAG, regroupement thématique et détection de similarité, notamment dans les langues européennes, scandinaves et Indic.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).