google/text-multilingual-embedding-002
Publié par Google le 14 mai 2024, google/text-multilingual-embedding-002 est un modèle d’embedding multilingue. Il produit une représentation dense de 768 dimensions, conçue pour rapprocher numériquement des textes dont le sens est similaire, y compris dans plusieurs langues.
Publié par Google le 14 mai 2024, google/text-multilingual-embedding-002 est un modèle d’embedding multilingue. Il produit une représentation dense de 768 dimensions, conçue pour rapprocher numériquement des textes dont le sens est similaire, y compris dans plusieurs langues.
Ses vecteurs peuvent alimenter un moteur de recherche sémantique, la sélection de passages dans une architecture RAG, le calcul de similarité ou le clustering de corpus. Près de deux ans après sa sortie, il appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 14 mai 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB French | 41,2 % | 69ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 4,1 % | 17ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB French
MTEB: Instruction Following
Notre analyse
Forces. Le résultat sur RTEB French place le modèle dans le premier tiers du classement évalué, ce qui indique une aptitude correcte à retrouver des contenus français dans des corpus mêlant connaissances générales et domaine juridique. Son rang sur Instruction Following est nettement plus favorable, parmi le premier dixième des modèles comparés, même si la qualité mesurée demeure faible en valeur absolue. La représentation dense de 768 dimensions offre un format fixe et relativement contenu pour dimensionner les index, stocker les vecteurs et exécuter des calculs de similarité.
Limites et points d’attention. La performance sur RTEB French reste éloignée des modèles les mieux classés, ce qui réduit son intérêt lorsque la précision de recherche en français est prioritaire. Sur Instruction Following, le faible score absolu invite à ne pas confondre bon classement relatif et capacité robuste à respecter des consignes de retrieval. Son ancienneté, très importante dans ce secteur, augmente aussi le risque d’un écart avec les offres contemporaines. Usages pertinents : recherche sémantique multilingue, RAG, détection de similarité et clustering, après validation sur le corpus cible.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).