google/gemini-embedding-001
Publié par Google le 7 mars 2025, google/gemini-embedding-001 est un modèle d'embedding dense qui convertit les textes en vecteurs de 3 072 dimensions. Ses résultats en espagnol et en allemand attestent d'une aptitude multilingue, notamment pour retrouver des contenus spécialisés.
Publié par Google le 7 mars 2025, google/gemini-embedding-001 est un modèle d'embedding dense qui convertit les textes en vecteurs de 3 072 dimensions. Ses résultats en espagnol et en allemand attestent d'une aptitude multilingue, notamment pour retrouver des contenus spécialisés.
Il sert à indexer et rapprocher des passages selon leur sens, afin d'alimenter la recherche sémantique, la récupération de documents dans un système RAG, la mesure de similarité ou le clustering. Il ne produit pas de texte, mais fournit une représentation numérique exploitable par un moteur de recherche vectorielle.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 7 mars 2025 |
| Dimension du vecteur | 3 072 |
| Représentation | dense |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Code Information Retrieval | 73,9 % | 17ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 76,0 % | 12ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 58,5 % | 19ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 66,5 % | 16ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 77,9 % | 17ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 58,4 % | 15ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 65,5 % | 23ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Spanish | 72,0 % | 4ᵉ / 27 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 5,2 % | 12ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Code Information Retrieval
MTEB: RTEB Finance
Notre analyse
Forces. Les évaluations MTEB placent particulièrement bien google/gemini-embedding-001 sur les textes espagnols, où il figure dans le top 10. Le modèle obtient aussi des résultats solides en retrieval spécialisé, notamment dans la finance et la santé. Sur RTEB German, son positionnement montre une capacité utile à retrouver des contenus allemands dans des corpus juridiques, médicaux et professionnels. Cette combinaison favorise les systèmes de recherche multilingues et les bases documentaires couvrant plusieurs domaines spécialisés.
Limites et points d'attention. La représentation dense de 3 072 dimensions augmente la taille des index, la mémoire nécessaire et le coût des calculs de similarité par rapport à des embeddings moins dimensionnels. Les performances restent inégales selon les langues et les domaines : le classement en allemand est moins favorable que celui obtenu en espagnol, tandis que les résultats en santé demeurent derrière ceux observés en finance. Sorti il y a environ un an, le modèle appartient déjà à une génération ancienne à l'échelle de l'IA et peut être dépassé par des références plus récentes. Usages pertinents : recherche sémantique multilingue, RAG documentaire, similarité et clustering de corpus financiers, médicaux ou professionnels.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).