google/gemini-embedding-001

Publié par Google le 7 mars 2025, google/gemini-embedding-001 est un modèle d'embedding dense qui convertit les textes en vecteurs de 3 072 dimensions. Ses résultats en espagnol et en allemand attestent d'une aptitude multilingue, notamment pour retrouver des contenus spécialisés.

Publié par Google le 7 mars 2025, google/gemini-embedding-001 est un modèle d'embedding dense qui convertit les textes en vecteurs de 3 072 dimensions. Ses résultats en espagnol et en allemand attestent d'une aptitude multilingue, notamment pour retrouver des contenus spécialisés.

Il sert à indexer et rapprocher des passages selon leur sens, afin d'alimenter la recherche sémantique, la récupération de documents dans un système RAG, la mesure de similarité ou le clustering. Il ne produit pas de texte, mais fournit une représentation numérique exploitable par un moteur de recherche vectorielle.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurGoogle
Poids🟢 Poids ouverts
Date de sortie7 mars 2025
Dimension du vecteur3 072
Représentationdense
Longueur de séquence max2 048 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Code Information Retrieval73,9 %17ᵉ / 49mteb✅ Mesuré
MTEB: Code76,0 %12ᵉ / 43mteb✅ Mesuré
MTEB: RTEB Legal58,5 %19ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare66,5 %16ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance77,9 %17ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French58,4 %15ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German65,5 %23ᵉ / 209mteb✅ Mesuré
MTEB: Spanish72,0 %4ᵉ / 27mteb✅ Mesuré
MTEB: Instruction Following5,2 %12ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Code Information Retrieval

▶ google/gemini-embedding…74 %

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
▶ google/gemini-embedding…78 %

Notre analyse

Forces. Les évaluations MTEB placent particulièrement bien google/gemini-embedding-001 sur les textes espagnols, où il figure dans le top 10. Le modèle obtient aussi des résultats solides en retrieval spécialisé, notamment dans la finance et la santé. Sur RTEB German, son positionnement montre une capacité utile à retrouver des contenus allemands dans des corpus juridiques, médicaux et professionnels. Cette combinaison favorise les systèmes de recherche multilingues et les bases documentaires couvrant plusieurs domaines spécialisés.

Limites et points d'attention. La représentation dense de 3 072 dimensions augmente la taille des index, la mémoire nécessaire et le coût des calculs de similarité par rapport à des embeddings moins dimensionnels. Les performances restent inégales selon les langues et les domaines : le classement en allemand est moins favorable que celui obtenu en espagnol, tandis que les résultats en santé demeurent derrière ceux observés en finance. Sorti il y a environ un an, le modèle appartient déjà à une génération ancienne à l'échelle de l'IA et peut être dépassé par des références plus récentes. Usages pertinents : recherche sémantique multilingue, RAG documentaire, similarité et clustering de corpus financiers, médicaux ou professionnels.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).