google/gemini-embedding-2-preview

Publié par Google le 25 mars 2025, google/gemini-embedding-2-preview est un modèle d'embedding dense produisant des vecteurs de 3 072 dimensions. Il convertit les textes en représentations numériques comparables, plutôt que de générer du contenu.

Publié par Google le 25 mars 2025, google/gemini-embedding-2-preview est un modèle d'embedding dense produisant des vecteurs de 3 072 dimensions. Il convertit les textes en représentations numériques comparables, plutôt que de générer du contenu.

Il sert à indexer des corpus pour la recherche sémantique, à sélectionner les passages d'un système RAG, à mesurer la similarité entre documents et à regrouper des contenus par proximité. Son ancienneté d'environ un an est importante à l'échelle de l'IA : ce modèle preview appartient à une génération probablement dépassée et souvent retirée des catalogues actuels.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurGoogle
Poids🟢 Poids ouverts
Date de sortie25 mars 2025
Dimension du vecteur3 072
Représentationdense
Longueur de séquence max2 048 tokens
Modalités (entrée → sortie)audio,image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal41,3 %75ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare64,6 %18ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance78,6 %15ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French56,7 %21ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German26,4 %104ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
▶ google/gemini-embedding…79 %

MTEB: RTEB Healthcare

voyageai/voyage-4-large…74 %
nvidia/Nemotron-3-Embed…71 %
▶ google/gemini-embedding…65 %

Notre analyse

Forces. Les résultats RTEB placent google/gemini-embedding-2-preview parmi les modèles les mieux classés de l'échantillon en recherche financière et médicale. Le modèle se montre également compétitif pour la recherche en français, sur des corpus couvrant notamment les connaissances générales et le droit. Ce profil correspond à l'indexation de documents spécialisés, à la récupération de passages pour le RAG et au rapprochement sémantique de contenus. La représentation dense fournit une mesure continue de proximité entre textes, utile pour la similarité et le clustering.

Limites et points d'attention. Les performances sont moins convaincantes sur RTEB Legal, où le classement se situe davantage dans le milieu du corpus évalué, et surtout sur RTEB German, nettement en retrait par rapport aux meilleurs modèles. Les vecteurs de 3 072 dimensions alourdissent aussi les index, augmentent les besoins de stockage et rendent les calculs de similarité plus coûteux que des représentations plus compactes. Son âge impose enfin de le comparer à des embeddings plus récents avant tout nouveau déploiement. Usages pertinents : recherche sémantique et RAG en finance, santé ou français, après validation sur le corpus cible.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).