google/gemini-embedding-2-preview
Publié par Google le 25 mars 2025, google/gemini-embedding-2-preview est un modèle d'embedding dense produisant des vecteurs de 3 072 dimensions. Il convertit les textes en représentations numériques comparables, plutôt que de générer du contenu.
Publié par Google le 25 mars 2025, google/gemini-embedding-2-preview est un modèle d'embedding dense produisant des vecteurs de 3 072 dimensions. Il convertit les textes en représentations numériques comparables, plutôt que de générer du contenu.
Il sert à indexer des corpus pour la recherche sémantique, à sélectionner les passages d'un système RAG, à mesurer la similarité entre documents et à regrouper des contenus par proximité. Son ancienneté d'environ un an est importante à l'échelle de l'IA : ce modèle preview appartient à une génération probablement dépassée et souvent retirée des catalogues actuels.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 25 mars 2025 |
| Dimension du vecteur | 3 072 |
| Représentation | dense |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | audio,image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 41,3 % | 75ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 64,6 % | 18ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 78,6 % | 15ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 56,7 % | 21ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 26,4 % | 104ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Finance
MTEB: RTEB Healthcare
Notre analyse
Forces. Les résultats RTEB placent google/gemini-embedding-2-preview parmi les modèles les mieux classés de l'échantillon en recherche financière et médicale. Le modèle se montre également compétitif pour la recherche en français, sur des corpus couvrant notamment les connaissances générales et le droit. Ce profil correspond à l'indexation de documents spécialisés, à la récupération de passages pour le RAG et au rapprochement sémantique de contenus. La représentation dense fournit une mesure continue de proximité entre textes, utile pour la similarité et le clustering.
Limites et points d'attention. Les performances sont moins convaincantes sur RTEB Legal, où le classement se situe davantage dans le milieu du corpus évalué, et surtout sur RTEB German, nettement en retrait par rapport aux meilleurs modèles. Les vecteurs de 3 072 dimensions alourdissent aussi les index, augmentent les besoins de stockage et rendent les calculs de similarité plus coûteux que des représentations plus compactes. Son âge impose enfin de le comparer à des embeddings plus récents avant tout nouveau déploiement. Usages pertinents : recherche sémantique et RAG en finance, santé ou français, après validation sur le corpus cible.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).