google/embeddinggemma-300m

Publié par Google le 4 septembre 2025, google/embeddinggemma-300m est un modèle d’embedding dense de 308 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions et est distribué sous licence Gemma.

Publié par Google le 4 septembre 2025, google/embeddinggemma-300m est un modèle d’embedding dense de 308 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions et est distribué sous licence Gemma.

Le modèle transforme les textes en représentations numériques comparables. Ces vecteurs servent à retrouver des contenus par proximité sémantique, à alimenter la phase de recherche d’un système RAG, à mesurer la similarité entre documents ou à regrouper des corpus par clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurGoogle
Poids🟢 Poids ouverts
Licencegemma
Date de sortie4 septembre 2025
Dimension du vecteur768
Représentationdense
Paramètres308 millions
Paramètres actifs308 millions
Longueur de séquence max2 048 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Code Information Retrieval67,3 %28ᵉ / 49mteb✅ Mesuré
MTEB: Code68,8 %22ᵉ / 43mteb✅ Mesuré
MTEB: Farsi67,8 %8ᵉ / 30mteb✅ Mesuré
MTEB: Russian65,2 %12ᵉ / 104mteb✅ Mesuré
MTEB: Instruction Following5,6 %8ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB placent google/embeddinggemma-300m dans le top 10 du track Farsi, ce qui souligne son efficacité sur les textes persans pour des tâches comprenant classification, clustering et comparaison de paires. Le modèle obtient aussi un classement solide sur le track Russian, couvrant notamment classification, clustering et reranking. Sur Instruction Following, il figure également dans le top 10 en matière de classement, un signal favorable pour la récupération guidée par une consigne. Sa sortie dense de 768 dimensions fournit un format uniforme pour construire des index vectoriels et comparer les contenus.

Limites et points d'attention. Le score absolu sur Instruction Following reste faible malgré un rang relatif élevé, ce qui invite à valider précisément la qualité de récupération sur les consignes propres à chaque application. Les 768 valeurs de chaque vecteur déterminent aussi l’espace nécessaire au stockage de l’index et le volume de calcul des comparaisons, particulièrement à grande échelle. Usages pertinents : recherche sémantique, RAG, détection de similarité et clustering de corpus, notamment en persan ou en russe.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).