google/embeddinggemma-300m
Publié par Google le 4 septembre 2025, google/embeddinggemma-300m est un modèle d’embedding dense de 308 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions et est distribué sous licence Gemma.
Publié par Google le 4 septembre 2025, google/embeddinggemma-300m est un modèle d’embedding dense de 308 millions de paramètres, tous actifs. Il produit des vecteurs de 768 dimensions et est distribué sous licence Gemma.
Le modèle transforme les textes en représentations numériques comparables. Ces vecteurs servent à retrouver des contenus par proximité sémantique, à alimenter la phase de recherche d’un système RAG, à mesurer la similarité entre documents ou à regrouper des corpus par clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | |
| Poids | 🟢 Poids ouverts |
| Licence | gemma |
| Date de sortie | 4 septembre 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 308 millions |
| Paramètres actifs | 308 millions |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Code Information Retrieval | 67,3 % | 28ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 68,8 % | 22ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: Farsi | 67,8 % | 8ᵉ / 30 | mteb | ✅ Mesuré |
| MTEB: Russian | 65,2 % | 12ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 5,6 % | 8ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Code Information Retrieval
MTEB: Code
Notre analyse
Forces. Les résultats MTEB placent google/embeddinggemma-300m dans le top 10 du track Farsi, ce qui souligne son efficacité sur les textes persans pour des tâches comprenant classification, clustering et comparaison de paires. Le modèle obtient aussi un classement solide sur le track Russian, couvrant notamment classification, clustering et reranking. Sur Instruction Following, il figure également dans le top 10 en matière de classement, un signal favorable pour la récupération guidée par une consigne. Sa sortie dense de 768 dimensions fournit un format uniforme pour construire des index vectoriels et comparer les contenus.
Limites et points d'attention. Le score absolu sur Instruction Following reste faible malgré un rang relatif élevé, ce qui invite à valider précisément la qualité de récupération sur les consignes propres à chaque application. Les 768 valeurs de chaque vecteur déterminent aussi l’espace nécessaire au stockage de l’index et le volume de calcul des comparaisons, particulièrement à grande échelle. Usages pertinents : recherche sémantique, RAG, détection de similarité et clustering de corpus, notamment en persan ou en russe.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).