emillykkejensen/EmbeddingGemma-Scandi-300m
Publié le 17 octobre 2025 par emillykkejensen, emillykkejensen/EmbeddingGemma-Scandi-300m est un modèle d’embedding de 308 millions de paramètres actifs, affiné à partir de google/embeddinggemma-300m. Il produit des représentations denses de 768 dimensions et cible les textes…
Publié le 17 octobre 2025 par emillykkejensen, emillykkejensen/EmbeddingGemma-Scandi-300m est un modèle d’embedding de 308 millions de paramètres actifs, affiné à partir de google/embeddinggemma-300m. Il produit des représentations denses de 768 dimensions et cible les textes scandinaves, notamment en danois, norvégien et suédois.
Le modèle encode séparément les requêtes et les documents, puis rapproche leurs représentations par similarité cosinus. Il convient à la recherche sémantique, à la récupération de passages pour le RAG, à la similarité textuelle, à la détection de paraphrases, à la classification et au clustering. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | emillykkejensen |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 17 octobre 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 308 millions |
| Paramètres actifs | 308 millions |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Scandinavian | 54,0 % | 30ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Scandinavian
Notre analyse
Forces. L’intérêt de emillykkejensen/EmbeddingGemma-Scandi-300m réside dans sa spécialisation scandinave, issue d’un affinage sur nordic-embedding-training-data. Son architecture de Sentence Transformer associe pooling moyen, couches denses et normalisation afin de produire des vecteurs directement comparables par similarité cosinus. Les encodages distincts des requêtes et des documents répondent particulièrement aux besoins de recherche sémantique et de récupération documentaire. La même représentation dense peut aussi alimenter des systèmes de détection de paraphrases, de classification ou de clustering. La licence Apache 2.0 facilite le déploiement et l’adaptation dans des infrastructures auto-hébergées.
Limites et points d’attention. Sur MTEB: Scandinavian, le modèle atteint 54 % et se classe 30e sur 48, un positionnement dans la seconde moitié du classement qui invite à valider sa qualité sur les corpus et langues visés. Sa spécialisation sur les données scandinaves le destine d’abord au danois, au norvégien et au suédois, plutôt qu’à une couverture linguistique générale. Ses vecteurs denses de 768 dimensions imposent aussi un stockage et un calcul de similarité à dimensionner selon le volume de l’index. Usages pertinents : recherche sémantique scandinave, récupération pour le RAG, rapprochement de textes, classification et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).