nicher92/saga-embed_v1
Publié par nicher92 le 9 janvier 2025 sous licence ouverte MIT, nicher92/saga-embed_v1 est un modèle d’embedding de 404 millions de paramètres, tous actifs. Fondé sur une architecture ModernBert, il produit avec SentenceTransformer.encode un vecteur dense de 1 024 dimensions.
Publié par nicher92 le 9 janvier 2025 sous licence ouverte MIT, nicher92/saga-embed_v1 est un modèle d’embedding de 404 millions de paramètres, tous actifs. Fondé sur une architecture ModernBert, il produit avec SentenceTransformer.encode un vecteur dense de 1 024 dimensions.
Entraîné sur environ 250 millions de paires sémantiquement liées puis affiné, il cible plusieurs langues scandinaves, notamment le danois, le suédois et le norvégien bokmål. Il sert à la recherche sémantique, à l’indexation pour le RAG, au clustering, à la classification et à la mesure de similarité. Son utilisation fonctionne sans prompt, avec également des formats adaptés à ces tâches.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | nicher92 |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 9 janvier 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | vecteur d’embedding via SentenceTransformer.encode ; aucun mode creux ou multi-vecteur n’est mentionné |
| Paramètres | 404 millions |
| Paramètres actifs | 404 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Scandinavian | 63,5 % | 8ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Scandinavian
Notre analyse
Forces. SAGA-embed se distingue dans l’évaluation MTEB Scandinavian, où il figure dans le top 10. Ce résultat indique une bonne aptitude générale à représenter les textes scandinaves pour des traitements sémantiques, sans spécialisation dans un domaine ou une tâche unique. Son entraînement sur des paires sémantiquement liées correspond directement aux besoins de rapprochement entre requêtes, passages et documents. La licence MIT facilite l’intégration, la modification et l’auto-hébergement. Le format SentenceTransformer et la représentation dense unique simplifient aussi son emploi dans les outils courants d’indexation vectorielle.
Limites et points d'attention. Son positionnement régional le destine avant tout au danois, au suédois et au norvégien bokmål, plutôt qu’à une couverture multilingue générale. Les vecteurs de 1 024 dimensions alourdissent davantage le stockage des index et le calcul de similarité que des représentations plus compactes. Avec 404 millions de paramètres actifs, l’encodage demande également plus de ressources que celui de petits modèles. Son ancienneté est déjà longue à l’échelle de l’IA: issu de la génération du début 2025, il peut être dépassé par des modèles scandinaves plus récents et ces générations sont souvent retirées progressivement des catalogues. Usages pertinents: recherche sémantique, RAG, similarité, classification et clustering de corpus scandinaves.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).