clips/e5-small-trm-nl
Publié par clips le 23 septembre 2025, clips/e5-small-trm-nl est un modèle d’embedding de 41 millions de paramètres, affiné à partir de clips/e5-small-trm pour traiter des textes en néerlandais. Il produit une représentation dense unique de 384 dimensions et est distribué sous licence…
Publié par clips le 23 septembre 2025, clips/e5-small-trm-nl est un modèle d’embedding de 41 millions de paramètres, affiné à partir de clips/e5-small-trm pour traiter des textes en néerlandais. Il produit une représentation dense unique de 384 dimensions et est distribué sous licence ouverte MIT.
Le modèle transforme chaque texte en vecteur numérique afin d’alimenter la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité ou le clustering. Il s’utilise avec Transformers ou Sentence Transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | clips |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 23 septembre 2025 |
| Dimension du vecteur | 384 |
| Représentation | dense à vecteur unique |
| Paramètres | 41 millions |
| Paramètres actifs | 41 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Dutch | 53,3 % | 35ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Dutch
Notre analyse
Forces. Sur MTEB: Dutch, clips/e5-small-trm-nl se place dans le premier tiers des modèles évalués pour la qualité générale des embeddings néerlandais, sur un ensemble couvrant notamment la classification, le clustering et la classification de paires. Sa spécialisation en néerlandais convient aux systèmes centrés sur cette langue. Les textes sont encodés par pooling moyen des derniers états cachés, puis normalisés en L2, ce qui facilite les comparaisons de similarité. La dimension de 384 offre par ailleurs des vecteurs compacts, adaptés à des index relativement légers. La licence MIT autorise l’auto-hébergement et l’intégration dans des applications.
Limites et points d'attention. Son positionnement sur MTEB: Dutch reste en retrait des modèles les mieux classés du benchmark. Son affinage ciblé sur le néerlandais en fait aussi un choix spécialisé plutôt qu’un encodeur généraliste. En recherche, le format des entrées doit respecter les préfixes « query: » et « passage: » ; pour les autres tâches, « query: » peut être employé seul. Usages pertinents : recherche sémantique, RAG, similarité et clustering de contenus néerlandais.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).