clips/e5-small-trm-nl

Publié par clips le 23 septembre 2025, clips/e5-small-trm-nl est un modèle d’embedding de 41 millions de paramètres, affiné à partir de clips/e5-small-trm pour traiter des textes en néerlandais. Il produit une représentation dense unique de 384 dimensions et est distribué sous licence…

Publié par clips le 23 septembre 2025, clips/e5-small-trm-nl est un modèle d’embedding de 41 millions de paramètres, affiné à partir de clips/e5-small-trm pour traiter des textes en néerlandais. Il produit une représentation dense unique de 384 dimensions et est distribué sous licence ouverte MIT.

Le modèle transforme chaque texte en vecteur numérique afin d’alimenter la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité ou le clustering. Il s’utilise avec Transformers ou Sentence Transformers.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurclips
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie23 septembre 2025
Dimension du vecteur384
Représentationdense à vecteur unique
Paramètres41 millions
Paramètres actifs41 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Dutch53,3 %35ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Sur MTEB: Dutch, clips/e5-small-trm-nl se place dans le premier tiers des modèles évalués pour la qualité générale des embeddings néerlandais, sur un ensemble couvrant notamment la classification, le clustering et la classification de paires. Sa spécialisation en néerlandais convient aux systèmes centrés sur cette langue. Les textes sont encodés par pooling moyen des derniers états cachés, puis normalisés en L2, ce qui facilite les comparaisons de similarité. La dimension de 384 offre par ailleurs des vecteurs compacts, adaptés à des index relativement légers. La licence MIT autorise l’auto-hébergement et l’intégration dans des applications.

Limites et points d'attention. Son positionnement sur MTEB: Dutch reste en retrait des modèles les mieux classés du benchmark. Son affinage ciblé sur le néerlandais en fait aussi un choix spécialisé plutôt qu’un encodeur généraliste. En recherche, le format des entrées doit respecter les préfixes « query: » et « passage: » ; pour les autres tâches, « query: » peut être employé seul. Usages pertinents : recherche sémantique, RAG, similarité et clustering de contenus néerlandais.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).