clips/e5-base-trm-nl

Publié par clips le 23 septembre 2025 sous licence ouverte MIT, clips/e5-base-trm-nl est un modèle d’embedding de 124 millions de paramètres, tous actifs. Cette version affinée de clips/e5-base-trm cible la représentation de textes en néerlandais.

Publié par clips le 23 septembre 2025 sous licence ouverte MIT, clips/e5-base-trm-nl est un modèle d’embedding de 124 millions de paramètres, tous actifs. Cette version affinée de clips/e5-base-trm cible la représentation de textes en néerlandais.

Chaque texte est converti en un vecteur dense unique de 768 dimensions, obtenu par average pooling des états cachés puis normalisation L2. Ces représentations servent à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurclips
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie23 septembre 2025
Dimension du vecteur768
Représentationdense (vecteur unique)
Paramètres124 millions
Paramètres actifs124 millions
Longueur de séquence max514 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Dutch54,5 %29ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Sur MTEB: Dutch, clips/e5-base-trm-nl se situe dans le premier tiers des modèles évalués pour la qualité générale des embeddings néerlandais, sur un ensemble couvrant notamment la classification, le clustering et la classification de paires. Son affinage spécialisé constitue un atout pour organiser, rapprocher ou retrouver des contenus en néerlandais. La normalisation L2 facilite la comparaison des vecteurs par similarité. La licence MIT autorise la réutilisation, l’adaptation et l’auto-hébergement, tandis que le format dense à vecteur unique simplifie l’intégration dans un index vectoriel.

Limites et points d'attention. La dimension de 768 implique un compromis entre richesse de représentation, volume de stockage de l’index et coût des recherches de similarité. Le protocole d’encodage doit aussi être respecté : la recherche repose sur les préfixes « query: » et « passage: », ajoutés automatiquement par encode_query et encode_document. Pour les autres tâches, le préfixe « query: » peut être employé. Les usages pertinents sont la recherche sémantique, le RAG, la similarité et le clustering de textes néerlandais.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).