clips/e5-large-trm-nl

Publié par clips le 23 septembre 2025 sous licence ouverte MIT, clips/e5-large-trm-nl est un modèle d’embedding dense de 355 millions de paramètres, tous actifs. Version affinée de clips/e5-large-trm, il transforme les textes en vecteurs de 1 024 dimensions.

Publié par clips le 23 septembre 2025 sous licence ouverte MIT, clips/e5-large-trm-nl est un modèle d’embedding dense de 355 millions de paramètres, tous actifs. Version affinée de clips/e5-large-trm, il transforme les textes en vecteurs de 1 024 dimensions.

Le modèle cible notamment les contenus néerlandais. Il produit ses représentations par average pooling des derniers états cachés, suivi d’une normalisation L2. Ces vecteurs servent à la recherche sémantique, à la sélection de passages pour un système RAG, à la mesure de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurclips
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie23 septembre 2025
Dimension du vecteur1 024
Représentationdense
Paramètres355 millions
Paramètres actifs355 millions
Longueur de séquence max514 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Dutch56,4 %21ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Sur MTEB Dutch, clips/e5-large-trm-nl se place dans la partie supérieure du classement global consacré aux embeddings néerlandais, couvrant notamment la classification, le clustering et la comparaison de paires. Sa spécialisation et son affinage à partir de clips/e5-large-trm en font une option adaptée à l’indexation et au rapprochement sémantique de textes néerlandais. Pour la recherche, les préfixes « query: » et « passage: » différencient explicitement les requêtes des contenus indexés. Pour les autres tâches, le seul préfixe « query: » peut être employé. La licence MIT autorise une intégration, une modification et un déploiement avec peu de contraintes.

Limites et points d’attention. Le résultat MTEB Dutch agrège plusieurs familles de tâches et ne doit pas être interprété comme une performance uniforme sur chacune d’elles. Les 355 millions de paramètres impliquent davantage de calcul qu’un encodeur plus petit. Les vecteurs denses de 1 024 dimensions augmentent aussi la taille des index, la mémoire nécessaire et le coût de recherche par rapport à des représentations moins dimensionnelles. Usages pertinents : recherche sémantique en néerlandais, récupération de passages pour le RAG, détection de similarité, classification par proximité et clustering documentaire.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).