clips/e5-base-trm-nl
Publié par clips le 23 septembre 2025 sous licence ouverte MIT, clips/e5-base-trm-nl est un modèle d’embedding de 124 millions de paramètres, tous actifs. Cette version affinée de clips/e5-base-trm cible la représentation de textes en néerlandais.
Publié par clips le 23 septembre 2025 sous licence ouverte MIT, clips/e5-base-trm-nl est un modèle d’embedding de 124 millions de paramètres, tous actifs. Cette version affinée de clips/e5-base-trm cible la représentation de textes en néerlandais.
Chaque texte est converti en un vecteur dense unique de 768 dimensions, obtenu par average pooling des états cachés puis normalisation L2. Ces représentations servent à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | clips |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 23 septembre 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense (vecteur unique) |
| Paramètres | 124 millions |
| Paramètres actifs | 124 millions |
| Longueur de séquence max | 514 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Dutch | 54,5 % | 29ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Dutch
Notre analyse
Forces. Sur MTEB: Dutch, clips/e5-base-trm-nl se situe dans le premier tiers des modèles évalués pour la qualité générale des embeddings néerlandais, sur un ensemble couvrant notamment la classification, le clustering et la classification de paires. Son affinage spécialisé constitue un atout pour organiser, rapprocher ou retrouver des contenus en néerlandais. La normalisation L2 facilite la comparaison des vecteurs par similarité. La licence MIT autorise la réutilisation, l’adaptation et l’auto-hébergement, tandis que le format dense à vecteur unique simplifie l’intégration dans un index vectoriel.
Limites et points d'attention. La dimension de 768 implique un compromis entre richesse de représentation, volume de stockage de l’index et coût des recherches de similarité. Le protocole d’encodage doit aussi être respecté : la recherche repose sur les préfixes « query: » et « passage: », ajoutés automatiquement par encode_query et encode_document. Pour les autres tâches, le préfixe « query: » peut être employé. Les usages pertinents sont la recherche sémantique, le RAG, la similarité et le clustering de textes néerlandais.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).