clips/e5-large-trm-nl
Publié par clips le 23 septembre 2025 sous licence ouverte MIT, clips/e5-large-trm-nl est un modèle d’embedding dense de 355 millions de paramètres, tous actifs. Version affinée de clips/e5-large-trm, il transforme les textes en vecteurs de 1 024 dimensions.
Publié par clips le 23 septembre 2025 sous licence ouverte MIT, clips/e5-large-trm-nl est un modèle d’embedding dense de 355 millions de paramètres, tous actifs. Version affinée de clips/e5-large-trm, il transforme les textes en vecteurs de 1 024 dimensions.
Le modèle cible notamment les contenus néerlandais. Il produit ses représentations par average pooling des derniers états cachés, suivi d’une normalisation L2. Ces vecteurs servent à la recherche sémantique, à la sélection de passages pour un système RAG, à la mesure de similarité et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | clips |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 23 septembre 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 355 millions |
| Paramètres actifs | 355 millions |
| Longueur de séquence max | 514 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Dutch | 56,4 % | 21ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Dutch
Notre analyse
Forces. Sur MTEB Dutch, clips/e5-large-trm-nl se place dans la partie supérieure du classement global consacré aux embeddings néerlandais, couvrant notamment la classification, le clustering et la comparaison de paires. Sa spécialisation et son affinage à partir de clips/e5-large-trm en font une option adaptée à l’indexation et au rapprochement sémantique de textes néerlandais. Pour la recherche, les préfixes « query: » et « passage: » différencient explicitement les requêtes des contenus indexés. Pour les autres tâches, le seul préfixe « query: » peut être employé. La licence MIT autorise une intégration, une modification et un déploiement avec peu de contraintes.
Limites et points d’attention. Le résultat MTEB Dutch agrège plusieurs familles de tâches et ne doit pas être interprété comme une performance uniforme sur chacune d’elles. Les 355 millions de paramètres impliquent davantage de calcul qu’un encodeur plus petit. Les vecteurs denses de 1 024 dimensions augmentent aussi la taille des index, la mémoire nécessaire et le coût de recherche par rapport à des représentations moins dimensionnelles. Usages pertinents : recherche sémantique en néerlandais, récupération de passages pour le RAG, détection de similarité, classification par proximité et clustering documentaire.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).