manu/sentence_croissant_alpha_v0.3
Publié par manu le 26 avril 2024, manu/sentence_croissant_alpha_v0.3 est un modèle d’embedding Sentence-Transformers fondé sur LlamaModel. Son milliard de paramètres produit des représentations denses de 2 048 dimensions. Sa longueur de séquence maximale atteint 1 024 tokens, avec un…
Publié par manu le 26 avril 2024, manu/sentence_croissant_alpha_v0.3 est un modèle d’embedding Sentence-Transformers fondé sur LlamaModel. Son milliard de paramètres produit des représentations denses de 2 048 dimensions. Sa longueur de séquence maximale atteint 1 024 tokens, avec un pooling pondéré qui inclut les tokens du prompt.
Le modèle transforme phrases et paragraphes en vecteurs numériques destinés à la recherche sémantique, à la récupération de passages pour les systèmes RAG, au calcul de similarité et au clustering. Il ne génère pas de texte, mais encode les contenus afin de les comparer ou de les indexer.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | manu |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 26 avril 2024 |
| Dimension du vecteur | 2 048 |
| Représentation | dense |
| Paramètres | 1 milliards |
| Paramètres actifs | 1 milliards |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 36,5 % | 96ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 35,3 % | 95ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 39,4 % | 77ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 43,5 % | 57ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 49,5 % | 55ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 30,1 % | 90ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 29,8 % | 97ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 55,4 % | 34ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Indic | 36,3 % | 60ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: French
Notre analyse
Forces. Le meilleur résultat relatif apparaît sur MTEB: French, où le modèle se situe dans le premier tiers du classement. Il conserve un niveau intermédiaire sur MTEB: European, ce qui indique une aptitude utile au traitement de textes dans plusieurs langues européennes. Sa séquence maximale de 1 024 tokens permet d’encoder des passages assez développés, tandis que le pooling pondéré incluant le prompt peut adapter la représentation à la consigne d’encodage. Ces caractéristiques conviennent à l’indexation sémantique de phrases, de paragraphes et d’extraits documentaires.
Limites et points d'attention. Les résultats sont plus faibles en recherche médicale, en langues indiciennes et surtout sur MTEB: Long-context Retrieval. Le juridique reste en milieu de tableau, sans spécialisation dominante sur ce domaine. Les vecteurs de 2 048 dimensions alourdissent l’index, la mémoire nécessaire et le coût des recherches par rapport à des représentations plus compactes. Sorti il y a environ deux ans, un âge très long à l’échelle de l’IA, ce modèle est probablement dépassé par des embeddings plus récents de sa catégorie. Usages pertinents : recherche sémantique en français, clustering et récupération de passages de longueur modérée pour un pipeline RAG.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).