manu/sentence_croissant_alpha_v0.3

Publié par manu le 26 avril 2024, manu/sentence_croissant_alpha_v0.3 est un modèle d’embedding Sentence-Transformers fondé sur LlamaModel. Son milliard de paramètres produit des représentations denses de 2 048 dimensions. Sa longueur de séquence maximale atteint 1 024 tokens, avec un…

Publié par manu le 26 avril 2024, manu/sentence_croissant_alpha_v0.3 est un modèle d’embedding Sentence-Transformers fondé sur LlamaModel. Son milliard de paramètres produit des représentations denses de 2 048 dimensions. Sa longueur de séquence maximale atteint 1 024 tokens, avec un pooling pondéré qui inclut les tokens du prompt.

Le modèle transforme phrases et paragraphes en vecteurs numériques destinés à la recherche sémantique, à la récupération de passages pour les systèmes RAG, au calcul de similarité et au clustering. Il ne génère pas de texte, mais encode les contenus afin de les comparer ou de les indexer.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurmanu
Poids🟢 Poids ouverts
Date de sortie26 avril 2024
Dimension du vecteur2 048
Représentationdense
Paramètres1 milliards
Paramètres actifs1 milliards
Longueur de séquence max2 048 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval36,5 %96ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal35,3 %95ᵉ / 208mteb✅ Mesuré
MTEB: Medical39,4 %77ᵉ / 158mteb✅ Mesuré
MTEB: Legal43,5 %57ᵉ / 157mteb✅ Mesuré
MTEB: European49,5 %55ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French30,1 %90ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German29,8 %97ᵉ / 209mteb✅ Mesuré
MTEB: French55,4 %34ᵉ / 117mteb✅ Mesuré
MTEB: Indic36,3 %60ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur résultat relatif apparaît sur MTEB: French, où le modèle se situe dans le premier tiers du classement. Il conserve un niveau intermédiaire sur MTEB: European, ce qui indique une aptitude utile au traitement de textes dans plusieurs langues européennes. Sa séquence maximale de 1 024 tokens permet d’encoder des passages assez développés, tandis que le pooling pondéré incluant le prompt peut adapter la représentation à la consigne d’encodage. Ces caractéristiques conviennent à l’indexation sémantique de phrases, de paragraphes et d’extraits documentaires.

Limites et points d'attention. Les résultats sont plus faibles en recherche médicale, en langues indiciennes et surtout sur MTEB: Long-context Retrieval. Le juridique reste en milieu de tableau, sans spécialisation dominante sur ce domaine. Les vecteurs de 2 048 dimensions alourdissent l’index, la mémoire nécessaire et le coût des recherches par rapport à des représentations plus compactes. Sorti il y a environ deux ans, un âge très long à l’échelle de l’IA, ce modèle est probablement dépassé par des embeddings plus récents de sa catégorie. Usages pertinents : recherche sémantique en français, clustering et récupération de passages de longueur modérée pour un pipeline RAG.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).