manu/sentence_croissant_alpha_v0.2

Publié par manu le 15 mars 2024, manu/sentence_croissant_alpha_v0.2 est un modèle d’embedding multilingue de 1 milliard de paramètres. Fondé sur LlamaModel et intégré à Sentence-Transformers, il produit des vecteurs denses de 2 048 dimensions à partir de séquences comptant jusqu’à 1 024…

Publié par manu le 15 mars 2024, manu/sentence_croissant_alpha_v0.2 est un modèle d’embedding multilingue de 1 milliard de paramètres. Fondé sur LlamaModel et intégré à Sentence-Transformers, il produit des vecteurs denses de 2 048 dimensions à partir de séquences comptant jusqu’à 1 024 tokens.

Un pooling pondéré des tokens, incluant le prompt, transforme les phrases et paragraphes en représentations numériques. Ces vecteurs servent à la recherche sémantique, à la récupération de passages pour un système RAG, au calcul de similarité et au clustering. Sorti il y a près de deux ans, le modèle appartient désormais à une génération ancienne à l’échelle de l’IA, probablement dépassée par des embeddings plus récents.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurmanu
Poids🟢 Poids ouverts
Date de sortie15 mars 2024
Dimension du vecteur2 048
Représentationdense
Paramètres1 milliards
Paramètres actifs1 milliards
Longueur de séquence max2 048 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval36,8 %93ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal33,6 %110ᵉ / 208mteb✅ Mesuré
MTEB: Medical37,3 %95ᵉ / 158mteb✅ Mesuré
MTEB: Legal42,3 %61ᵉ / 157mteb✅ Mesuré
MTEB: European49,2 %59ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French26,0 %109ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German27,0 %102ᵉ / 209mteb✅ Mesuré
MTEB: French54,7 %36ᵉ / 117mteb✅ Mesuré
MTEB: German46,8 %27ᵉ / 96mteb✅ Mesuré
MTEB: Indic36,6 %57ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les meilleurs résultats relatifs apparaissent sur les tracks MTEB French et German, où le modèle se situe dans le premier tiers des modèles évalués. Il est donc surtout pertinent pour représenter des textes français ou allemands dans des tâches de classification, de clustering et de comparaison de paires. Son résultat sur MTEB European reste proche du milieu du classement et confirme une aptitude multilingue plus large, notamment pour la classification et le bitext mining. La séquence maximale de 1 024 tokens permet aussi de traiter des paragraphes et des passages relativement développés.

Limites et points d'attention. Les résultats sont moins convaincants sur MTEB Medical et Long-context Retrieval, où le modèle figure dans la moitié basse. MTEB Legal est plus favorable en rang relatif, mais demeure nettement inférieur à ses résultats français et européens. La dimension de 2 048 alourdit les index vectoriels et peut rendre la recherche plus coûteuse qu’avec des embeddings plus compacts. Malgré une fenêtre de 1 024 tokens, le classement en contexte long indique une efficacité limitée sur les documents étendus. Son ancienneté accroît enfin le risque d’un écart avec les modèles contemporains. Usages pertinents : recherche sémantique, RAG et clustering de phrases ou paragraphes, particulièrement en français et en allemand, après validation sur le corpus ciblé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).