manu/sentence_croissant_alpha_v0.2
Publié par manu le 15 mars 2024, manu/sentence_croissant_alpha_v0.2 est un modèle d’embedding multilingue de 1 milliard de paramètres. Fondé sur LlamaModel et intégré à Sentence-Transformers, il produit des vecteurs denses de 2 048 dimensions à partir de séquences comptant jusqu’à 1 024…
Publié par manu le 15 mars 2024, manu/sentence_croissant_alpha_v0.2 est un modèle d’embedding multilingue de 1 milliard de paramètres. Fondé sur LlamaModel et intégré à Sentence-Transformers, il produit des vecteurs denses de 2 048 dimensions à partir de séquences comptant jusqu’à 1 024 tokens.
Un pooling pondéré des tokens, incluant le prompt, transforme les phrases et paragraphes en représentations numériques. Ces vecteurs servent à la recherche sémantique, à la récupération de passages pour un système RAG, au calcul de similarité et au clustering. Sorti il y a près de deux ans, le modèle appartient désormais à une génération ancienne à l’échelle de l’IA, probablement dépassée par des embeddings plus récents.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | manu |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 15 mars 2024 |
| Dimension du vecteur | 2 048 |
| Représentation | dense |
| Paramètres | 1 milliards |
| Paramètres actifs | 1 milliards |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 36,8 % | 93ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 33,6 % | 110ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 37,3 % | 95ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 42,3 % | 61ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 49,2 % | 59ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 26,0 % | 109ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 27,0 % | 102ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 54,7 % | 36ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 46,8 % | 27ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Indic | 36,6 % | 57ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: French
Notre analyse
Forces. Les meilleurs résultats relatifs apparaissent sur les tracks MTEB French et German, où le modèle se situe dans le premier tiers des modèles évalués. Il est donc surtout pertinent pour représenter des textes français ou allemands dans des tâches de classification, de clustering et de comparaison de paires. Son résultat sur MTEB European reste proche du milieu du classement et confirme une aptitude multilingue plus large, notamment pour la classification et le bitext mining. La séquence maximale de 1 024 tokens permet aussi de traiter des paragraphes et des passages relativement développés.
Limites et points d'attention. Les résultats sont moins convaincants sur MTEB Medical et Long-context Retrieval, où le modèle figure dans la moitié basse. MTEB Legal est plus favorable en rang relatif, mais demeure nettement inférieur à ses résultats français et européens. La dimension de 2 048 alourdit les index vectoriels et peut rendre la recherche plus coûteuse qu’avec des embeddings plus compacts. Malgré une fenêtre de 1 024 tokens, le classement en contexte long indique une efficacité limitée sur les documents étendus. Son ancienneté accroît enfin le risque d’un écart avec les modèles contemporains. Usages pertinents : recherche sémantique, RAG et clustering de phrases ou paragraphes, particulièrement en français et en allemand, après validation sur le corpus ciblé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).