manu/sentence_croissant_alpha_v0.4
Publié par manu le 27 avril 2024 sous licence ouverte MIT, manu/sentence_croissant_alpha_v0.4 est un modèle d’embedding dense de 1 milliard de paramètres, tous actifs. Fondé sur LlamaModel et Sentence-Transformers, il produit des vecteurs de 2 048 dimensions.
Publié par manu le 27 avril 2024 sous licence ouverte MIT, manu/sentence_croissant_alpha_v0.4 est un modèle d’embedding dense de 1 milliard de paramètres, tous actifs. Fondé sur LlamaModel et Sentence-Transformers, il produit des vecteurs de 2 048 dimensions.
Sa longueur de séquence maximale atteint 1 024 tokens, avec un pooling pondéré incluant le prompt. Il encode phrases et paragraphes pour la recherche sémantique, l’indexation destinée au RAG, la mesure de similarité et le clustering. Près de deux ans après sa sortie, il appartient à une génération déjà ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | manu |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 27 avril 2024 |
| Dimension du vecteur | 2 048 |
| Représentation | dense |
| Paramètres | 1 milliards |
| Paramètres actifs | 1 milliards |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 37,2 % | 91ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 35,4 % | 94ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 39,1 % | 81ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 43,9 % | 56ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 49,7 % | 53ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 29,7 % | 91ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 31,0 % | 93ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 55,7 % | 33ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 43,6 % | 35ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Indic | 36,2 % | 62ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: French
Notre analyse
Forces. Le meilleur résultat relatif apparaît sur MTEB: French, où le modèle se situe dans le premier tiers du classement. Ses évaluations en allemand et dans le domaine juridique le placent également dans une zone plutôt favorable, tandis que MTEB: European indique une capacité exploitable sur plusieurs langues européennes. La séquence de 1 024 tokens facilite l’encodage de passages relativement longs, et la licence MIT autorise l’intégration, la modification et l’auto-hébergement. Le pooling pondéré des tokens, prompt compris, permet d’adapter la représentation à la consigne associée au texte.
Limites et points d’attention. Les résultats sont moins convaincants en recherche médicale et en Long-context Retrieval, deux tracks où le modèle se situe dans la moitié basse des classements. La fenêtre de 1 024 tokens ne suffit donc pas à garantir une bonne récupération sur des documents à contexte long. Les vecteurs denses de 2 048 dimensions alourdissent aussi les index et augmentent le coût de stockage et de recherche par rapport à des représentations moins dimensionnées. Son ancienneté invite à le comparer systématiquement aux embeddings récents. Usages pertinents : recherche sémantique en français, clustering de phrases ou paragraphes et indexation RAG sous licence permissive.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).