avsolatorio/GIST-all-MiniLM-L6-v2
Publié par avsolatorio le 3 février 2024 sous licence ouverte MIT, GIST-all-MiniLM-L6-v2 est un modèle d’embedding dense de 23 millions de paramètres. Il produit des vecteurs compacts de 384 dimensions à partir de textes ou de requêtes documentaires.
Publié par avsolatorio le 3 février 2024 sous licence ouverte MIT, GIST-all-MiniLM-L6-v2 est un modèle d’embedding dense de 23 millions de paramètres. Il produit des vecteurs compacts de 384 dimensions à partir de textes ou de requêtes documentaires.
Affiné depuis sentence-transformers/all-MiniLM-L6-v2 avec le jeu MEDI enrichi de triplets issus de tâches de classification MTEB, il fonctionne sans instruction particulière. Il sert à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité cosinus et au clustering, notamment avec Sentence Transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | avsolatorio |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 3 février 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 23 millions |
| Paramètres actifs | 23 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 45,1 % | 127ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 34,4 % | 105ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 32,4 % | 122ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 32,2 % | 108ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 39,2 % | 89ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 45,5 % | 94ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 10,1 % | 160ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 14,2 % | 150ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 46,2 % | 82ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 38,4 % | 63ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 36,1 % | 88ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Indic | 32,4 % | 88ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les évaluations MTEB placent ses résultats relatifs les plus favorables sur les ensembles French et European, ce qui le rend plus intéressant pour la comparaison et l’organisation de textes en français ou dans plusieurs langues européennes que pour ses autres domaines évalués. Sa représentation dense de 384 dimensions permet de constituer des index relativement compacts, tandis que ses 23 millions de paramètres facilitent un déploiement léger. La licence MIT autorise l’auto-hébergement et une intégration souple dans des chaînes de recherche documentaire.
Limites et points d’attention. Les classements restent dans la seconde moitié des tableaux sur French, European et BEIR, ce qui signale une qualité désormais modeste face aux autres modèles évalués. Les résultats sont encore plus faibles sur Legal, German et surtout Dutch. Sorti il y a environ deux ans, un âge très long à l’échelle de l’IA, ce modèle appartient à une génération probablement dépassée et souvent retirée des catalogues actuels de son éditeur. Usages pertinents : prototypes de recherche sémantique, petits index RAG, déduplication, similarité et clustering lorsque la compacité et la licence MIT priment sur la qualité maximale.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).