avsolatorio/GIST-all-MiniLM-L6-v2

Publié par avsolatorio le 3 février 2024 sous licence ouverte MIT, GIST-all-MiniLM-L6-v2 est un modèle d’embedding dense de 23 millions de paramètres. Il produit des vecteurs compacts de 384 dimensions à partir de textes ou de requêtes documentaires.

Publié par avsolatorio le 3 février 2024 sous licence ouverte MIT, GIST-all-MiniLM-L6-v2 est un modèle d’embedding dense de 23 millions de paramètres. Il produit des vecteurs compacts de 384 dimensions à partir de textes ou de requêtes documentaires.

Affiné depuis sentence-transformers/all-MiniLM-L6-v2 avec le jeu MEDI enrichi de triplets issus de tâches de classification MTEB, il fonctionne sans instruction particulière. Il sert à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité cosinus et au clustering, notamment avec Sentence Transformers.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeuravsolatorio
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie3 février 2024
Dimension du vecteur384
Représentationdense
Paramètres23 millions
Paramètres actifs23 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR45,1 %127ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval34,4 %105ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal32,4 %122ᵉ / 208mteb✅ Mesuré
MTEB: Medical32,2 %108ᵉ / 158mteb✅ Mesuré
MTEB: Legal39,2 %89ᵉ / 157mteb✅ Mesuré
MTEB: European45,5 %94ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French10,1 %160ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German14,2 %150ᵉ / 209mteb✅ Mesuré
MTEB: French46,2 %82ᵉ / 117mteb✅ Mesuré
MTEB: German38,4 %63ᵉ / 96mteb✅ Mesuré
MTEB: Dutch36,1 %88ᵉ / 113mteb✅ Mesuré
MTEB: Indic32,4 %88ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les évaluations MTEB placent ses résultats relatifs les plus favorables sur les ensembles French et European, ce qui le rend plus intéressant pour la comparaison et l’organisation de textes en français ou dans plusieurs langues européennes que pour ses autres domaines évalués. Sa représentation dense de 384 dimensions permet de constituer des index relativement compacts, tandis que ses 23 millions de paramètres facilitent un déploiement léger. La licence MIT autorise l’auto-hébergement et une intégration souple dans des chaînes de recherche documentaire.

Limites et points d’attention. Les classements restent dans la seconde moitié des tableaux sur French, European et BEIR, ce qui signale une qualité désormais modeste face aux autres modèles évalués. Les résultats sont encore plus faibles sur Legal, German et surtout Dutch. Sorti il y a environ deux ans, un âge très long à l’échelle de l’IA, ce modèle appartient à une génération probablement dépassée et souvent retirée des catalogues actuels de son éditeur. Usages pertinents : prototypes de recherche sémantique, petits index RAG, déduplication, similarité et clustering lorsque la compacité et la licence MIT priment sur la qualité maximale.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).