avsolatorio/GIST-small-Embedding-v0

Publié par avsolatorio le 3 février 2024 sous licence ouverte MIT, GIST-small-Embedding-v0 est un modèle dense de 33 millions de paramètres. Il produit des vecteurs de 384 dimensions, un format compact qui limite la taille des index et facilite le déploiement avec Sentence Transformers.

Publié par avsolatorio le 3 février 2024 sous licence ouverte MIT, GIST-small-Embedding-v0 est un modèle dense de 33 millions de paramètres. Il produit des vecteurs de 384 dimensions, un format compact qui limite la taille des index et facilite le déploiement avec Sentence Transformers.

Affiné à partir de BAAI/bge-small-en-v1.5 sur MEDI et sur des triplets issus de tâches de classification MTEB, il encode directement les textes et les requêtes sans instruction. Il sert à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeuravsolatorio
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie3 février 2024
Dimension du vecteur384
Représentationdense
Paramètres33 millions
Paramètres actifs33 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR50,4 %95ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval34,8 %101ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal31,7 %129ᵉ / 208mteb✅ Mesuré
MTEB: Medical36,7 %98ᵉ / 158mteb✅ Mesuré
MTEB: Legal39,4 %85ᵉ / 157mteb✅ Mesuré
MTEB: European46,7 %80ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French14,7 %148ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German10,8 %171ᵉ / 209mteb✅ Mesuré
MTEB: French47,2 %78ᵉ / 117mteb✅ Mesuré
MTEB: German38,7 %61ᵉ / 96mteb✅ Mesuré
MTEB: Dutch38,4 %80ᵉ / 113mteb✅ Mesuré
MTEB: Indic31,6 %103ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ avsolatorio/GIST-small-…50 %
dwzhu/e5-base-4k50 %

MTEB: Long-context Retrieval

▶ avsolatorio/GIST-small-…35 %

Notre analyse

Forces. Son meilleur résultat relatif apparaît sur BEIR, consacré à la recherche zero-shot dans des domaines et des tâches de recherche d’information variés, même si son classement reste proche du milieu du panel. Les évaluations French et European montrent également une capacité exploitable pour la classification, le clustering, la comparaison de paires et plusieurs langues européennes. Ses vecteurs de 384 dimensions permettent de constituer des index relativement légers et de réduire le coût de stockage et de recherche. La licence MIT autorise par ailleurs l’intégration, la modification et l’auto-hébergement dans des applications commerciales ou internes.

Limites et points d'attention. Les résultats sont plus faibles sur les tracks Legal, German et Dutch, où le modèle se situe dans la seconde moitié des classements. La couverture thématique des données d’affinage peut aussi limiter les performances dans des domaines éloignés de celles-ci. Sorti il y a environ deux ans, un âge très long à l’échelle de l’IA, il appartient à une génération désormais probablement dépassée et souvent retirée des catalogues des éditeurs. Usages pertinents : prototypes compacts de recherche sémantique, RAG, similarité et clustering, après validation sur les langues et domaines ciblés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).