avsolatorio/GIST-Embedding-v0

Publié par avsolatorio le 31 janvier 2024 sous licence ouverte MIT, GIST-Embedding-v0 est un modèle dense de 109 millions de paramètres, affiné à partir de BAAI/bge-base-en-v1.5. Il représente chaque texte par un vecteur de 768 dimensions.

Publié par avsolatorio le 31 janvier 2024 sous licence ouverte MIT, GIST-Embedding-v0 est un modèle dense de 109 millions de paramètres, affiné à partir de BAAI/bge-base-en-v1.5. Il représente chaque texte par un vecteur de 768 dimensions.

Le modèle produit directement les embeddings des documents et des requêtes, sans instruction particulière. Compatible avec Sentence Transformers, il sert à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité cosinus et au clustering de textes.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeuravsolatorio
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie31 janvier 2024
Dimension du vecteur768
Représentationdense
Paramètres109 millions
Paramètres actifs109 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR52,3 %70ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval35,2 %99ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal32,5 %121ᵉ / 208mteb✅ Mesuré
MTEB: Medical40,0 %75ᵉ / 158mteb✅ Mesuré
MTEB: Legal40,7 %73ᵉ / 157mteb✅ Mesuré
MTEB: European47,9 %70ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French20,7 %126ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German16,1 %136ᵉ / 209mteb✅ Mesuré
MTEB: French49,1 %67ᵉ / 117mteb✅ Mesuré
MTEB: German40,4 %51ᵉ / 96mteb✅ Mesuré
MTEB: Dutch40,0 %69ᵉ / 113mteb✅ Mesuré
MTEB: Indic33,3 %78ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ avsolatorio/GIST-Embedd…52 %
llmrails/ember-v152 %

MTEB: Long-context Retrieval

▶ avsolatorio/GIST-Embedd…35 %

Notre analyse

Forces. Le résultat le plus solide apparaît sur BEIR, qui évalue la recherche zero-shot dans des tâches et domaines hétérogènes. Le modèle reste également exploitable sur les ensembles French, European et Legal, couvrant notamment la classification, le clustering, la similarité de paires et la recherche documentaire. Son entraînement sur MEDI a été enrichi de triplets issus de données de classification MTEB, hors Amazon Polarity Classification. La licence MIT facilite l’auto-hébergement et l’intégration commerciale, tandis que Sentence Transformers simplifie la génération des vecteurs et leur comparaison.

Limites et points d’attention. Les positions obtenues sur French, European, German et Dutch se situent globalement dans la seconde moitié des classements considérés. Le track Legal présente aussi un niveau modéré, ce qui invite à valider le modèle sur les corpus spécialisés avant déploiement. Sorti il y a environ deux ans, il appartient à une génération désormais ancienne à l’échelle de l’IA et probablement dépassée par des embeddings plus récents. Ses vecteurs de 768 dimensions imposent par ailleurs un stockage et un calcul de recherche non négligeables à grande échelle. Usages pertinents : recherche sémantique généraliste, RAG, déduplication, regroupement thématique et mesure de proximité entre textes après évaluation sur les données cibles.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).