avsolatorio/GIST-Embedding-v0
Publié par avsolatorio le 31 janvier 2024 sous licence ouverte MIT, GIST-Embedding-v0 est un modèle dense de 109 millions de paramètres, affiné à partir de BAAI/bge-base-en-v1.5. Il représente chaque texte par un vecteur de 768 dimensions.
Publié par avsolatorio le 31 janvier 2024 sous licence ouverte MIT, GIST-Embedding-v0 est un modèle dense de 109 millions de paramètres, affiné à partir de BAAI/bge-base-en-v1.5. Il représente chaque texte par un vecteur de 768 dimensions.
Le modèle produit directement les embeddings des documents et des requêtes, sans instruction particulière. Compatible avec Sentence Transformers, il sert à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité cosinus et au clustering de textes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | avsolatorio |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 31 janvier 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 109 millions |
| Paramètres actifs | 109 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 52,3 % | 70ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 35,2 % | 99ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 32,5 % | 121ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 40,0 % | 75ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 40,7 % | 73ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 47,9 % | 70ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 20,7 % | 126ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 16,1 % | 136ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 49,1 % | 67ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 40,4 % | 51ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 40,0 % | 69ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Indic | 33,3 % | 78ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le résultat le plus solide apparaît sur BEIR, qui évalue la recherche zero-shot dans des tâches et domaines hétérogènes. Le modèle reste également exploitable sur les ensembles French, European et Legal, couvrant notamment la classification, le clustering, la similarité de paires et la recherche documentaire. Son entraînement sur MEDI a été enrichi de triplets issus de données de classification MTEB, hors Amazon Polarity Classification. La licence MIT facilite l’auto-hébergement et l’intégration commerciale, tandis que Sentence Transformers simplifie la génération des vecteurs et leur comparaison.
Limites et points d’attention. Les positions obtenues sur French, European, German et Dutch se situent globalement dans la seconde moitié des classements considérés. Le track Legal présente aussi un niveau modéré, ce qui invite à valider le modèle sur les corpus spécialisés avant déploiement. Sorti il y a environ deux ans, il appartient à une génération désormais ancienne à l’échelle de l’IA et probablement dépassée par des embeddings plus récents. Ses vecteurs de 768 dimensions imposent par ailleurs un stockage et un calcul de recherche non négligeables à grande échelle. Usages pertinents : recherche sémantique généraliste, RAG, déduplication, regroupement thématique et mesure de proximité entre textes après évaluation sur les données cibles.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).