avsolatorio/GIST-small-Embedding-v0
Publié par avsolatorio le 3 février 2024 sous licence ouverte MIT, GIST-small-Embedding-v0 est un modèle dense de 33 millions de paramètres. Il produit des vecteurs de 384 dimensions, un format compact qui limite la taille des index et facilite le déploiement avec Sentence Transformers.
Publié par avsolatorio le 3 février 2024 sous licence ouverte MIT, GIST-small-Embedding-v0 est un modèle dense de 33 millions de paramètres. Il produit des vecteurs de 384 dimensions, un format compact qui limite la taille des index et facilite le déploiement avec Sentence Transformers.
Affiné à partir de BAAI/bge-small-en-v1.5 sur MEDI et sur des triplets issus de tâches de classification MTEB, il encode directement les textes et les requêtes sans instruction. Il sert à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | avsolatorio |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 3 février 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 33 millions |
| Paramètres actifs | 33 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 50,4 % | 95ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 34,8 % | 101ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 31,7 % | 129ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 36,7 % | 98ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 39,4 % | 85ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 46,7 % | 80ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 14,7 % | 148ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 10,8 % | 171ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 47,2 % | 78ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 38,7 % | 61ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 38,4 % | 80ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Indic | 31,6 % | 103ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Son meilleur résultat relatif apparaît sur BEIR, consacré à la recherche zero-shot dans des domaines et des tâches de recherche d’information variés, même si son classement reste proche du milieu du panel. Les évaluations French et European montrent également une capacité exploitable pour la classification, le clustering, la comparaison de paires et plusieurs langues européennes. Ses vecteurs de 384 dimensions permettent de constituer des index relativement légers et de réduire le coût de stockage et de recherche. La licence MIT autorise par ailleurs l’intégration, la modification et l’auto-hébergement dans des applications commerciales ou internes.
Limites et points d'attention. Les résultats sont plus faibles sur les tracks Legal, German et Dutch, où le modèle se situe dans la seconde moitié des classements. La couverture thématique des données d’affinage peut aussi limiter les performances dans des domaines éloignés de celles-ci. Sorti il y a environ deux ans, un âge très long à l’échelle de l’IA, il appartient à une génération désormais probablement dépassée et souvent retirée des catalogues des éditeurs. Usages pertinents : prototypes compacts de recherche sémantique, RAG, similarité et clustering, après validation sur les langues et domaines ciblés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).