avsolatorio/GIST-large-Embedding-v0
Publié par avsolatorio le 14 février 2024 sous licence ouverte MIT, GIST-large-Embedding-v0 est un modèle dense de 335 millions de paramètres. Il produit des vecteurs de 1 024 dimensions et dérive de BAAI/bge-large-en-v1.5, affiné sur une compilation de MEDI et de données de…
Publié par avsolatorio le 14 février 2024 sous licence ouverte MIT, GIST-large-Embedding-v0 est un modèle dense de 335 millions de paramètres. Il produit des vecteurs de 1 024 dimensions et dérive de BAAI/bge-large-en-v1.5, affiné sur une compilation de MEDI et de données de classification MTEB enrichie de triplets minés.
Le modèle encode directement les textes et les requêtes, sans instruction préalable. Compatible avec Sentence Transformers, il sert à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering de contenus.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | avsolatorio |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 14 février 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 335 millions |
| Paramètres actifs | 335 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 53,4 % | 57ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 39,0 % | 80ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 34,4 % | 103ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 40,2 % | 73ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 41,5 % | 69ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 49,2 % | 60ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 24,6 % | 112ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 15,9 % | 141ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 52,4 % | 46ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 42,6 % | 42ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 41,5 % | 62ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Indic | 34,0 % | 72ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur résultat relatif apparaît sur BEIR, ce qui en fait surtout un modèle adapté à la recherche zero-shot dans des corpus et domaines hétérogènes. Le track French est également mieux placé que ses autres évaluations linguistiques, tandis que les résultats European et German indiquent une capacité exploitable au-delà de l’anglais pour la classification, le clustering et la comparaison de textes. La licence MIT facilite l’auto-hébergement et l’intégration commerciale. L’encodage sans instruction simplifie les pipelines de recherche, notamment avec Sentence Transformers.
Limites et points d'attention. Les performances sont moins convaincantes sur les tracks Legal et Dutch, où le modèle se situe autour du milieu de tableau, ce qui appelle une validation sur les corpus spécialisés ou néerlandais visés. Ses vecteurs de 1 024 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle de février 2024 est probablement dépassé par des modèles d’embedding plus récents de son segment et peut avoir disparu des sélections courantes de l’éditeur. Usages pertinents : recherche sémantique généraliste, RAG, similarité et clustering, avec évaluation préalable en contexte juridique ou néerlandais.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).