GritLM/GritLM-7B
Publié par GritLM le 15 février 2024, GritLM/GritLM-7B est un modèle d’embedding de 7 milliards de paramètres, tous actifs. Issu de Mistral 7B et affiné avec GRIT, il produit des vecteurs de 4 096 dimensions pour représenter numériquement des textes.
Publié par GritLM le 15 février 2024, GritLM/GritLM-7B est un modèle d’embedding de 7 milliards de paramètres, tous actifs. Issu de Mistral 7B et affiné avec GRIT, il produit des vecteurs de 4 096 dimensions pour représenter numériquement des textes.
Ces représentations servent à la recherche sémantique, à la récupération de passages dans un système RAG, au calcul de similarité et au clustering. Distribué sous licence ouverte Apache 2.0, le modèle peut être auto-hébergé et intégré à des infrastructures maîtrisées.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | GritLM |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 15 février 2024 |
| Dimension du vecteur | 4 096 |
| Représentation | embedding |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 47,1 % | 46ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 20,6 % | 4ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 48,0 % | 45ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 64,1 % | 19ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 71,3 % | 32ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 61,5 % | 16ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 56,7 % | 19ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 63,0 % | 8ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 57,1 % | 18ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 44,2 % | 75ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Russian | 65,0 % | 13ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: Scandinavian | 64,1 % | 7ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Reasoning Retrieval
Notre analyse
Forces. Les résultats MTEB placent GritLM/GritLM-7B parmi les dix premiers sur les tracks Scandinavian et European, ce qui en fait surtout un embedding performant pour la recherche et l’analyse de textes dans plusieurs langues européennes. Le modèle obtient également un classement solide sur Russian. Ses résultats en Medical et RTEB Healthcare montrent une aptitude notable à retrouver des informations cliniques, biomédicales et de santé. La licence Apache 2.0 facilite l’auto-hébergement, la modification et l’exploitation commerciale.
Limites et points d'attention. RTEB Finance constitue son positionnement le moins favorable parmi les tracks fournis, avec un rang plus éloigné de la tête. Ses vecteurs de 4 096 dimensions alourdissent les index, augmentent les besoins de stockage et rendent la recherche plus coûteuse que des représentations plus compactes. Les 7 milliards de paramètres actifs impliquent aussi un déploiement plus lourd. Sorti il y a environ deux ans, il est ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents. Usages pertinents : recherche multilingue européenne, RAG médical, similarité documentaire et clustering auto-hébergé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).