GritLM/GritLM-8x7B
Publié par GritLM le 15 février 2024 sous licence ouverte Apache 2.0, GritLM/GritLM-8x7B est un modèle d'embedding dense fondé sur Mixtral 8x7B et affiné avec la méthode GRIT. Il compte 58 milliards de paramètres, dont 13 milliards actifs.
Publié par GritLM le 15 février 2024 sous licence ouverte Apache 2.0, GritLM/GritLM-8x7B est un modèle d'embedding dense fondé sur Mixtral 8x7B et affiné avec la méthode GRIT. Il compte 58 milliards de paramètres, dont 13 milliards actifs.
Chaque texte est représenté par un vecteur de 32 768 dimensions. Cette représentation sert à la recherche sémantique, à la sélection de passages pour le RAG, au calcul de similarité et au clustering. Ses résultats couvrent notamment plusieurs langues européennes ainsi que des corpus français, médicaux et juridiques.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | GritLM |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 15 février 2024 |
| Dimension du vecteur | 32 768 |
| Représentation | dense |
| Paramètres | 58 milliards |
| Paramètres actifs | 13 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 55,1 % | 42ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 44,2 % | 52ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 46,8 % | 54ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 60,9 % | 21ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 54,1 % | 35ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 62,3 % | 10ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 58,8 % | 14ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 46,8 % | 64ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 2,4 % | 23ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. GritLM/GritLM-8x7B se distingue surtout sur MTEB European, où il figure dans le top 10 pour des tâches européennes comprenant le bitext mining et la classification. Il obtient également un classement solide sur RTEB French, consacré à la recherche en français dans des corpus juridiques et de connaissances générales, ainsi que sur MTEB Medical pour la recherche clinique, biomédicale et grand public. La licence Apache 2.0 autorise l'auto-hébergement et l'intégration dans des systèmes commerciaux. L'activation de 13 milliards de paramètres sur un total de 58 milliards reprend le fonctionnement parcimonieux de l'architecture Mixtral.
Limites et points d'attention. Les résultats sont moins compétitifs sur BEIR et dans les tracks juridiques, particulièrement RTEB Legal, que sur les évaluations européennes, françaises et médicales. Les vecteurs denses de 32 768 dimensions alourdissent fortement les index, la mémoire nécessaire au stockage et le coût des recherches de similarité. Sorti il y a environ deux ans, le modèle est ancien à l'échelle de l'IA et peut être dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique multilingue européenne, retrieval en français, RAG médical et regroupement de documents lorsque l'infrastructure peut absorber des vecteurs très volumineux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).