GritLM/GritLM-8x7B

Publié par GritLM le 15 février 2024 sous licence ouverte Apache 2.0, GritLM/GritLM-8x7B est un modèle d'embedding dense fondé sur Mixtral 8x7B et affiné avec la méthode GRIT. Il compte 58 milliards de paramètres, dont 13 milliards actifs.

Publié par GritLM le 15 février 2024 sous licence ouverte Apache 2.0, GritLM/GritLM-8x7B est un modèle d'embedding dense fondé sur Mixtral 8x7B et affiné avec la méthode GRIT. Il compte 58 milliards de paramètres, dont 13 milliards actifs.

Chaque texte est représenté par un vecteur de 32 768 dimensions. Cette représentation sert à la recherche sémantique, à la sélection de passages pour le RAG, au calcul de similarité et au clustering. Ses résultats couvrent notamment plusieurs langues européennes ainsi que des corpus français, médicaux et juridiques.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurGritLM
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie15 février 2024
Dimension du vecteur32 768
Représentationdense
Paramètres58 milliards
Paramètres actifs13 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR55,1 %42ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval44,2 %52ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal46,8 %54ᵉ / 208mteb✅ Mesuré
MTEB: Medical60,9 %21ᵉ / 158mteb✅ Mesuré
MTEB: Legal54,1 %35ᵉ / 157mteb✅ Mesuré
MTEB: European62,3 %10ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French58,8 %14ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German46,8 %64ᵉ / 209mteb✅ Mesuré
MTEB: Instruction Following2,4 %23ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. GritLM/GritLM-8x7B se distingue surtout sur MTEB European, où il figure dans le top 10 pour des tâches européennes comprenant le bitext mining et la classification. Il obtient également un classement solide sur RTEB French, consacré à la recherche en français dans des corpus juridiques et de connaissances générales, ainsi que sur MTEB Medical pour la recherche clinique, biomédicale et grand public. La licence Apache 2.0 autorise l'auto-hébergement et l'intégration dans des systèmes commerciaux. L'activation de 13 milliards de paramètres sur un total de 58 milliards reprend le fonctionnement parcimonieux de l'architecture Mixtral.

Limites et points d'attention. Les résultats sont moins compétitifs sur BEIR et dans les tracks juridiques, particulièrement RTEB Legal, que sur les évaluations européennes, françaises et médicales. Les vecteurs denses de 32 768 dimensions alourdissent fortement les index, la mémoire nécessaire au stockage et le coût des recherches de similarité. Sorti il y a environ deux ans, le modèle est ancien à l'échelle de l'IA et peut être dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique multilingue européenne, retrieval en français, RAG médical et regroupement de documents lorsque l'infrastructure peut absorber des vecteurs très volumineux.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).