GritLM/GritLM-7B

Publié par GritLM le 15 février 2024, GritLM/GritLM-7B est un modèle d’embedding de 7 milliards de paramètres, tous actifs. Issu de Mistral 7B et affiné avec GRIT, il produit des vecteurs de 4 096 dimensions pour représenter numériquement des textes.

Publié par GritLM le 15 février 2024, GritLM/GritLM-7B est un modèle d’embedding de 7 milliards de paramètres, tous actifs. Issu de Mistral 7B et affiné avec GRIT, il produit des vecteurs de 4 096 dimensions pour représenter numériquement des textes.

Ces représentations servent à la recherche sémantique, à la récupération de passages dans un système RAG, au calcul de similarité et au clustering. Distribué sous licence ouverte Apache 2.0, le modèle peut être auto-hébergé et intégré à des infrastructures maîtrisées.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurGritLM
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie15 février 2024
Dimension du vecteur4 096
Représentationembedding
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval47,1 %46ᵉ / 170mteb✅ Mesuré
MTEB: Reasoning Retrieval20,6 %4ᵉ / 29mteb✅ Mesuré
MTEB: RTEB Legal48,0 %45ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare64,1 %19ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance71,3 %32ᵉ / 97mteb✅ Mesuré
MTEB: Medical61,5 %16ᵉ / 158mteb✅ Mesuré
MTEB: Legal56,7 %19ᵉ / 157mteb✅ Mesuré
MTEB: European63,0 %8ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French57,1 %18ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German44,2 %75ᵉ / 209mteb✅ Mesuré
MTEB: Russian65,0 %13ᵉ / 104mteb✅ Mesuré
MTEB: Scandinavian64,1 %7ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB placent GritLM/GritLM-7B parmi les dix premiers sur les tracks Scandinavian et European, ce qui en fait surtout un embedding performant pour la recherche et l’analyse de textes dans plusieurs langues européennes. Le modèle obtient également un classement solide sur Russian. Ses résultats en Medical et RTEB Healthcare montrent une aptitude notable à retrouver des informations cliniques, biomédicales et de santé. La licence Apache 2.0 facilite l’auto-hébergement, la modification et l’exploitation commerciale.

Limites et points d'attention. RTEB Finance constitue son positionnement le moins favorable parmi les tracks fournis, avec un rang plus éloigné de la tête. Ses vecteurs de 4 096 dimensions alourdissent les index, augmentent les besoins de stockage et rendent la recherche plus coûteuse que des représentations plus compactes. Les 7 milliards de paramètres actifs impliquent aussi un déploiement plus lourd. Sorti il y a environ deux ans, il est ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents. Usages pertinents : recherche multilingue européenne, RAG médical, similarité documentaire et clustering auto-hébergé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).