Mihaiii/gte-micro-v4

Mihaiii/gte-micro-v4 est un modèle d’embedding dense de 19 millions de paramètres, publié par Mihaiii le 22 avril 2024 sous licence ouverte MIT. Distillé de gte-tiny, il produit des vecteurs de 384 dimensions et traite exclusivement des textes anglais, avec une troncature à 512 tokens.

Mihaiii/gte-micro-v4 est un modèle d’embedding dense de 19 millions de paramètres, publié par Mihaiii le 22 avril 2024 sous licence ouverte MIT. Distillé de gte-tiny, il produit des vecteurs de 384 dimensions et traite exclusivement des textes anglais, avec une troncature à 512 tokens.

Conçu pour l’autocomplétion sémantique, il génère des embeddings de phrases avec Sentence-Transformers ou Hugging Face Transformers, à l’aide d’un pooling moyen tenant compte du masque d’attention. Ces représentations servent à la recherche sémantique, au RAG, au calcul de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMihaiii
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie22 avril 2024
Dimension du vecteur384
Représentationdense
Paramètres19 millions
Paramètres actifs19 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR39,2 %141ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval32,7 %113ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal29,3 %148ᵉ / 208mteb✅ Mesuré
MTEB: Medical29,8 %116ᵉ / 158mteb✅ Mesuré
MTEB: Legal36,3 %106ᵉ / 157mteb✅ Mesuré
MTEB: European42,9 %105ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French7,5 %164ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German12,2 %162ᵉ / 209mteb✅ Mesuré
MTEB: French43,6 %91ᵉ / 117mteb✅ Mesuré
MTEB: German36,4 %70ᵉ / 96mteb✅ Mesuré
MTEB: Indic31,8 %101ᵉ / 119mteb✅ Mesuré
MTEB: Russian22,3 %93ᵉ / 104mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Ses résultats MTEB les plus élevés concernent les évaluations French et European, devant BEIR, ce qui indique une aptitude relative aux tâches de classification, de clustering, de comparaison de paires et de recherche zero-shot. Ces scores restent toutefois situés dans le bas des classements correspondants et ne constituent pas une prise en charge multilingue, le modèle étant exclusivement anglophone. Ses 19 millions de paramètres et ses vecteurs de 384 dimensions permettent des index relativement compacts. La licence MIT facilite l’auto-hébergement, la modification et l’intégration dans des applications commerciales.

Limites et points d'attention. Les performances sont plus faibles sur German et Legal, puis sur Long-context Retrieval, ce qui limite son intérêt pour l’allemand, les corpus juridiques et la recherche dans des documents longs. La troncature à 512 tokens impose de découper les contenus volumineux avant indexation. Sorti il y a environ deux ans, une ancienneté très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée par des modèles d’embedding plus récents. Usages pertinents : autocomplétion sémantique en anglais, petits index de recherche, RAG sur passages courts, similarité de phrases et clustering à ressources contenues.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).