Mihaiii/gte-micro-v4
Mihaiii/gte-micro-v4 est un modèle d’embedding dense de 19 millions de paramètres, publié par Mihaiii le 22 avril 2024 sous licence ouverte MIT. Distillé de gte-tiny, il produit des vecteurs de 384 dimensions et traite exclusivement des textes anglais, avec une troncature à 512 tokens.
Mihaiii/gte-micro-v4 est un modèle d’embedding dense de 19 millions de paramètres, publié par Mihaiii le 22 avril 2024 sous licence ouverte MIT. Distillé de gte-tiny, il produit des vecteurs de 384 dimensions et traite exclusivement des textes anglais, avec une troncature à 512 tokens.
Conçu pour l’autocomplétion sémantique, il génère des embeddings de phrases avec Sentence-Transformers ou Hugging Face Transformers, à l’aide d’un pooling moyen tenant compte du masque d’attention. Ces représentations servent à la recherche sémantique, au RAG, au calcul de similarité et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Mihaiii |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 22 avril 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 19 millions |
| Paramètres actifs | 19 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 39,2 % | 141ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 32,7 % | 113ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 29,3 % | 148ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 29,8 % | 116ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 36,3 % | 106ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 42,9 % | 105ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 7,5 % | 164ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 12,2 % | 162ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 43,6 % | 91ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 36,4 % | 70ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Indic | 31,8 % | 101ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Russian | 22,3 % | 93ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Ses résultats MTEB les plus élevés concernent les évaluations French et European, devant BEIR, ce qui indique une aptitude relative aux tâches de classification, de clustering, de comparaison de paires et de recherche zero-shot. Ces scores restent toutefois situés dans le bas des classements correspondants et ne constituent pas une prise en charge multilingue, le modèle étant exclusivement anglophone. Ses 19 millions de paramètres et ses vecteurs de 384 dimensions permettent des index relativement compacts. La licence MIT facilite l’auto-hébergement, la modification et l’intégration dans des applications commerciales.
Limites et points d'attention. Les performances sont plus faibles sur German et Legal, puis sur Long-context Retrieval, ce qui limite son intérêt pour l’allemand, les corpus juridiques et la recherche dans des documents longs. La troncature à 512 tokens impose de découper les contenus volumineux avant indexation. Sorti il y a environ deux ans, une ancienneté très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée par des modèles d’embedding plus récents. Usages pertinents : autocomplétion sémantique en anglais, petits index de recherche, RAG sur passages courts, similarité de phrases et clustering à ressources contenues.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).