Mihaiii/gte-micro
Publié par Mihaiii le 21 avril 2024 sous licence MIT, Mihaiii/gte-micro est un modèle d’embedding dense de 17 millions de paramètres, tous actifs. Distillé à partir de gte-small pour l’autocomplétion sémantique, il transforme exclusivement des textes anglais en vecteurs de 384 dimensions…
Publié par Mihaiii le 21 avril 2024 sous licence MIT, Mihaiii/gte-micro est un modèle d’embedding dense de 17 millions de paramètres, tous actifs. Distillé à partir de gte-small pour l’autocomplétion sémantique, il transforme exclusivement des textes anglais en vecteurs de 384 dimensions et accepte jusqu’à 512 tokens.
Ces vecteurs servent à la recherche sémantique, à la récupération de passages pour un système RAG, à la mesure de similarité et au clustering. Le modèle applique un average pooling aux derniers états cachés, avec normalisation L2 optionnelle, et fonctionne avec Transformers ou sentence-transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Mihaiii |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 21 avril 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 17 millions |
| Paramètres actifs | 17 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 28,1 % | 163ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 27,1 % | 136ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 24,7 % | 175ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 21,3 % | 138ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 26,4 % | 139ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 40,8 % | 111ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 5,5 % | 174ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 8,2 % | 183ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 37,7 % | 101ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 30,9 % | 81ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Indic | 30,3 % | 114ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Russian | 20,6 % | 98ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les évaluations MTEB European et French constituent ses résultats les moins faibles, notamment sur des ensembles mêlant classification, clustering, pair classification et bitext mining, sans toutefois le placer parmi les modèles les mieux classés. Ses 17 millions de paramètres et ses vecteurs de 384 dimensions favorisent un index compact, avec des besoins de stockage et de calcul contenus. La licence MIT permet l’auto-hébergement et l’intégration dans des produits commerciaux. La compatibilité avec Transformers et sentence-transformers simplifie également son déploiement.
Limites et points d'attention. Malgré les évaluations européennes, le modèle prend exclusivement en charge l’anglais. Ses classements sont faibles sur MTEB German et Indic, ainsi que sur BEIR pour la recherche zero-shot. Le résultat en Long-context Retrieval est également bas, ce qui concorde avec une séquence limitée à 512 tokens et la troncature des textes plus longs. Sorti il y a environ deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et apparaît probablement dépassé face aux modèles plus récents de sa catégorie. Usages pertinents : petits index anglophones, autocomplétion sémantique, prototypes RAG et clustering de textes courts.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).