Alibaba-NLP/gte-Qwen2-1.5B-instruct
Publié par Alibaba le 29 juillet 2024, Alibaba-NLP/gte-Qwen2-1.5B-instruct est un modèle d’embedding dense multilingue de la famille GTE, construit sur Qwen2-1.5B. Ses 2 milliards de paramètres, tous actifs, produisent des vecteurs de 8 960 dimensions. Distribué sous licence ouverte…
Publié par Alibaba le 29 juillet 2024, Alibaba-NLP/gte-Qwen2-1.5B-instruct est un modèle d’embedding dense multilingue de la famille GTE, construit sur Qwen2-1.5B. Ses 2 milliards de paramètres, tous actifs, produisent des vecteurs de 8 960 dimensions. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé.
Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Il combine attention bidirectionnelle et réglage par instruction côté requête, après un entraînement multilingue couvrant plusieurs domaines avec des données supervisées et faiblement supervisées.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Alibaba |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 29 juillet 2024 |
| Dimension du vecteur | 8 960 |
| Représentation | dense |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 58,3 % | 20ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 44,1 % | 53ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 45,1 % | 63ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 65,0 % | 3ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 55,6 % | 24ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 61,8 % | 15ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 50,6 % | 42ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 45,9 % | 67ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chinese | 67,1 % | 31ᵉ / 58 | mteb | ✅ Mesuré |
| MTEB: French | 66,1 % | 12ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Indic | 60,4 % | 24ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Thai | 38,0 % | 25ᵉ / 28 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le domaine médical constitue son principal point fort dans MTEB, avec un classement parmi les tout meilleurs pour la recherche d’informations cliniques, biomédicales et de santé grand public. Les résultats en français et sur l’ensemble European le placent également dans le haut du classement, ce qui soutient les usages multilingues de classification, de clustering, de recherche et de rapprochement de textes. Sur BEIR, son rang témoigne aussi d’une bonne capacité de retrieval zero-shot dans des tâches et domaines hétérogènes. La licence Apache 2.0 facilite l’intégration et l’auto-hébergement, tandis que la compatibilité déclarée avec Sentence Transformers, Transformers et infinity_emb offre plusieurs voies de déploiement.
Limites et points d'attention. Les performances relatives sont moins marquantes sur les ensembles Chinese et Indic que sur les tracks médical, français et European. La dimension de sortie de 8 960 alourdit les index vectoriels, augmente les besoins de stockage et peut rendre la recherche plus coûteuse que chez des modèles produisant des vecteurs plus compacts. Sorti il y a près de deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : recherche médicale, RAG multilingue, recherche sémantique en français et en langues européennes, similarité documentaire et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).