Alibaba-NLP/gte-Qwen1.5-7B-instruct
Publié par Alibaba le 20 avril 2024, Alibaba-NLP/gte-Qwen1.5-7B-instruct est un modèle d’embedding dense de 7 milliards de paramètres, tous actifs. Il transforme les textes en vecteurs de 4 096 dimensions afin d’en représenter la proximité sémantique.
Publié par Alibaba le 20 avril 2024, Alibaba-NLP/gte-Qwen1.5-7B-instruct est un modèle d’embedding dense de 7 milliards de paramètres, tous actifs. Il transforme les textes en vecteurs de 4 096 dimensions afin d’en représenter la proximité sémantique.
Sa couverture du français, des langues européennes et des langues indiciennes lui confère un positionnement multilingue. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré à des systèmes de recherche sémantique, de RAG, de classement par similarité ou de clustering documentaire.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Alibaba |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 20 avril 2024 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 56,2 % | 28ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 41,8 % | 62ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 22,1 % | 3ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 41,4 % | 74ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 62,2 % | 14ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 51,6 % | 40ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 62,0 % | 14ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 41,8 % | 66ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 38,0 % | 85ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 65,9 % | 14ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Indic | 59,6 % | 29ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 5,4 % | 11ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le modèle se distingue surtout sur les évaluations MTEB consacrées au français, au médical et aux langues européennes, où il figure parmi les modèles les mieux classés. Ce profil convient à la représentation de corpus multilingues et à la recherche d’informations dans des contenus cliniques, biomédicaux ou destinés au grand public. Sa licence Apache 2.0 facilite l’auto-hébergement, l’adaptation et l’exploitation commerciale sans dépendre d’un service propriétaire.
Limites et points d’attention. Les résultats sont moins favorables sur Legal, où le modèle se situe plus loin dans le classement, ainsi que sur BEIR et les langues indiciennes. Ses vecteurs de 4 096 dimensions impliquent des index plus volumineux, davantage de mémoire et des recherches potentiellement plus coûteuses que celles de modèles produisant des représentations plus compactes. Avec 7 milliards de paramètres actifs, son déploiement est également plus exigeant que celui d’un petit encodeur. Sorti il y a près de deux ans, il appartient désormais à une génération ancienne à l’échelle de l’IA et peut être dépassé ou retiré des catalogues actuels. Usages pertinents : recherche sémantique et RAG multilingues, notamment en français, en langues européennes et sur des corpus médicaux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).