Qwen: Qwen3 Embedding 8B
Qwen: Qwen3 Embedding 8B est un modèle d’embedding dense de Qwen, publié sous licence ouverte Apache 2.0. Ses 8 milliards de paramètres actifs et ses 36 couches produisent des vecteurs comptant jusqu’à 4 096 dimensions, avec une longueur de contexte de 32K.
Qwen: Qwen3 Embedding 8B est un modèle d’embedding dense de Qwen, publié sous licence ouverte Apache 2.0. Ses 8 milliards de paramètres actifs et ses 36 couches produisent des vecteurs comptant jusqu’à 4 096 dimensions, avec une longueur de contexte de 32K.
Multilingue, il couvre plus de 100 langues et accepte des instructions adaptées aux tâches. Il transforme les textes en représentations numériques pour la recherche sémantique, la sélection de passages dans un système RAG, la classification, le clustering et le bitext mining. Le support MRL permet d’ajuster la dimension de sortie entre 32 et 4 096.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 28 octobre 2025 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Paramètres | 8 milliards |
| Paramètres actifs | 8 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embeddings |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 62,8 % | 4ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 79,9 % | 2ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 80,7 % | 4ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 67,2 % | 8ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 67,0 % | 12ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 72,7 % | 27ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 59,5 % | 13ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 66,8 % | 21ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: CoREB | 59,0 % | 8ᵉ / 19 | mteb | ✅ Mesuré |
| MTEB: Chinese | 73,9 % | 7ᵉ / 58 | mteb | ✅ Mesuré |
| MTEB: Russian | 71,4 % | 2ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: Dutch | 65,6 % | 5ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Code Information Retrieval
Tarifs
| Fournisseur | Prix / 1M tokens |
|---|---|
| Nebius Token Factory | 0,01 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 78 % en dessous de la moyenne des modèles d'embedding similaires.
Notre analyse
Forces. Les résultats MTEB placent le modèle parmi les mieux classés en recherche d’information, notamment sur les contenus chinois et russes. Ses performances sont également solides sur RTEB Legal, ce qui favorise la recherche dans des corpus de jurisprudence, de textes réglementaires ou de résumés juridiques. Le contexte de 32K facilite l’encodage de documents longs. Les dimensions personnalisables permettent d’arbitrer entre précision, taille d’index et vitesse de recherche. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des services commerciaux. Le tarif minimal de 0,01 $ par million de tokens en entrée se situe 78 % sous la moyenne des modèles similaires.
Limites et points d’attention. RTEB Finance constitue son résultat relatif le moins favorable, avec un classement sensiblement inférieur à ceux observés en chinois, en russe et dans le domaine juridique. À sa dimension maximale de 4 096, chaque vecteur alourdit le stockage, la mémoire et le calcul nécessaires à la recherche de voisins. Une réduction via MRL rend l’index plus compact, au prix d’un arbitrage sur la richesse de la représentation. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, exploration de corpus juridiques, classification, rapprochement de textes et clustering.
Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).