Qwen: Qwen3 Embedding 0.6B
Qwen: Qwen3 Embedding 0.6B est un modèle d’embedding textuel dense publié par Qwen le 5 novembre 2025 sous licence ouverte Apache 2.0. Ses 596 millions de paramètres sont répartis sur 28 couches. Il accepte des séquences de 32K et produit par défaut des vecteurs de 1024 dimensions.
Qwen: Qwen3 Embedding 0.6B est un modèle d’embedding textuel dense publié par Qwen le 5 novembre 2025 sous licence ouverte Apache 2.0. Ses 596 millions de paramètres sont répartis sur 28 couches. Il accepte des séquences de 32K et produit par défaut des vecteurs de 1024 dimensions.
Fondé sur Qwen3, il couvre plus de 100 langues et prend en charge des instructions personnalisées. Le support MRL permet de régler la dimension des vecteurs entre 32 et 1024. Le modèle sert notamment à la recherche sémantique, au RAG, à la classification, au clustering et à l’alignement de textes bilingues.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 5 novembre 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 596 millions |
| Paramètres actifs | 596 millions |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embeddings |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 55,5 % | 34ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 75,0 % | 14ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 75,4 % | 16ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: CoREB | 54,1 % | 15ᵉ / 19 | mteb | ✅ Mesuré |
| MTEB: Chinese | 66,4 % | 35ᵉ / 58 | mteb | ✅ Mesuré |
| MTEB: Russian | 64,3 % | 14ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: Thai | 63,5 % | 12ᵉ / 28 | mteb | ✅ Mesuré |
| MTEB: Scandinavian | 61,0 % | 16ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: Dutch | 54,3 % | 30ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 5,1 % | 13ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Code Information Retrieval
Notre analyse
Forces. Les résultats MTEB indiquent un positionnement multilingue solide, particulièrement en russe et en thaï, sur des ensembles combinant recherche, classification, clustering, reranking et comparaison de paires. Le chinois et les langues scandinaves élargissent cette couverture à plusieurs familles linguistiques. Le contexte de 32K facilite l’encodage de documents longs, tandis que les instructions personnalisées permettent d’adapter la représentation à la tâche. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des services commerciaux. Le réglage MRL constitue aussi un atout opérationnel : réduire la dimension peut alléger les index et accélérer la recherche.
Limites et points d'attention. Le positionnement MTEB apparaît moins favorable en chinois, où le modèle se situe dans la seconde moitié du classement, et plus intermédiaire sur le track Scandinavian. L’utilisation de vecteurs de 1024 dimensions augmente la taille des index, la mémoire nécessaire et le coût des recherches par rapport à une représentation réduite. Abaisser la dimension améliore l’efficacité, mais impose un arbitrage avec la richesse de la représentation. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, classification, clustering et rapprochement de textes bilingues.
Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).