Qwen: Qwen3 Embedding 0.6B

Qwen: Qwen3 Embedding 0.6B est un modèle d’embedding textuel dense publié par Qwen le 5 novembre 2025 sous licence ouverte Apache 2.0. Ses 596 millions de paramètres sont répartis sur 28 couches. Il accepte des séquences de 32K et produit par défaut des vecteurs de 1024 dimensions.

Qwen: Qwen3 Embedding 0.6B est un modèle d’embedding textuel dense publié par Qwen le 5 novembre 2025 sous licence ouverte Apache 2.0. Ses 596 millions de paramètres sont répartis sur 28 couches. Il accepte des séquences de 32K et produit par défaut des vecteurs de 1024 dimensions.

Fondé sur Qwen3, il couvre plus de 100 langues et prend en charge des instructions personnalisées. Le support MRL permet de régler la dimension des vecteurs entre 32 et 1024. Le modèle sert notamment à la recherche sémantique, au RAG, à la classification, au clustering et à l’alignement de textes bilingues.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie5 novembre 2025
Dimension du vecteur1 024
Représentationdense
Paramètres596 millions
Paramètres actifs596 millions
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embeddings

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR55,5 %34ᵉ / 192mteb✅ Mesuré
MTEB: Code Information Retrieval75,0 %14ᵉ / 49mteb✅ Mesuré
MTEB: Code75,4 %16ᵉ / 43mteb✅ Mesuré
MTEB: CoREB54,1 %15ᵉ / 19mteb✅ Mesuré
MTEB: Chinese66,4 %35ᵉ / 58mteb✅ Mesuré
MTEB: Russian64,3 %14ᵉ / 104mteb✅ Mesuré
MTEB: Thai63,5 %12ᵉ / 28mteb✅ Mesuré
MTEB: Scandinavian61,0 %16ᵉ / 48mteb✅ Mesuré
MTEB: Dutch54,3 %30ᵉ / 113mteb✅ Mesuré
MTEB: Instruction Following5,1 %13ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB indiquent un positionnement multilingue solide, particulièrement en russe et en thaï, sur des ensembles combinant recherche, classification, clustering, reranking et comparaison de paires. Le chinois et les langues scandinaves élargissent cette couverture à plusieurs familles linguistiques. Le contexte de 32K facilite l’encodage de documents longs, tandis que les instructions personnalisées permettent d’adapter la représentation à la tâche. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des services commerciaux. Le réglage MRL constitue aussi un atout opérationnel : réduire la dimension peut alléger les index et accélérer la recherche.

Limites et points d'attention. Le positionnement MTEB apparaît moins favorable en chinois, où le modèle se situe dans la seconde moitié du classement, et plus intermédiaire sur le track Scandinavian. L’utilisation de vecteurs de 1024 dimensions augmente la taille des index, la mémoire nécessaire et le coût des recherches par rapport à une représentation réduite. Abaisser la dimension améliore l’efficacité, mais impose un arbitrage avec la richesse de la représentation. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, classification, clustering et rapprochement de textes bilingues.


Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).