microsoft/harrier-oss-v1-0.6b
Publié par Microsoft le 27 mars 2026 sous licence MIT, microsoft/harrier-oss-v1-0.6b est un modèle d’embedding multilingue de 596 millions de paramètres. Son architecture décodeur uniquement produit des vecteurs denses de 1 024 dimensions, avec pooling du dernier token non rembourré et…
Publié par Microsoft le 27 mars 2026 sous licence MIT, microsoft/harrier-oss-v1-0.6b est un modèle d’embedding multilingue de 596 millions de paramètres. Son architecture décodeur uniquement produit des vecteurs denses de 1 024 dimensions, avec pooling du dernier token non rembourré et normalisation L2. Il accepte des séquences allant jusqu’à 32 768 tokens.
Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, au clustering et à la mesure de similarité. Il couvre notamment le français, l’anglais, l’arabe, le chinois, le japonais, le coréen, l’hindi et plusieurs langues européennes. Il prend aussi en charge la classification, l’extraction de bitextes et le reranking.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Microsoft |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 27 mars 2026 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 596 millions |
| Paramètres actifs | 596 millions |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Japanese | 72,7 % | 7ᵉ / 20 | mteb | ✅ Mesuré |
| MTEB: Dutch | 59,4 % | 15ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 0,8 % | 39ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Japanese
MTEB: Dutch
Notre analyse
Forces. Les résultats MTEB placent microsoft/harrier-oss-v1-0.6b dans le top 10 en japonais pour un ensemble de tâches comprenant clustering, classification et similarité sémantique. Le modèle obtient également un classement solide en néerlandais, ce qui confirme son intérêt pour des traitements multilingues au-delà de l’anglais. Sa fenêtre de 32 768 tokens facilite l’encodage de documents longs. Les requêtes peuvent être guidées par une instruction en langage naturel, tandis que les documents ne nécessitent pas d’instruction. La licence MIT autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires, et l’entraînement inclut une distillation de connaissances.
Limites et points d’attention. Le track MTEB Instruction Following constitue son principal point faible, avec une qualité mesurée très basse malgré la prise en charge de requêtes guidées par instruction. Cette faiblesse invite à valider soigneusement les scénarios de retrieval reposant sur des consignes complexes. Les vecteurs de 1 024 dimensions entraînent aussi un coût de stockage et de calcul à prendre en compte pour les index volumineux. Les usages pertinents sont la recherche sémantique multilingue, le RAG sur documents longs, le clustering, la classification, la similarité, l’extraction de bitextes et le reranking.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).