microsoft/harrier-oss-v1-0.6b

Publié par Microsoft le 27 mars 2026 sous licence MIT, microsoft/harrier-oss-v1-0.6b est un modèle d’embedding multilingue de 596 millions de paramètres. Son architecture décodeur uniquement produit des vecteurs denses de 1 024 dimensions, avec pooling du dernier token non rembourré et…

Publié par Microsoft le 27 mars 2026 sous licence MIT, microsoft/harrier-oss-v1-0.6b est un modèle d’embedding multilingue de 596 millions de paramètres. Son architecture décodeur uniquement produit des vecteurs denses de 1 024 dimensions, avec pooling du dernier token non rembourré et normalisation L2. Il accepte des séquences allant jusqu’à 32 768 tokens.

Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, au clustering et à la mesure de similarité. Il couvre notamment le français, l’anglais, l’arabe, le chinois, le japonais, le coréen, l’hindi et plusieurs langues européennes. Il prend aussi en charge la classification, l’extraction de bitextes et le reranking.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMicrosoft
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie27 mars 2026
Dimension du vecteur1 024
Représentationdense
Paramètres596 millions
Paramètres actifs596 millions
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Japanese72,7 %7ᵉ / 20mteb✅ Mesuré
MTEB: Dutch59,4 %15ᵉ / 113mteb✅ Mesuré
MTEB: Instruction Following0,8 %39ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB placent microsoft/harrier-oss-v1-0.6b dans le top 10 en japonais pour un ensemble de tâches comprenant clustering, classification et similarité sémantique. Le modèle obtient également un classement solide en néerlandais, ce qui confirme son intérêt pour des traitements multilingues au-delà de l’anglais. Sa fenêtre de 32 768 tokens facilite l’encodage de documents longs. Les requêtes peuvent être guidées par une instruction en langage naturel, tandis que les documents ne nécessitent pas d’instruction. La licence MIT autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires, et l’entraînement inclut une distillation de connaissances.

Limites et points d’attention. Le track MTEB Instruction Following constitue son principal point faible, avec une qualité mesurée très basse malgré la prise en charge de requêtes guidées par instruction. Cette faiblesse invite à valider soigneusement les scénarios de retrieval reposant sur des consignes complexes. Les vecteurs de 1 024 dimensions entraînent aussi un coût de stockage et de calcul à prendre en compte pour les index volumineux. Les usages pertinents sont la recherche sémantique multilingue, le RAG sur documents longs, le clustering, la classification, la similarité, l’extraction de bitextes et le reranking.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).