microsoft/harrier-oss-v1-270m

Publié par Microsoft le 27 mars 2026 sous licence ouverte MIT, microsoft/harrier-oss-v1-270m est un modèle d’embedding multilingue de 268 millions de paramètres, tous actifs. Son architecture décodeur uniquement produit des représentations denses de 640 dimensions à partir du dernier…

Publié par Microsoft le 27 mars 2026 sous licence ouverte MIT, microsoft/harrier-oss-v1-270m est un modèle d’embedding multilingue de 268 millions de paramètres, tous actifs. Son architecture décodeur uniquement produit des représentations denses de 640 dimensions à partir du dernier token non rembourré, puis applique une normalisation L2.

Le modèle transforme les textes en vecteurs destinés à la recherche sémantique, au RAG, au clustering, à la classification, à la similarité, à l’extraction de bitextes et au reranking. Il couvre notamment le français, l’anglais, l’arabe, le chinois, le japonais, le coréen, l’hindi, l’espagnol et l’allemand.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMicrosoft
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie27 mars 2026
Dimension du vecteur640
Représentationdense
Paramètres268 millions
Paramètres actifs268 millions
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Japanese69,3 %15ᵉ / 20mteb✅ Mesuré
MTEB: Dutch55,9 %25ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB montrent surtout un intérêt pour les traitements multilingues. Le modèle obtient un positionnement favorable sur le track Dutch et affiche une qualité notable en japonais, même si son rang y reste moins compétitif. Cette couverture s’étend à plusieurs grandes langues européennes et asiatiques, ce qui convient aux corpus multilingues et à la recherche interlingue. Les vecteurs denses de 640 dimensions offrent un compromis pratique pour contenir la taille des index et le coût de la recherche vectorielle. La licence MIT autorise par ailleurs l’auto-hébergement, la modification et l’intégration dans des applications commerciales.

Limites et points d'attention. Le track MTEB Instruction Following constitue le principal signal faible, avec une performance proche de zéro malgré un classement qui ne se situe pas en fin de tableau. Les requêtes doivent pourtant inclure une instruction en langage naturel décrivant la tâche, tandis que les documents sont encodés sans cette instruction, ce qui impose un formatage distinct dans les pipelines. Le rang obtenu en japonais invite aussi à distinguer score absolu et compétitivité face aux autres modèles évalués. Usages pertinents : recherche sémantique multilingue, RAG, clustering, classification, détection de similarité, extraction de bitextes et reranking auto-hébergés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).