microsoft/harrier-oss-v1-270m
Publié par Microsoft le 27 mars 2026 sous licence ouverte MIT, microsoft/harrier-oss-v1-270m est un modèle d’embedding multilingue de 268 millions de paramètres, tous actifs. Son architecture décodeur uniquement produit des représentations denses de 640 dimensions à partir du dernier…
Publié par Microsoft le 27 mars 2026 sous licence ouverte MIT, microsoft/harrier-oss-v1-270m est un modèle d’embedding multilingue de 268 millions de paramètres, tous actifs. Son architecture décodeur uniquement produit des représentations denses de 640 dimensions à partir du dernier token non rembourré, puis applique une normalisation L2.
Le modèle transforme les textes en vecteurs destinés à la recherche sémantique, au RAG, au clustering, à la classification, à la similarité, à l’extraction de bitextes et au reranking. Il couvre notamment le français, l’anglais, l’arabe, le chinois, le japonais, le coréen, l’hindi, l’espagnol et l’allemand.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Microsoft |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 27 mars 2026 |
| Dimension du vecteur | 640 |
| Représentation | dense |
| Paramètres | 268 millions |
| Paramètres actifs | 268 millions |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Japanese | 69,3 % | 15ᵉ / 20 | mteb | ✅ Mesuré |
| MTEB: Dutch | 55,9 % | 25ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Japanese
MTEB: Dutch
Notre analyse
Forces. Les résultats MTEB montrent surtout un intérêt pour les traitements multilingues. Le modèle obtient un positionnement favorable sur le track Dutch et affiche une qualité notable en japonais, même si son rang y reste moins compétitif. Cette couverture s’étend à plusieurs grandes langues européennes et asiatiques, ce qui convient aux corpus multilingues et à la recherche interlingue. Les vecteurs denses de 640 dimensions offrent un compromis pratique pour contenir la taille des index et le coût de la recherche vectorielle. La licence MIT autorise par ailleurs l’auto-hébergement, la modification et l’intégration dans des applications commerciales.
Limites et points d'attention. Le track MTEB Instruction Following constitue le principal signal faible, avec une performance proche de zéro malgré un classement qui ne se situe pas en fin de tableau. Les requêtes doivent pourtant inclure une instruction en langage naturel décrivant la tâche, tandis que les documents sont encodés sans cette instruction, ce qui impose un formatage distinct dans les pipelines. Le rang obtenu en japonais invite aussi à distinguer score absolu et compétitivité face aux autres modèles évalués. Usages pertinents : recherche sémantique multilingue, RAG, clustering, classification, détection de similarité, extraction de bitextes et reranking auto-hébergés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).