MCINext/Hakim-unsup
Publié par MCINext le 10 mai 2025, Hakim-unsup est un modèle d'embedding dense de 124 millions de paramètres consacré au texte persan. Il transforme chaque texte en un vecteur flottant de 768 dimensions, sans générer de contenu.
Publié par MCINext le 10 mai 2025, Hakim-unsup est un modèle d'embedding dense de 124 millions de paramètres consacré au texte persan. Il transforme chaque texte en un vecteur flottant de 768 dimensions, sans générer de contenu.
Préentraîné sur de grands corpus persans, puis soumis à un apprentissage contrastif non supervisé sur des millions de paires de textes, il produit des représentations sémantiques généralistes. Il peut alimenter la recherche sémantique, la récupération de passages pour le RAG, la mesure de similarité, le classement et le clustering. Une API accepte des listes de textes et renvoie leurs embeddings.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | MCINext |
| Poids | 🟢 Poids ouverts |
| Licence | not specified |
| Date de sortie | 10 mai 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 124 millions |
| Paramètres actifs | 124 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Farsi | 63,8 % | 14ᵉ / 30 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Farsi
Notre analyse
Forces. Hakim-unsup cible explicitement les représentations sémantiques du persan. Son évaluation MTEB Farsi couvre la classification, le clustering et la classification de paires, ce qui le rend adapté au regroupement de contenus, à la détection de proximité sémantique et au rapprochement de textes. Son résultat le situe dans la moitié supérieure des modèles évalués, sans le placer parmi les tout premiers. Ses 768 dimensions constituent un format courant pour créer des index vectoriels de taille modérée. Ce checkpoint non supervisé peut aussi servir de base à un ajustement supervisé ou à un instruction tuning spécialisé.
Limites et points d'attention. Le classement MTEB Farsi, quatorzième sur trente, indique une qualité intermédiaire plutôt qu'une avance nette sur la classification, le clustering et la classification de paires en persan. La spécialisation persane limite son intérêt lorsque les corpus reposent sur d'autres langues. Avec environ un an d'ancienneté, durée très longue à l'échelle de l'IA, il doit être comparé aux modèles contemporains, souvent plus récents et susceptibles d'avoir remplacé les références de sa période. Usages pertinents : recherche sémantique en persan, RAG, similarité de textes, clustering et base d'un ajustement ultérieur.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).