MCINext/Hakim-unsup

Publié par MCINext le 10 mai 2025, Hakim-unsup est un modèle d'embedding dense de 124 millions de paramètres consacré au texte persan. Il transforme chaque texte en un vecteur flottant de 768 dimensions, sans générer de contenu.

Publié par MCINext le 10 mai 2025, Hakim-unsup est un modèle d'embedding dense de 124 millions de paramètres consacré au texte persan. Il transforme chaque texte en un vecteur flottant de 768 dimensions, sans générer de contenu.

Préentraîné sur de grands corpus persans, puis soumis à un apprentissage contrastif non supervisé sur des millions de paires de textes, il produit des représentations sémantiques généralistes. Il peut alimenter la recherche sémantique, la récupération de passages pour le RAG, la mesure de similarité, le classement et le clustering. Une API accepte des listes de textes et renvoie leurs embeddings.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMCINext
Poids🟢 Poids ouverts
Licencenot specified
Date de sortie10 mai 2025
Dimension du vecteur768
Représentationdense
Paramètres124 millions
Paramètres actifs124 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Farsi63,8 %14ᵉ / 30mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Hakim-unsup cible explicitement les représentations sémantiques du persan. Son évaluation MTEB Farsi couvre la classification, le clustering et la classification de paires, ce qui le rend adapté au regroupement de contenus, à la détection de proximité sémantique et au rapprochement de textes. Son résultat le situe dans la moitié supérieure des modèles évalués, sans le placer parmi les tout premiers. Ses 768 dimensions constituent un format courant pour créer des index vectoriels de taille modérée. Ce checkpoint non supervisé peut aussi servir de base à un ajustement supervisé ou à un instruction tuning spécialisé.

Limites et points d'attention. Le classement MTEB Farsi, quatorzième sur trente, indique une qualité intermédiaire plutôt qu'une avance nette sur la classification, le clustering et la classification de paires en persan. La spécialisation persane limite son intérêt lorsque les corpus reposent sur d'autres langues. Avec environ un an d'ancienneté, durée très longue à l'échelle de l'IA, il doit être comparé aux modèles contemporains, souvent plus récents et susceptibles d'avoir remplacé les références de sa période. Usages pertinents : recherche sémantique en persan, RAG, similarité de textes, clustering et base d'un ajustement ultérieur.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).