MCINext/Hakim

MCINext/Hakim est un modèle d’embedding dense de 124 millions de paramètres, publié par MCINext le 10 mai 2025. Conçu pour le persan, il transforme les textes en vecteurs de 768 dimensions afin d’en représenter le sens.

MCINext/Hakim est un modèle d’embedding dense de 124 millions de paramètres, publié par MCINext le 10 mai 2025. Conçu pour le persan, il transforme les textes en vecteurs de 768 dimensions afin d’en représenter le sens.

Hakim cible notamment la recherche sémantique, la récupération de passages pour le RAG, la similarité et le clustering. Son API distingue plusieurs types de prompts, dont sentiment, classification, STS et retrieval, avec des embeddings séparés pour les requêtes et les passages lors de la recherche d’information.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMCINext
Poids🟢 Poids ouverts
Licencenot specified
Date de sortie10 mai 2025
Dimension du vecteur768
Représentationdense
Paramètres124 millions
Paramètres actifs124 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Farsi71,6 %4ᵉ / 30mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Farsi

▶ MCINext/Hakim72 %

Notre analyse

Forces. Hakim se classe dans le top 10 de MTEB Farsi, dont l’évaluation couvre la classification, le clustering et la classification de paires. Ce résultat le situe parmi les modèles performants de sa période pour la représentation sémantique du persan. Son adaptation repose sur des corpus persans, des paires non supervisées et des paires supervisées formulées par instructions. Les prompts spécialisés facilitent l’emploi d’un même modèle pour le sentiment, la classification, le clustering, la similarité sémantique et la recherche. La séparation entre requêtes et passages constitue un atout pratique pour construire un moteur de recherche ou une chaîne RAG.

Limites et points d'attention. Sorti il y a environ un an, Hakim appartient à une génération déjà ancienne à l’échelle de l’IA, susceptible d’avoir été dépassée par des modèles persans plus récents et à comparer aux offres encore maintenues. Sa spécialisation persane limite son intérêt lorsque les corpus couvrent d’autres langues. La représentation dense impose de stocker 768 valeurs par texte, avec un volume d’index et un coût de recherche qui augmentent avec la taille du corpus. Usages pertinents : recherche sémantique, RAG, classification, similarité et clustering de contenus persans.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).