MCINext/Hakim
MCINext/Hakim est un modèle d’embedding dense de 124 millions de paramètres, publié par MCINext le 10 mai 2025. Conçu pour le persan, il transforme les textes en vecteurs de 768 dimensions afin d’en représenter le sens.
MCINext/Hakim est un modèle d’embedding dense de 124 millions de paramètres, publié par MCINext le 10 mai 2025. Conçu pour le persan, il transforme les textes en vecteurs de 768 dimensions afin d’en représenter le sens.
Hakim cible notamment la recherche sémantique, la récupération de passages pour le RAG, la similarité et le clustering. Son API distingue plusieurs types de prompts, dont sentiment, classification, STS et retrieval, avec des embeddings séparés pour les requêtes et les passages lors de la recherche d’information.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | MCINext |
| Poids | 🟢 Poids ouverts |
| Licence | not specified |
| Date de sortie | 10 mai 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 124 millions |
| Paramètres actifs | 124 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Farsi | 71,6 % | 4ᵉ / 30 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Farsi
Notre analyse
Forces. Hakim se classe dans le top 10 de MTEB Farsi, dont l’évaluation couvre la classification, le clustering et la classification de paires. Ce résultat le situe parmi les modèles performants de sa période pour la représentation sémantique du persan. Son adaptation repose sur des corpus persans, des paires non supervisées et des paires supervisées formulées par instructions. Les prompts spécialisés facilitent l’emploi d’un même modèle pour le sentiment, la classification, le clustering, la similarité sémantique et la recherche. La séparation entre requêtes et passages constitue un atout pratique pour construire un moteur de recherche ou une chaîne RAG.
Limites et points d'attention. Sorti il y a environ un an, Hakim appartient à une génération déjà ancienne à l’échelle de l’IA, susceptible d’avoir été dépassée par des modèles persans plus récents et à comparer aux offres encore maintenues. Sa spécialisation persane limite son intérêt lorsque les corpus couvrent d’autres langues. La représentation dense impose de stocker 768 valeurs par texte, avec un volume d’index et un coût de recherche qui augmentent avec la taille du corpus. Usages pertinents : recherche sémantique, RAG, classification, similarité et clustering de contenus persans.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).