MCINext/Hakim-small

Publié par MCINext le 10 mai 2025, MCINext/Hakim-small est un modèle dense d’embedding de 39 millions de paramètres, tous actifs. Spécialisé dans le persan, il transforme les textes en vecteurs de 512 dimensions.

Publié par MCINext le 10 mai 2025, MCINext/Hakim-small est un modèle dense d’embedding de 39 millions de paramètres, tous actifs. Spécialisé dans le persan, il transforme les textes en vecteurs de 512 dimensions.

Son ajustement par instructions couvre la classification, le clustering, la similarité sémantique, la recherche, les questions-réponses et l’inférence en langage naturel. Il vise notamment la recherche sémantique et dense, les systèmes RAG et le traitement d’échanges tenant compte de l’historique conversationnel.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMCINext
Poids🟢 Poids ouverts
Licencenot specified
Date de sortie10 mai 2025
Dimension du vecteur512
Représentationdense
Paramètres39 millions
Paramètres actifs39 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Farsi68,5 %6ᵉ / 30mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Farsi

▶ MCINext/Hakim-small69 %

Notre analyse

Forces. MCINext/Hakim-small se classe dans le top 10 de MTEB: Farsi, une évaluation couvrant la classification, le clustering et la comparaison de paires de textes en persan. Ce positionnement en fait une option solide pour organiser des corpus persanophones, rapprocher des contenus sémantiquement voisins et retrouver des passages pertinents. Ses 39 millions de paramètres en font un modèle compact, tandis que ses vecteurs de 512 dimensions permettent des index plus légers que ceux produits par des embeddings de plus grande dimension. L’ajustement intégrant l’historique conversationnel peut aussi servir la recherche dans des échanges successifs.

Limites et points d'attention. Sa spécialisation porte sur le persan, ce qui circonscrit son intérêt face aux modèles conçus pour une couverture multilingue étendue. Les résultats MTEB disponibles établissent surtout sa qualité sur la classification, le clustering et la comparaison de paires, sans justifier un avantage équivalent sur tous les scénarios de recherche dense ou de RAG. Avec près d’un an d’ancienneté, il appartient déjà à une génération relativement ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : recherche sémantique, RAG, similarité et clustering de contenus en persan.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).