PartAI/TookaBERT-Base

PartAI/TookaBERT-Base est un modèle d’embedding dense de PartAI, publié le 8 décembre 2024 sous licence ouverte Apache 2.0. Ses 123 millions de paramètres produisent des vecteurs de 768 dimensions. L’encodeur a été préentraîné sur plus de 500 Go de textes en persan, notamment des…

PartAI/TookaBERT-Base est un modèle d’embedding dense de PartAI, publié le 8 décembre 2024 sous licence ouverte Apache 2.0. Ses 123 millions de paramètres produisent des vecteurs de 768 dimensions. L’encodeur a été préentraîné sur plus de 500 Go de textes en persan, notamment des actualités, blogs, forums et livres.

Il transforme les textes en représentations numériques destinées à la recherche sémantique, à l’indexation pour le RAG, au calcul de similarité et au clustering. Son préentraînement repose sur la modélisation de langage masqué, avec masquage de mots entiers et deux longueurs de contexte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurPartAI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie8 décembre 2024
Dimension du vecteur768
Représentationdense
Paramètres123 millions
Paramètres actifs123 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Farsi46,5 %25ᵉ / 30mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Farsi

▶ PartAI/TookaBERT-Base47 %
sbunlp/fabert46 %

Notre analyse

Forces. TookaBERT-Base se distingue par sa spécialisation dans le persan et par la diversité des contenus employés lors du préentraînement. Cette base linguistique couvre plusieurs registres, des actualités aux forums et aux livres. Son architecture d’encodeur peut aussi être affinée pour l’analyse de sentiments, la classification de textes, les questions à choix multiple, les questions-réponses et la reconnaissance d’entités nommées. La licence Apache 2.0 autorise l’auto-hébergement, la modification et l’intégration commerciale. Les vecteurs denses de 768 dimensions offrent une représentation standardisée pour constituer des index sémantiques.

Limites et points d'attention. Sur MTEB Farsi, qui regroupe notamment classification, clustering et pair classification, le modèle se place dans le bas du classement. Sa qualité d’embedding persan apparaît donc en retrait face à la majorité des modèles évalués. Les vecteurs de 768 dimensions alourdissent davantage le stockage et les calculs de similarité que des représentations plus petites. Avec près de deux ans d’ancienneté, TookaBERT-Base appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles persans plus récents. Usages pertinents : prototypes auto-hébergés, recherche sémantique en persan, clustering et RAG lorsque la licence ouverte prime sur le meilleur niveau de performance disponible.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).