PartAI/TookaBERT-Base
PartAI/TookaBERT-Base est un modèle d’embedding dense de PartAI, publié le 8 décembre 2024 sous licence ouverte Apache 2.0. Ses 123 millions de paramètres produisent des vecteurs de 768 dimensions. L’encodeur a été préentraîné sur plus de 500 Go de textes en persan, notamment des…
PartAI/TookaBERT-Base est un modèle d’embedding dense de PartAI, publié le 8 décembre 2024 sous licence ouverte Apache 2.0. Ses 123 millions de paramètres produisent des vecteurs de 768 dimensions. L’encodeur a été préentraîné sur plus de 500 Go de textes en persan, notamment des actualités, blogs, forums et livres.
Il transforme les textes en représentations numériques destinées à la recherche sémantique, à l’indexation pour le RAG, au calcul de similarité et au clustering. Son préentraînement repose sur la modélisation de langage masqué, avec masquage de mots entiers et deux longueurs de contexte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | PartAI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 8 décembre 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 123 millions |
| Paramètres actifs | 123 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Farsi | 46,5 % | 25ᵉ / 30 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Farsi
Notre analyse
Forces. TookaBERT-Base se distingue par sa spécialisation dans le persan et par la diversité des contenus employés lors du préentraînement. Cette base linguistique couvre plusieurs registres, des actualités aux forums et aux livres. Son architecture d’encodeur peut aussi être affinée pour l’analyse de sentiments, la classification de textes, les questions à choix multiple, les questions-réponses et la reconnaissance d’entités nommées. La licence Apache 2.0 autorise l’auto-hébergement, la modification et l’intégration commerciale. Les vecteurs denses de 768 dimensions offrent une représentation standardisée pour constituer des index sémantiques.
Limites et points d'attention. Sur MTEB Farsi, qui regroupe notamment classification, clustering et pair classification, le modèle se place dans le bas du classement. Sa qualité d’embedding persan apparaît donc en retrait face à la majorité des modèles évalués. Les vecteurs de 768 dimensions alourdissent davantage le stockage et les calculs de similarité que des représentations plus petites. Avec près de deux ans d’ancienneté, TookaBERT-Base appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles persans plus récents. Usages pertinents : prototypes auto-hébergés, recherche sémantique en persan, clustering et RAG lorsque la licence ouverte prime sur le meilleur niveau de performance disponible.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).