PartAI/Tooka-SBERT
PartAI/Tooka-SBERT est un modèle d’embedding publié par PartAI le 7 décembre 2024. Fondé sur TookaBERT-Large et spécialisé dans le persan, il compte 353 millions de paramètres, tous actifs. Il produit des représentations denses de 1024 dimensions à partir de séquences atteignant 512…
PartAI/Tooka-SBERT est un modèle d’embedding publié par PartAI le 7 décembre 2024. Fondé sur TookaBERT-Large et spécialisé dans le persan, il compte 353 millions de paramètres, tous actifs. Il produit des représentations denses de 1024 dimensions à partir de séquences atteignant 512 tokens.
Le modèle rapproche les phrases et paragraphes selon leur similarité cosinus. Il sert notamment à la recherche sémantique, à la récupération de passages pour un système RAG, à la détection de paraphrases, à la classification et au clustering. Sa licence ouverte Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | PartAI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 7 décembre 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 353 millions |
| Paramètres actifs | 353 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Farsi | 59,3 % | 21ᵉ / 30 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Farsi
Notre analyse
Forces. Sa spécialisation dans le persan constitue son principal intérêt pour l’indexation et la comparaison de contenus dans cette langue. Son évaluation MTEB Farsi couvre la classification, le clustering et la classification de paires, ce qui confirme son orientation vers plusieurs formes de similarité sémantique. La limite de 512 tokens permet d’encoder des paragraphes et des passages relativement développés. La licence Apache 2.0 facilite par ailleurs le déploiement local, la modification et l’exploitation commerciale.
Limites et points d’attention. Son résultat MTEB Farsi le place dans la partie basse du classement évalué, ce qui réduit son attrait face aux meilleures solutions persanophones de cette évaluation. Les vecteurs de 1024 dimensions peuvent aussi produire des index plus volumineux et rendre la recherche plus coûteuse que des représentations plus compactes. Sorti fin 2024, il appartient désormais à une génération ancienne à l’échelle rapide de l’IA et peut avoir été dépassé, voire retiré des catalogues actuels de l’éditeur. Usages pertinents : recherche sémantique en persan, RAG, paraphrases, classification et clustering avec possibilité d’auto-hébergement.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).