PartAI/Tooka-SBERT-V2-Small
Publié par PartAI le 1er mai 2025, PartAI/Tooka-SBERT-V2-Small est un modèle d’embedding Sentence Transformers de 123 millions de paramètres actifs. Il transforme phrases et paragraphes en représentations denses de 768 dimensions, adaptées à la comparaison de proximité sémantique.
Publié par PartAI le 1er mai 2025, PartAI/Tooka-SBERT-V2-Small est un modèle d’embedding Sentence Transformers de 123 millions de paramètres actifs. Il transforme phrases et paragraphes en représentations denses de 768 dimensions, adaptées à la comparaison de proximité sémantique.
Préentraîné sur Targoman News puis affiné sur plusieurs jeux de données synthétiques, il présente une orientation marquée vers le persan. Il sert notamment à la recherche sémantique, au RAG, au clustering et au classement de documents. À l’échelle de l’IA, son ancienneté d’environ un an le place déjà derrière des générations plus récentes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | PartAI |
| Poids | 🟢 Poids ouverts |
| Licence | not specified |
| Date de sortie | 1 mai 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 123 millions |
| Paramètres actifs | 123 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Farsi | 62,0 % | 18ᵉ / 30 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Farsi
Notre analyse
Forces. PartAI/Tooka-SBERT-V2-Small est spécialisé dans la projection de textes en persan au sein d’un espace vectoriel dense. Son évaluation MTEB: Farsi couvre la classification, le clustering et la classification de paires, ce qui indique une polyvalence sur plusieurs formes de comparaison sémantique. Pour la recherche asymétrique et le reranking, le modèle distingue explicitement les rôles grâce au préfixe « سوال: » pour les requêtes et « متن: » pour les documents. Cette convention facilite la construction de pipelines où une question courte doit être rapprochée de passages plus informatifs.
Limites et points d'attention. Son classement MTEB: Farsi, au 18e rang sur 30, le situe dans la seconde moitié du panel plutôt que parmi les références de cette évaluation. Les vecteurs de 768 dimensions impliquent aussi un index plus volumineux et davantage de calcul de similarité que des représentations de dimension inférieure. Sorti en mai 2025, il est ancien à l’échelle rapide du secteur et probablement dépassé par des modèles plus récents, voire retiré des catalogues actuels. Usages pertinents : recherche sémantique en persan, RAG, similarité de textes, clustering et reranking asymétrique.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).