PartAI/Tooka-SBERT-V2-Small

Publié par PartAI le 1er mai 2025, PartAI/Tooka-SBERT-V2-Small est un modèle d’embedding Sentence Transformers de 123 millions de paramètres actifs. Il transforme phrases et paragraphes en représentations denses de 768 dimensions, adaptées à la comparaison de proximité sémantique.

Publié par PartAI le 1er mai 2025, PartAI/Tooka-SBERT-V2-Small est un modèle d’embedding Sentence Transformers de 123 millions de paramètres actifs. Il transforme phrases et paragraphes en représentations denses de 768 dimensions, adaptées à la comparaison de proximité sémantique.

Préentraîné sur Targoman News puis affiné sur plusieurs jeux de données synthétiques, il présente une orientation marquée vers le persan. Il sert notamment à la recherche sémantique, au RAG, au clustering et au classement de documents. À l’échelle de l’IA, son ancienneté d’environ un an le place déjà derrière des générations plus récentes.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurPartAI
Poids🟢 Poids ouverts
Licencenot specified
Date de sortie1 mai 2025
Dimension du vecteur768
Représentationdense
Paramètres123 millions
Paramètres actifs123 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Farsi62,0 %18ᵉ / 30mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. PartAI/Tooka-SBERT-V2-Small est spécialisé dans la projection de textes en persan au sein d’un espace vectoriel dense. Son évaluation MTEB: Farsi couvre la classification, le clustering et la classification de paires, ce qui indique une polyvalence sur plusieurs formes de comparaison sémantique. Pour la recherche asymétrique et le reranking, le modèle distingue explicitement les rôles grâce au préfixe « سوال: » pour les requêtes et « متن: » pour les documents. Cette convention facilite la construction de pipelines où une question courte doit être rapprochée de passages plus informatifs.

Limites et points d'attention. Son classement MTEB: Farsi, au 18e rang sur 30, le situe dans la seconde moitié du panel plutôt que parmi les références de cette évaluation. Les vecteurs de 768 dimensions impliquent aussi un index plus volumineux et davantage de calcul de similarité que des représentations de dimension inférieure. Sorti en mai 2025, il est ancien à l’échelle rapide du secteur et probablement dépassé par des modèles plus récents, voire retiré des catalogues actuels. Usages pertinents : recherche sémantique en persan, RAG, similarité de textes, clustering et reranking asymétrique.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).