PartAI/Tooka-SBERT-V2-Large

PartAI/Tooka-SBERT-V2-Large est un modèle d’embedding publié par PartAI le 1er mai 2025. Ses 353 millions de paramètres produisent des représentations denses de 1 024 dimensions à partir de phrases ou de paragraphes, afin de mesurer leur proximité sémantique.

PartAI/Tooka-SBERT-V2-Large est un modèle d’embedding publié par PartAI le 1er mai 2025. Ses 353 millions de paramètres produisent des représentations denses de 1 024 dimensions à partir de phrases ou de paragraphes, afin de mesurer leur proximité sémantique.

Ce modèle Sentence Transformers cible notamment la recherche sémantique, le RAG, la similarité et le clustering. Pour la recherche et le reranking, il distingue les requêtes des documents au moyen des préfixes persans « سوال: » et « متن: ». Il peut encoder directement les textes et calculer la similarité entre leurs embeddings.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurPartAI
Poids🟢 Poids ouverts
Licencenot specified
Date de sortie1 mai 2025
Dimension du vecteur1 024
Représentationdense
Paramètres353 millions
Paramètres actifs353 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Farsi63,3 %15ᵉ / 30mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. PartAI/Tooka-SBERT-V2-Large propose une architecture adaptée à la recherche asymétrique, avec un format distinct pour les requêtes et les documents. Cette séparation est utile pour rapprocher une question d’un passage pertinent dans un moteur de recherche sémantique ou un pipeline RAG. Son évaluation MTEB Farsi couvre la classification, le clustering et la classification de paires, ce qui atteste une polyvalence sur plusieurs formes de comparaison sémantique en persan. La sortie dense de 1 024 dimensions fournit une représentation détaillée pour la similarité et le regroupement de contenus.

Limites et points d'attention. Son résultat MTEB Farsi le place au milieu du classement évalué, plutôt que parmi les références dominantes de ce benchmark. Les vecteurs de 1 024 dimensions alourdissent également les index et rendent le stockage ainsi que la recherche plus coûteux que pour des embeddings plus compacts. Avec environ un an d’ancienneté, ce modèle est déjà très ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : recherche sémantique en persan, RAG, calcul de similarité et clustering, après validation sur les données visées.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).