PartAI/Tooka-SBERT-V2-Large
PartAI/Tooka-SBERT-V2-Large est un modèle d’embedding publié par PartAI le 1er mai 2025. Ses 353 millions de paramètres produisent des représentations denses de 1 024 dimensions à partir de phrases ou de paragraphes, afin de mesurer leur proximité sémantique.
PartAI/Tooka-SBERT-V2-Large est un modèle d’embedding publié par PartAI le 1er mai 2025. Ses 353 millions de paramètres produisent des représentations denses de 1 024 dimensions à partir de phrases ou de paragraphes, afin de mesurer leur proximité sémantique.
Ce modèle Sentence Transformers cible notamment la recherche sémantique, le RAG, la similarité et le clustering. Pour la recherche et le reranking, il distingue les requêtes des documents au moyen des préfixes persans « سوال: » et « متن: ». Il peut encoder directement les textes et calculer la similarité entre leurs embeddings.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | PartAI |
| Poids | 🟢 Poids ouverts |
| Licence | not specified |
| Date de sortie | 1 mai 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 353 millions |
| Paramètres actifs | 353 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Farsi | 63,3 % | 15ᵉ / 30 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Farsi
Notre analyse
Forces. PartAI/Tooka-SBERT-V2-Large propose une architecture adaptée à la recherche asymétrique, avec un format distinct pour les requêtes et les documents. Cette séparation est utile pour rapprocher une question d’un passage pertinent dans un moteur de recherche sémantique ou un pipeline RAG. Son évaluation MTEB Farsi couvre la classification, le clustering et la classification de paires, ce qui atteste une polyvalence sur plusieurs formes de comparaison sémantique en persan. La sortie dense de 1 024 dimensions fournit une représentation détaillée pour la similarité et le regroupement de contenus.
Limites et points d'attention. Son résultat MTEB Farsi le place au milieu du classement évalué, plutôt que parmi les références dominantes de ce benchmark. Les vecteurs de 1 024 dimensions alourdissent également les index et rendent le stockage ainsi que la recherche plus coûteux que pour des embeddings plus compacts. Avec environ un an d’ancienneté, ce modèle est déjà très ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : recherche sémantique en persan, RAG, calcul de similarité et clustering, après validation sur les données visées.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).