ai-forever/ru-en-RoSBERTa

Publié par ai-forever le 29 juillet 2024, ru-en-RoSBERTa est un modèle d’embedding de 404 millions de paramètres, fondé sur ruRoBERTa et destiné principalement aux textes russes. Il produit une représentation dense unique de 1 024 dimensions, avec pooling CLS recommandé, et accepte…

Publié par ai-forever le 29 juillet 2024, ru-en-RoSBERTa est un modèle d’embedding de 404 millions de paramètres, fondé sur ruRoBERTa et destiné principalement aux textes russes. Il produit une représentation dense unique de 1 024 dimensions, avec pooling CLS recommandé, et accepte jusqu’à 512 tokens.

Affiné sur environ quatre millions de paires russes et anglaises, il transforme les textes en vecteurs pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Des préfixes distinguent la recherche requête-document, les tâches symétriques de paraphrase et les caractéristiques thématiques. Sa licence MIT autorise l’auto-hébergement et les usages commerciaux.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurai-forever
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie29 juillet 2024
Dimension du vecteur1 024
Représentationdense à vecteur unique, avec pooling CLS recommandé ou pooling moyen
Paramètres404 millions
Paramètres actifs404 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR39,3 %140ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval31,7 %116ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal24,9 %173ᵉ / 208mteb✅ Mesuré
MTEB: Medical30,7 %113ᵉ / 158mteb✅ Mesuré
MTEB: Legal32,6 %126ᵉ / 157mteb✅ Mesuré
MTEB: European42,0 %108ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French4,9 %178ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German7,0 %187ᵉ / 209mteb✅ Mesuré
MTEB: Russian61,8 %21ᵉ / 104mteb✅ Mesuré
MTEB: French39,1 %100ᵉ / 117mteb✅ Mesuré
MTEB: Dutch32,4 %94ᵉ / 113mteb✅ Mesuré
MTEB: German32,0 %79ᵉ / 96mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

brahmairesearch/slx-v0.142 %
▶ ai-forever/ru-en-RoSBER…39 %

MTEB: Long-context Retrieval

▶ ai-forever/ru-en-RoSBER…32 %

Notre analyse

Forces. Le track MTEB Russian constitue son principal point fort : son classement y est nettement meilleur que sur les autres évaluations, ce qui confirme son intérêt pour la classification, le clustering, le reranking et l’appariement de textes russes. Les préfixes spécialisés permettent d’adapter les embeddings aux tâches asymétriques de recherche ou aux comparaisons symétriques. Le pooling CLS recommandé simplifie la production d’un vecteur unique, tandis que le pooling moyen et la normalisation L2 offrent d’autres options d’indexation. La licence MIT facilite le déploiement local et l’intégration dans des systèmes propriétaires.

Limites et points d’attention. Les résultats sont faibles sur MTEB European, French et Dutch, ainsi que sur BEIR pour la recherche zero-shot hétérogène. Le track MTEB Legal place aussi le modèle dans le bas du classement, ce qui limite son intérêt pour la recherche juridique spécialisée. Les vecteurs de 1 024 dimensions alourdissent l’index et augmentent le coût de la recherche par rapport à des représentations plus compactes. La limite de 512 tokens impose de segmenter les documents longs. Avec environ deux ans d’ancienneté, durée importante à l’échelle de l’IA, ce modèle est probablement dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique, RAG, similarité et clustering centrés sur le russe.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).