sergeyzh/BERTA

Publié par sergeyzh le 10 mars 2025, sergeyzh/BERTA est un modèle d’embedding dense de 128 millions de paramètres sous licence ouverte MIT. Il transforme des textes russes et anglais en vecteurs de 768 dimensions, avec une longueur de séquence maximale de 512 tokens.

Publié par sergeyzh le 10 mars 2025, sergeyzh/BERTA est un modèle d’embedding dense de 128 millions de paramètres sous licence ouverte MIT. Il transforme des textes russes et anglais en vecteurs de 768 dimensions, avec une longueur de séquence maximale de 512 tokens.

BERTA résulte de la distillation des embeddings de ai-forever/FRIDA vers sergeyzh/LaBSE-ru-turbo et applique un mean pooling. Ses vecteurs servent à la recherche sémantique, à la sélection de passages pour le RAG, au rapprochement de paraphrases et au clustering. Des préfixes spécialisés distinguent notamment requêtes, documents et tâches de catégorisation.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeursergeyzh
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie10 mars 2025
Dimension du vecteur768
Représentationdense
Paramètres128 millions
Paramètres actifs128 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Russian69,4 %8ᵉ / 104mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. BERTA se classe dans le top 10 de MTEB: Russian, ce qui le situe parmi les modèles performants de sa période pour la représentation de textes russes. Le benchmark couvre plusieurs familles de tâches, dont la classification, le clustering et le reranking, adaptées au classement de résultats, au regroupement thématique et à la comparaison sémantique. La prise en charge du russe et de l’anglais facilite les corpus bilingues. Les préfixes search_query:, search_document:, paraphrase:, categorize: et categorize_entailment: permettent d’adapter l’encodage au rôle du texte. La licence MIT autorise l’auto-hébergement et l’intégration commerciale, tandis que la compatibilité avec transformers et sentence_transformers simplifie le déploiement.

Limites et points d'attention. Une séquence de 512 tokens impose de découper les documents longs avant indexation, avec un risque de fragmenter leur contexte. Les vecteurs de 768 dimensions alourdissent davantage le stockage et le calcul de similarité que des représentations plus petites. À près d’un an, BERTA appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et comparable à des références souvent retirées des catalogues. Usages pertinents : recherche sémantique russe ou bilingue, RAG sur passages courts, reranking, détection de paraphrases et clustering thématique.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).