OrdalieTech/Solon-embeddings-mini-beta-1.1

OrdalieTech/Solon-embeddings-mini-beta-1.1 est un modèle d’embedding multilingue de 212 millions de paramètres, fondé sur EuroBERT-210m. Il transforme notamment des textes français et anglais en vecteurs denses de 768 dimensions. Publié par OrdalieTech sous licence ouverte Apache 2.0, il…

OrdalieTech/Solon-embeddings-mini-beta-1.1 est un modèle d’embedding multilingue de 212 millions de paramètres, fondé sur EuroBERT-210m. Il transforme notamment des textes français et anglais en vecteurs denses de 768 dimensions. Publié par OrdalieTech sous licence ouverte Apache 2.0, il peut être auto-hébergé et adapté.

Le modèle sert à indexer et rapprocher des contenus par leur sens, notamment pour la recherche sémantique, la récupération de passages dans un système RAG, le clustering, la similarité de phrases, la recommandation et la classification. Les vecteurs sont obtenus par moyenne des tokens, avec normalisation possible lors de l’encodage.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurOrdalieTech
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie1 janvier 2025
Dimension du vecteur768
Représentationdense
Paramètres212 millions
Paramètres actifs212 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: French56,3 %31ᵉ / 117mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Son résultat sur MTEB French le place dans la partie supérieure du classement évaluant la classification, le clustering et la comparaison de paires en français, sans atteindre les toutes premières positions. Son entraînement InfoNCE sur des paires produites par LLM vise directement le rapprochement de textes sémantiquement liés. La prise en charge du français et de l’anglais favorise les corpus multilingues, tandis que les représentations denses de 768 dimensions offrent un format standard pour les bases vectorielles. La licence Apache 2.0 facilite l’auto-hébergement, l’adaptation et les usages commerciaux.

Limites et points d’attention. Le classement MTEB French indique une qualité solide mais non dominante face aux autres modèles évalués. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, cette génération est probablement dépassée par des embeddings plus récents et peut ne plus figurer dans les catalogues actuels de l’éditeur. Ses 212 millions de paramètres impliquent aussi davantage de ressources qu’un modèle d’embedding plus petit, et des vecteurs de 768 dimensions déterminent directement le volume de l’index et le coût de la recherche. Usages pertinents : recherche sémantique bilingue, RAG en français ou en anglais, clustering, recommandation et classification fondée sur des embeddings.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).