OrdalieTech/Solon-embeddings-large-0.1
OrdalieTech/Solon-embeddings-large-0.1 est un modèle d’embedding dense publié par OrdalieTech le 9 décembre 2023 sous licence ouverte MIT. Ses 560 millions de paramètres, tous actifs, produisent des vecteurs de 1 024 dimensions. Conçu comme un modèle français, il affiche aussi des…
OrdalieTech/Solon-embeddings-large-0.1 est un modèle d’embedding dense publié par OrdalieTech le 9 décembre 2023 sous licence ouverte MIT. Ses 560 millions de paramètres, tous actifs, produisent des vecteurs de 1 024 dimensions. Conçu comme un modèle français, il affiche aussi des résultats MTEB dans plusieurs ensembles linguistiques européens et asiatiques.
Il transforme les textes en représentations numériques destinées à la recherche sémantique, à la sélection de passages pour le RAG, à la mesure de similarité et au clustering. Pour la recherche, les requêtes doivent être précédées de « query : », tandis que les passages ne nécessitent aucune instruction.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | OrdalieTech |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 9 décembre 2023 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 560 millions |
| Paramètres actifs | 560 millions |
| Longueur de séquence max | 514 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 47,3 % | 119ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 37,8 % | 86ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 42,8 % | 71ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 54,1 % | 38ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 53,7 % | 37ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 59,4 % | 21ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 41,4 % | 67ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 48,2 % | 59ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 68,4 % | 10ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Korean | 68,3 % | 12ᵉ / 102 | mteb | ✅ Mesuré |
| MTEB: Russian | 60,3 % | 25ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: French | 57,0 % | 28ᵉ / 117 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le principal point fort de Solon-embeddings-large-0.1 réside dans son comportement multilingue. Il figure dans le top 10 du track MTEB Indic et obtient également un classement élevé en coréen, sur des tâches comprenant classification, reranking, retrieval et bitext mining. Les résultats européens, français et néerlandais montrent une aptitude plus générale à rapprocher, classer et regrouper des textes dans plusieurs langues. Les évaluations françaises couvrent notamment la similarité textuelle, la classification, le reranking et STS. La licence MIT facilite l’auto-hébergement et l’intégration dans des applications commerciales ou ouvertes.
Limites et points d’attention. Les résultats MTEB sont moins bien classés en russe, en français et dans l’ensemble European que sur les tracks Indic et Korean, ce qui suggère une qualité variable selon la langue et la tâche. Les vecteurs de 1 024 dimensions augmentent les besoins de stockage des index et le coût des recherches par rapport à des représentations moins dimensionnées. Avec environ trois ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle appartient à une génération probablement dépassée par des embeddings plus récents et susceptible de ne plus occuper une place centrale dans le catalogue de son éditeur. Usages pertinents : recherche sémantique multilingue, RAG en français, similarité et clustering de corpus.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).