Mira190/Euler-Legal-Embedding-V1

Publié par Mira190 le 6 novembre 2025 sous licence ouverte Apache 2.0, Mira190/Euler-Legal-Embedding-V1 est un modèle d’embedding juridique de 8 milliards de paramètres, affiné à partir de Qwen3-Embedding-8B. Il produit des vecteurs denses de 4 096 dimensions à partir de séquences…

Publié par Mira190 le 6 novembre 2025 sous licence ouverte Apache 2.0, Mira190/Euler-Legal-Embedding-V1 est un modèle d’embedding juridique de 8 milliards de paramètres, affiné à partir de Qwen3-Embedding-8B. Il produit des vecteurs denses de 4 096 dimensions à partir de séquences pouvant atteindre 1 536 tokens.

Son évaluation couvre notamment l’anglais, l’allemand et le néerlandais. Le modèle sert à indexer des textes pour la recherche sémantique, le RAG, la mesure de similarité et le clustering, en particulier sur des corpus juridiques. Il fonctionne avec sentence-transformers ou transformers, applique un pooling sur le dernier token et normalise les embeddings, sans prompt spécifique.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMira190
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie6 novembre 2025
Dimension du vecteur4 096
Représentationvecteur dense
Paramètres8 milliards
Paramètres actifs8 milliards
Longueur de séquence max1 536 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal66,7 %10ᵉ / 208mteb✅ Mesuré
MTEB: Legal70,4 %1ᵉ / 157mteb✅ Mesuré
MTEB: RTEB German64,8 %29ᵉ / 209mteb✅ Mesuré
MTEB: Dutch58,4 %17ᵉ / 113mteb✅ Mesuré
MTEB: Instruction Following7,4 %6ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Legal

▶ Mira190/Euler-Legal-Emb…70 %
Hanno-Labs/dinghy-law-0…66 %

MTEB: RTEB Legal

▶ Mira190/Euler-Legal-Emb…67 %
nvidia/Nemotron-3-Embed…65 %

Notre analyse

Forces. Mira190/Euler-Legal-Embedding-V1 se distingue surtout en recherche documentaire juridique. Il occupe la première place du track MTEB Legal et figure aussi dans le top 10 de RTEB Legal, ce qui indique une forte aptitude à rapprocher requêtes, décisions de justice, textes législatifs et contenus de questions-réponses juridiques. Les résultats en allemand couvrent également des corpus juridiques, médicaux et professionnels, tandis que le track Dutch confirme une capacité multilingue au-delà de l’anglais. Son classement dans le top 10 en Instruction Following montre aussi une bonne position relative pour la recherche guidée par des consignes. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des services commerciaux.

Limites et points d'attention. Les performances relatives sont moins dominantes en allemand et en néerlandais que sur le juridique, avec des classements hors du top 10. Le score absolu du track Instruction Following reste faible malgré un rang favorable. Les vecteurs de 4 096 dimensions alourdissent les index, la mémoire nécessaire et le coût des recherches de similarité. Le modèle de 8 milliards de paramètres demande également davantage de ressources d’inférence que des encodeurs plus compacts. La limite de 1 536 tokens impose de segmenter les documents juridiques longs. Usages pertinents : moteurs de recherche juridique, RAG spécialisé, détection de documents proches et clustering de corpus multilingues à dominante juridique.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).