Linq-AI-Research/Linq-Embed-Mistral

Linq-AI-Research/Linq-Embed-Mistral est un modèle d’embedding dense de 7 milliards de paramètres, publié par Linq-AI-Research le 29 mai 2024. Issu d’E5-mistral-7b-instruct et de Mistral-7B-v0.1, il produit des vecteurs de 4 096 dimensions et couvre plusieurs langues.

Linq-AI-Research/Linq-Embed-Mistral est un modèle d’embedding dense de 7 milliards de paramètres, publié par Linq-AI-Research le 29 mai 2024. Issu d’E5-mistral-7b-instruct et de Mistral-7B-v0.1, il produit des vecteurs de 4 096 dimensions et couvre plusieurs langues.

Il sert à indexer des textes pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Sa licence CC-BY-NC 4.0 autorise une exploitation ouverte sous attribution, mais exclut les usages commerciaux. Son ancienneté d’environ deux ans le rattache à une génération déjà ancienne à l’échelle de l’IA.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurLinq-AI-Research
Poids🟢 Poids ouverts
LicenceCC-BY-NC 4.0
Date de sortie29 mai 2024
Dimension du vecteur4 096
Représentationdense
Paramètres7 milliards
Paramètres actifs7 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR60,2 %10ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval45,8 %49ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal47,4 %50ᵉ / 208mteb✅ Mesuré
MTEB: Medical63,9 %10ᵉ / 158mteb✅ Mesuré
MTEB: Legal55,4 %26ᵉ / 157mteb✅ Mesuré
MTEB: European63,3 %7ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French57,6 %17ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German41,8 %80ᵉ / 209mteb✅ Mesuré
MTEB: French68,0 %8ᵉ / 117mteb✅ Mesuré
MTEB: Dutch63,1 %10ᵉ / 113mteb✅ Mesuré
MTEB: Indic61,9 %22ᵉ / 119mteb✅ Mesuré
MTEB: Instruction Following0,9 %36ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Linq-Embed-Mistral figure parmi les dix premiers sur les tracks MTEB French, European et Dutch, ce qui souligne son intérêt pour les corpus multilingues européens. Il se classe également dans le top 10 de MTEB Medical et de BEIR, deux résultats favorables à la recherche d’information médicale et au retrieval zero-shot sur des domaines hétérogènes. Son entraînement combine des triplets requête, exemple positif et exemple négatif provenant de jeux existants et de données synthétiques générées par LLM. Les requêtes peuvent intégrer une instruction décrivant la tâche, tandis que les documents indexés n’en nécessitent pas.

Limites et points d'attention. Le track MTEB Indic est moins favorable que ses meilleurs résultats européens et de retrieval, ce qui invite à davantage de prudence pour les langues indiciennes. Les vecteurs denses de 4 096 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Les 7 milliards de paramètres impliquent aussi un modèle conséquent à déployer. La licence CC-BY-NC 4.0 restreint l’exploitation commerciale, et son ancienneté le place face à des modèles plus récents. Usages pertinents : recherche sémantique multilingue, RAG, retrieval médical, similarité et clustering hors contexte commercial.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).