Linq-AI-Research/Linq-Embed-Mistral
Linq-AI-Research/Linq-Embed-Mistral est un modèle d’embedding dense de 7 milliards de paramètres, publié par Linq-AI-Research le 29 mai 2024. Issu d’E5-mistral-7b-instruct et de Mistral-7B-v0.1, il produit des vecteurs de 4 096 dimensions et couvre plusieurs langues.
Linq-AI-Research/Linq-Embed-Mistral est un modèle d’embedding dense de 7 milliards de paramètres, publié par Linq-AI-Research le 29 mai 2024. Issu d’E5-mistral-7b-instruct et de Mistral-7B-v0.1, il produit des vecteurs de 4 096 dimensions et couvre plusieurs langues.
Il sert à indexer des textes pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Sa licence CC-BY-NC 4.0 autorise une exploitation ouverte sous attribution, mais exclut les usages commerciaux. Son ancienneté d’environ deux ans le rattache à une génération déjà ancienne à l’échelle de l’IA.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Linq-AI-Research |
| Poids | 🟢 Poids ouverts |
| Licence | CC-BY-NC 4.0 |
| Date de sortie | 29 mai 2024 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 60,2 % | 10ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 45,8 % | 49ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 47,4 % | 50ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 63,9 % | 10ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 55,4 % | 26ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 63,3 % | 7ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 57,6 % | 17ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 41,8 % | 80ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 68,0 % | 8ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Dutch | 63,1 % | 10ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Indic | 61,9 % | 22ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 0,9 % | 36ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Linq-Embed-Mistral figure parmi les dix premiers sur les tracks MTEB French, European et Dutch, ce qui souligne son intérêt pour les corpus multilingues européens. Il se classe également dans le top 10 de MTEB Medical et de BEIR, deux résultats favorables à la recherche d’information médicale et au retrieval zero-shot sur des domaines hétérogènes. Son entraînement combine des triplets requête, exemple positif et exemple négatif provenant de jeux existants et de données synthétiques générées par LLM. Les requêtes peuvent intégrer une instruction décrivant la tâche, tandis que les documents indexés n’en nécessitent pas.
Limites et points d'attention. Le track MTEB Indic est moins favorable que ses meilleurs résultats européens et de retrieval, ce qui invite à davantage de prudence pour les langues indiciennes. Les vecteurs denses de 4 096 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Les 7 milliards de paramètres impliquent aussi un modèle conséquent à déployer. La licence CC-BY-NC 4.0 restreint l’exploitation commerciale, et son ancienneté le place face à des modèles plus récents. Usages pertinents : recherche sémantique multilingue, RAG, retrieval médical, similarité et clustering hors contexte commercial.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).