Haon-Chen/speed-embedding-7b-instruct
Publié par Haon-Chen le 31 octobre 2024 sous licence ouverte MIT, Haon-Chen/speed-embedding-7b-instruct est un modèle dense de 7 milliards de paramètres et 32 couches. Il produit des vecteurs de 4 096 dimensions par pooling sur le dernier token, avec normalisation L2 dans l’exemple…
Publié par Haon-Chen le 31 octobre 2024 sous licence ouverte MIT, Haon-Chen/speed-embedding-7b-instruct est un modèle dense de 7 milliards de paramètres et 32 couches. Il produit des vecteurs de 4 096 dimensions par pooling sur le dernier token, avec normalisation L2 dans l’exemple d’utilisation.
Évalué notamment sur des contenus indic, allemands, médicaux et juridiques, ce modèle sert à la recherche sémantique, au classement de passages, au RAG, à la similarité et au clustering. Chaque requête reçoit une instruction décrivant la tâche, contrairement aux documents. Les entrées supérieures à 4 096 tokens sont déconseillées.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Haon-Chen |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 31 octobre 2024 |
| Représentation | dense |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 33,6 % | 110ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 34,7 % | 99ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 47,0 % | 48ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 43,0 % | 60ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 4,7 % | 179ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 33,2 % | 91ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 47,5 % | 45ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Indic
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent les langues indiques, puis la recherche d’informations médicales et juridiques. Le modèle présente ainsi un intérêt pour l’indexation multilingue et les corpus spécialisés, notamment cliniques, biomédicaux, juridiques et réglementaires. Son encodage guidé par une instruction permet de préciser la tâche côté requête, tandis que les documents restent encodés sans consigne. La licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration dans des systèmes de recherche ou de RAG.
Limites et points d'attention. Les évaluations RTEB Legal, RTEB German et Long-context Retrieval placent le modèle dans la seconde moitié des classements, avec une faiblesse particulièrement marquée sur la récupération en contexte long. La recommandation de ne pas dépasser 4 096 tokens limite le traitement direct de documents volumineux et peut imposer leur découpage. Les vecteurs de 4 096 dimensions alourdissent également les index et rendent la recherche plus coûteuse que des représentations plus compactes. Avec près de deux ans d’ancienneté, durée très longue à l’échelle de l’IA, le modèle est probablement dépassé par des références plus récentes de sa catégorie. Usages pertinents : recherche sémantique multilingue, RAG sur passages courts ou segmentés, similarité et clustering de corpus médicaux ou juridiques.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).